【实测】GPT-6代号“土豆“还剩6天!48小时5款大模型扎堆,程序员到底该用哪个
摘要
4月头一周AI圈的信息密度有点离谱。OpenAI的GPT-6内部代号"Spud(土豆)"被扒了个底朝天,定档4月14号发布,性能比GPT-5.4涨了40%,上下文200万Token,三个产品并成一个入口。差不多同一时间,阿里、谷歌、微软和Cursor在48小时里前后脚甩了5款产品。这篇结合我自己写了10年代码的体感,把每个产品拆开聊聊,顺便说说不同场景下我会怎么选。
目录
- 摘要
- 前言
- 一、GPT-6这颗"土豆"到底什么来头
- 1.1 消息怎么出来的
- 1.2 参数对比
- 1.3 三个产品并成一个
- 1.4 几个有意思的信号
- 二、阿里 Qwen3.6-Plus:国产编程能力到目前为止最好的
- 2.1 发布背景
- 2.2 跑分
- 2.3 我自己用的体感
- 三、谷歌 Gemma 4:开源圈的新选择
- 3.1 出了几个版本
- 3.2 几个我觉得值得记的点
- 四、微软MAI系列 + Cursor 3:容易被忽略但不该忽略的
- 4.1 微软的三个自研模型
- 4.2 Cursor 3:写代码这件事的方式变了
- 五、我的判断和选型思路
- 5.1 这一周说明了啥
- 5.2 不同情况怎么选
- 六、参考资料
前言
4月7号我花了差不多一整天在刷各种技术资讯。从GPT-6泄漏的参数到千问3.6的评测帖子,信息量大到有种"看不完就别看了"的冲动。最后我把东西过了一遍,最大的感受就一句话:2026年模型之间的较量,已经不是比谁参数大了,而是比谁让写代码的人过得更舒服。
这篇文章就是把这一周里我觉得最值得说的几件事整理清楚。如果你正纠结选哪个模型,往下翻到第五节有个场景化的选型表。
一、GPT-6这颗"土豆"到底什么来头
1.1 消息怎么出来的
4月5号,X平台上一个叫@iruletheworldmo的博主开始连发GPT-6的内部信息,圈里管他叫"草莓哥"。量子位、36氪、华尔街见闻跟着转了一波。OpenAI管这个模型叫"Spud"——就是土豆——内部把它当成够到AGI的最后一把钥匙。
1.2 参数对比
| 指标 | GPT-5.4 | GPT-6 (泄露数据) | 变化 |
|---|---|---|---|
| 综合性能 | 基准线 | +40% | 🔥 |
| 上下文窗口 | 100万Token | 200万Token | 翻了一倍 |
| 多模态 | 后期接进来的 | 一个架构原生搞定 | 本质区别 |
| 输入单价 | $2/MTok | $2.5/MTok | 贵了25% |
| 输出单价 | $10/MTok | $12/MTok | 贵了20% |
1.3 三个产品并成一个
GPT-6最大的变化不在模型本身。它把ChatGPT(聊天)、Codex(编程)、Atlas(浏览器Agent)塞进了同一个壳子里。以后你跟AI说话的时候,它能同时帮你查东西、写代码、操作网页,不用手动来回切了。
原来怎么干: 你 → 打开ChatGPT聊 → 开Codex写码 → 开浏览器查资料 → 来回切窗口 现在的设想: 你 → 一个统一的Agent(聊+写+浏览+看图) ↓ 200万Token上下文,对话全程不会忘1.4 几个有意思的信号
有两件事我觉得比模型参数本身更值得琢磨。
第一件,去年12月起OpenAI内部一直处于"编程红色警报"。原因很直接:Anthropic的Claude在编码场景全面超了他们。GPT-6的Agent编程能力是被重点砸资源的方向。
第二件,产品部门改名了,叫"AGI部署部"。不是研发部、不是产品部——“部署部”。两个字,但意思差很多:说明他们认为东西已经造好了,现在是往外放的阶段。
预训练3月17号就跑完了,后训练和安全校验也收尾了。14号不是"可能发",是"等着发"。
二、阿里 Qwen3.6-Plus:国产编程能力到目前为止最好的
2.1 发布背景
4月2号阿里发了千问3.6系列的第一个模型Qwen3.6-Plus。官方直接打出"中国编程能力最强"的旗号,不过发布方式倒是很低调——没搞发布会,就在OpenRouter和百炼上悄悄上了线。
2.2 跑分
| 评测 | Qwen3.6-Plus | GLM-5 | Kimi K2.5 | 测的是啥 |
|---|---|---|---|---|
| SWE-bench | 国产第一 | 落后 | 落后 | 代码修复 |
| Claw-Eval | 赢了 | - | 落后 | 真实Agent任务 |
| Terminal-Bench | 领先 | - | - | 终端操作 |
2.3 我自己用的体感
拿千问3.6写了几个Go项目的代码,说下直观感受。
// 场景:让它生成并发安全的LRU Cache// 结果:一轮就给了能跑的代码,包含sync.RWMutex和双向链表// 以前3.5版本同样的事,得来回改两三次typeLRUCachestruct{capacityintmu sync.RWMutex cachemap[string]*list.Element ll*list.List}func(c*LRUCache)Get(keystring)(interface{},bool){c.mu.RLock()deferc.mu.RUnlock()ifelem,ok:=c.cache[key];ok{c.ll.MoveToFront(elem)returnelem.Value.(*entry).value,true}returnnil,false}百炼API一百万Token收2块钱。国产模型里这个价格基本没有对手了,偏偏编程能力还排第一。性价比确实没话说。
三、谷歌 Gemma 4:开源圈的新选择
3.1 出了几个版本
| 版本 | 参数 | 架构类型 | 特点 | 适合跑在哪 |
|---|---|---|---|---|
| 31B Dense | 310亿 | 稠密 | 开源全球前三 | 服务器 |
| 26B A4B MoE | 260亿(实际激活38亿) | MoE | 干掉过千亿级对手 | 高效推理 |
| E4B | 40亿 | 轻量 | 笔记本跑得动 | 边缘设备 |
| E2B | 20亿 | 超轻 | 只有1.5GB | 手机 |
3.2 几个我觉得值得记的点
Apache 2.0协议,商用没有任何限制。对比Meta家LLaMA的那套协议,这个确实友好不少。
数学基准跑了89.2%。代码ELO 2150——这是编程竞赛水平的分数了。
但最让我惊讶的是E2B版本。1.5个G的模型在手机上做多模态推理,搁2024年这还是论文里的设想。
# Gemma 4 E2B 在手机端部署的大概写法importmediapipeasmp# 1.5GB的模型文件model=mp.tasks.genai.LlmInference.create_from_model_path(model_path="gemma-4-e2b-it.task")# 手机端跑推理response=model.generate_response("分析这张架构图中的性能瓶颈")四、微软MAI系列 + Cursor 3:容易被忽略但不该忽略的
4.1 微软的三个自研模型
| 模型 | 干什么的 | 对比谁 |
|---|---|---|
| MAI-Transcribe-1 | 语音转文字 | 效果超了Whisper |
| MAI-Voice-1 | 声音克隆 | 高保真 |
| MAI-Image-2 | 文生图 | 已上Foundry平台 |
微软以前给人的印像是"投钱给OpenAI、集成GPT就完了"。但这三个自研模型说明他们在走另一条路——不做通用大模型,在垂直场景上各个击破。
4.2 Cursor 3:写代码这件事的方式变了
4月2号发布的,代号"Glass"。
以前用Cursor: 你写代码 → AI帮你补几行、改一下 现在的Cursor 3: 你说要啥 → Agent Window开十几个Agent → 分头写不同模块 你的角色:从码农变成Agent管理员有个数据我反复看了几遍确认没看错:Agent的使用量已经比Tab自动补全还高了。意思是用Cursor的人更多地在让AI主导写整段代码,而不只是让它帮忙补行尾。Anysphere(Cursor母公司)估值到了293亿美元,Fortune 500里有一半多在用。
五、我的判断和选型思路
5.1 这一周说明了啥
写代码这个赛道挤满了人。OpenAI搞"编程红色警报",千问硬打"编程最强",Cursor把IDE改造成Agent指挥台。各家都在争同一批用户。
端侧跑模型不是PPT了。Gemma 4那个1.5GB的E2B版本是真能下载真能跑的。MoE架构的普及也在帮忙,让小设备能带得动更大的模型。
Agent从展示品变成了生产工具。Cursor拿调用量数据证明了——开发者是真的在让Agent写产代码,不是拿来玩的。
5.2 不同情况怎么选
后端开发(Go/Java/Python): 平时干活:Qwen3.6-Plus,2块钱一百万Token,够用 碰到硬骨头:等GPT-6,14号出来再评估 IDE选择:建议升Cursor 3,Agent模式真的省时间 自己做项目或者小团队: 首推:Qwen3.6-Plus + Cursor 3,一个便宜一个高效 想在自己机器上跑:Gemma 4 E4B,笔记本带得动 需要语音功能:试试微软MAI-Transcribe-1 做开源或搞研究的: 首选Gemma 4,Apache 2.0拿来就能用 也可以关注千问,他们的东西也在陆续开源六、参考资料
- GPT-6曝光了 - 量子位
- 48小时连发5款大模型 - 腾讯云开发者
- 阿里发布Qwen3.6-Plus - 界面新闻
- Gemma 4开源全解读 - 36氪
- Cursor 3发布 - 智东西
- Cursor 3评测 - 搜狐科技
📢 你用上面这些新模型了没?GPT-6的三合一你觉得靠不靠谱?评论区聊。
看完觉得有用就点个赞 👍 收藏 ⭐,后面还会继续写。
