Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?
标签:AI、大模型、开源模型、自改进、强化学习
Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?
8 月 19 日,DeepReinforce 团队放出 Ornith-1.5。
三个数字让人头皮发麻:9B 模型在 SWE-Bench Verified 拿到 70.6,接近 Qwen3.6-35B 的 73.4;GPQA Diamond 86.4,匹敌 Claude Opus 4.8;DeepSWE 从上一版的 8.0 跳到 56.0,涨了 48 分。
但——所有这些数字,都是它自己评的。这篇文章不急着下结论,先把它到底在干嘛讲清楚,把为什么有人觉得它在自欺欺人摆到桌面上。
数据对比和实机体验,留给后面两篇。
一、先看三个数字,再决定要不要读下去
Ornith-1.5 是 DeepReinforce(前身为 DeepReinforce.ai,核心研究者来自斯坦福 NLP 组)刚放出来的开源模型系列,三个尺寸:397B MoE、35B MoE、9B Dense。9B 那版,6.6GB 就能跑。
先看一组让人困惑的对比:
| Benchmark | Ornith-1.5-9B | Qwen3.6-35B-A3B | Gemma-4-31B |
|---|---|---|---|
| Terminal-Bench 2.1 | 47.0 | 49.2 | - |
| SWE-Bench Verified | 70.6 | 73.4 | 52.0 |
| SWE-Bench Pro | 47.5 | 49.5 | 35.7 |
| GPQA Diamond | 86.4 | 86.0 | 84.3 |
| ClawEval | 66.5 | 68.7 | 48.5 |
| BrowseComp | 56.4 | 62.0 | - |
9B 的模型,在编码、推理、信息检索上大面积匹敌甚至超过 30B+ 的模型。这不是"小步优化",是量级差。
再看旗舰版 397B 的成绩:Terminal-Bench 2.1 拿到 86.1,DeepSWE 拿到 56.0,官方说这跟 Claude Opus 4.8(85.0 / 59.0)在一个水平线上。
一个 9B 的模型打出这个成绩,要么是它真的很强,要么是……它给自己出题的时候出了点偏题。
这就是本文要追问的核心问题。
二、Ornith-1.5 到底做了什么:一句话讲清
它把"训练任务策划"这件事,从人类手里拿走了,交给了模型自己。
Ornith-1.0(2026 年 6 月)做到了自脚手架(self-scaffolding):模型能自己搭建执行框架——工具调用、任务分解、重试策略。但训练任务本身,还是人编的。
Ornith-1.5 往前走了一步。它的训练循环是一个三段闭环:
第一阶段:自己出题。给定一个代码库或环境、任务类型的大方向、以及自己过去做过的题的历史,模型生成一道比它目前能力边界再难一点的新任务。目标成功率设为20%——即大部分时候它做不出来,但又有足够成功样本来训练。
第二阶段:自己搭脚手架。针对这道题,模型生成或优化一套专属执行框架:指令、工具、分解策略、编排逻辑。
第三阶段:自己解题。策略网络基于任务+脚手架生成解决方案,通过 GRPO(Group Relative Policy Optimization)强化学习,把奖励信号同时回传给三个阶段。
这套系统有三重防作弊奖励:有效性(题目可执行、可验证)、前沿难度(卡在能力边界附近)、新颖性(不能跟做过的题太像)。
听起来很美。但问题也来了——
三、那个绕不开的问题:它真的不是自欺欺人吗?
当一个系统既出题、又出题的评分标准、还自己答题——你怎么知道它不是在给自己开卷考试?
这不是刁难。自评分(self-scoring)是所有"自改进"系统共同面对的原罪。OpenAI 说 GPT-5.3-Codex "instrumental in creating itself",但所有人都清楚这句话意味着什么:模型参与了训练管线的某一步,不等于它真的在自我进化。
Ornith-1.5 的防御机制有三层:
- 三重 reward 信号——出题质量、脚手架质量、答案质量分别打分,互不相同,理论上可以互相制衡
- 20% 目标成功率——不让你只挑能做对的题
- Anti-hacking 过滤器——SWE-Bench 评测时会移除 Git 历史、断网、限制外部资源访问,防止模型"作弊"
但社区质疑的是更深层的东西:出题和打分的标准本身,仍然是模型自己定义和执行的。一个足够聪明的模型,理论上可以学会生成"它自己能答对、又通过了有效性检查"的题目——这不算完全作弊,但也不算真正的难度提升。
MIT Technology Review 恰好在 Ornith-1.5 发布前一天发表了一篇对 AI 递归自改进的质疑文章。核心发现是:在 NeurIPS 未发表论文上测试的 AI 代理,产出的工作"nowhere close to the mark"。Anthropic 联合创始人 Jack Clark 的评论更直接:"对短期递归自改进时间表持悲观信号(a bearish signal on short recursive self-improvement timelines)。"
Hacker News 上社区对 Ornith-1.0 的吐槽也直接搬过来了——"benchmaxxed versions of Qwen or Gemma 4"。这话不客气,但也不冤枉:9B 版本的 backbone 确实是 Qwen 3.5。
四、那 +48 分的 DeepSWE 怎么解释?
如果 Ornith-1.5 只是"调参调出来的 Qwen 3.5",那最大的疑点是——DeepSWE 从 8.0 跳到 56.0,这个幅度不合理。
DeepSWE 不是那种容易刷分的闭卷测试题。它是真实的软件工程任务,代码库、问题描述、补丁要求都是来自真实项目。要在这个评测上从 8 分到 56 分,靠 prompt tuning 或微调不可能做到。
两种可能性:
- 自改进确实起了作用。模型自己出题逼自己解决更难的问题,形成了真正的能力螺旋——这就是 Ornith AI 想证明的事。
- 训练管线的变化产生了系统性提升,不一定是"自改进"本身,但方向是对的。比如任务生成的多样性比人工策划更丰富,或者 GRPO 的联合优化比单目标训练更有效。
不管是哪种,训练方法确实变了,而不是把 Qwen 3.5 重新调了一遍包。
五、为什么我还是要关注它
理由有三个。
第一,性价比是真实的。9B、6.6GB、SWE-Bench Verified 70.6、GPQA 86.4——不管数字水分多大,能在消费级显卡和手机上跑出这个效果,本身就是里程碑。
第二,自出题训练的思路方向是对的。人类策划训练任务的瓶颈越来越明显:数据质量见顶、benchmark 越来越容易被刷、长尾任务没人写。如果模型能自己扩展训练课程,这条路再难也值得走。
第三,MIT 协议 + 开源权重 = 你可以自己验证。不像某些模型只能信官方数字,Ornith-1.5 的权重、评测脚本、模型卡全都在 HuggingFace 上。这意味着——
我可以自己跑一遍。这就是后面两篇要做的事。
六、后面两篇干什么
第二篇:纯数据对比。把 Ornith-1.5-9B 拉到一张表上,跟 Ornith-1.0-9B、Qwen3.5-9B、Gemma-4-31B、Qwen3.6-35B-A3B 逐条对比——编码、推理、检索、工具调用,哪些真的强、哪些其实被反超了。
第三篇:实机部署 + 亲身体验。在本地用 Ollama 跑起来,写代码、改 bug、用工具——看看 70.6 的 SWE-Bench 分数,在日常开发里到底兑不兑现。
三篇走完,"自改进是真的还是假的"这个问题,就有答案了。
七、一句话
Ornith-1.5 最牛的不是它的分数——是它让你无法简单地用"又一个刷分模型"打发它。+48 分的 DeepSWE 提升、9B 打出 35B 的编码分数、全开源 MIT 协议——哪怕它有自评分的硬伤,也比大多数"号称突破"的发布更值得认真看一眼。
但它是不是真的"自改进",我们后面见。
本文数据基于 Ornith AI 官方公告(ornith.ai/ornith_1_5.html)、HuggingFace 模型卡(ornith-ai/Ornith-1.5-9B)、Ollama 库、Byteiota 及 RuntimeWire 分析整理。Benchmark 数据均为官方自测,尚未经独立第三方复现。截稿于 2026-08-20。
这是 Ornith-1.5 系列第一篇。下一篇会做纯 Benchmark 横评,看看数字背后的真实差距。你觉得自改进这条路走得通吗?评论区聊聊。
附:核心信源
| 事项 | 来源 |
|---|---|
| Ornith-1.5 发布及技术细节 | ornith.ai/ornith_1_5.html |
| 9B 完整 Benchmark 数据 | HuggingFace: ornith-ai/Ornith-1.5-9B |
| 模型规格(架构/上下文/量化) | HuggingFace model card、Ollama library |
| DeepSWE +48 分分析 | Byteiota 深度评测 |
| 社区质疑 / 技术背景 | RuntimeWire、Hacker News 讨论 |
| 递归自改进质疑 | MIT Technology Review(2026-08-18 发文) |
| Jack Clark 评论 | Byteiota 引用 |
| MIT 许可证 / 开源协议 | HuggingFace、ornith.ai 官方文档 |
