当前位置: 首页 > news >正文

Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?

标签:AI、大模型、开源模型、自改进、强化学习

Ornith-1.5 号称自改进:但它真的不是「自己给自己出题自己给自己打满分」?

8 月 19 日,DeepReinforce 团队放出 Ornith-1.5。
三个数字让人头皮发麻:9B 模型在 SWE-Bench Verified 拿到 70.6,接近 Qwen3.6-35B 的 73.4;GPQA Diamond 86.4,匹敌 Claude Opus 4.8;DeepSWE 从上一版的 8.0 跳到 56.0,涨了 48 分。
但——所有这些数字,都是它自己评的。

这篇文章不急着下结论,先把它到底在干嘛讲清楚,把为什么有人觉得它在自欺欺人摆到桌面上。
数据对比和实机体验,留给后面两篇。


一、先看三个数字,再决定要不要读下去

Ornith-1.5 是 DeepReinforce(前身为 DeepReinforce.ai,核心研究者来自斯坦福 NLP 组)刚放出来的开源模型系列,三个尺寸:397B MoE、35B MoE、9B Dense。9B 那版,6.6GB 就能跑。

先看一组让人困惑的对比:

BenchmarkOrnith-1.5-9BQwen3.6-35B-A3BGemma-4-31B
Terminal-Bench 2.147.049.2-
SWE-Bench Verified70.673.452.0
SWE-Bench Pro47.549.535.7
GPQA Diamond86.486.084.3
ClawEval66.568.748.5
BrowseComp56.462.0-

9B 的模型,在编码、推理、信息检索上大面积匹敌甚至超过 30B+ 的模型。这不是"小步优化",是量级差

再看旗舰版 397B 的成绩:Terminal-Bench 2.1 拿到 86.1,DeepSWE 拿到 56.0,官方说这跟 Claude Opus 4.8(85.0 / 59.0)在一个水平线上。

一个 9B 的模型打出这个成绩,要么是它真的很强,要么是……它给自己出题的时候出了点偏题。

这就是本文要追问的核心问题。


二、Ornith-1.5 到底做了什么:一句话讲清

它把"训练任务策划"这件事,从人类手里拿走了,交给了模型自己。

Ornith-1.0(2026 年 6 月)做到了自脚手架(self-scaffolding):模型能自己搭建执行框架——工具调用、任务分解、重试策略。但训练任务本身,还是人编的。

Ornith-1.5 往前走了一步。它的训练循环是一个三段闭环:

第一阶段:自己出题。给定一个代码库或环境、任务类型的大方向、以及自己过去做过的题的历史,模型生成一道比它目前能力边界再难一点的新任务。目标成功率设为20%——即大部分时候它做不出来,但又有足够成功样本来训练。

第二阶段:自己搭脚手架。针对这道题,模型生成或优化一套专属执行框架:指令、工具、分解策略、编排逻辑。

第三阶段:自己解题。策略网络基于任务+脚手架生成解决方案,通过 GRPO(Group Relative Policy Optimization)强化学习,把奖励信号同时回传给三个阶段。

这套系统有三重防作弊奖励:有效性(题目可执行、可验证)、前沿难度(卡在能力边界附近)、新颖性(不能跟做过的题太像)。

听起来很美。但问题也来了——


三、那个绕不开的问题:它真的不是自欺欺人吗?

当一个系统既出题、又出题的评分标准、还自己答题——你怎么知道它不是在给自己开卷考试?

这不是刁难。自评分(self-scoring)是所有"自改进"系统共同面对的原罪。OpenAI 说 GPT-5.3-Codex "instrumental in creating itself",但所有人都清楚这句话意味着什么:模型参与了训练管线的某一步,不等于它真的在自我进化。

Ornith-1.5 的防御机制有三层:

  1. 三重 reward 信号——出题质量、脚手架质量、答案质量分别打分,互不相同,理论上可以互相制衡
  2. 20% 目标成功率——不让你只挑能做对的题
  3. Anti-hacking 过滤器——SWE-Bench 评测时会移除 Git 历史、断网、限制外部资源访问,防止模型"作弊"

但社区质疑的是更深层的东西:出题和打分的标准本身,仍然是模型自己定义和执行的。一个足够聪明的模型,理论上可以学会生成"它自己能答对、又通过了有效性检查"的题目——这不算完全作弊,但也不算真正的难度提升。

MIT Technology Review 恰好在 Ornith-1.5 发布前一天发表了一篇对 AI 递归自改进的质疑文章。核心发现是:在 NeurIPS 未发表论文上测试的 AI 代理,产出的工作"nowhere close to the mark"。Anthropic 联合创始人 Jack Clark 的评论更直接:"对短期递归自改进时间表持悲观信号(a bearish signal on short recursive self-improvement timelines)。"

Hacker News 上社区对 Ornith-1.0 的吐槽也直接搬过来了——"benchmaxxed versions of Qwen or Gemma 4"。这话不客气,但也不冤枉:9B 版本的 backbone 确实是 Qwen 3.5。


四、那 +48 分的 DeepSWE 怎么解释?

如果 Ornith-1.5 只是"调参调出来的 Qwen 3.5",那最大的疑点是——DeepSWE 从 8.0 跳到 56.0,这个幅度不合理。

DeepSWE 不是那种容易刷分的闭卷测试题。它是真实的软件工程任务,代码库、问题描述、补丁要求都是来自真实项目。要在这个评测上从 8 分到 56 分,靠 prompt tuning 或微调不可能做到。

两种可能性:

  1. 自改进确实起了作用。模型自己出题逼自己解决更难的问题,形成了真正的能力螺旋——这就是 Ornith AI 想证明的事。
  2. 训练管线的变化产生了系统性提升,不一定是"自改进"本身,但方向是对的。比如任务生成的多样性比人工策划更丰富,或者 GRPO 的联合优化比单目标训练更有效。

不管是哪种,训练方法确实变了,而不是把 Qwen 3.5 重新调了一遍包。


五、为什么我还是要关注它

理由有三个。

第一,性价比是真实的。9B、6.6GB、SWE-Bench Verified 70.6、GPQA 86.4——不管数字水分多大,能在消费级显卡和手机上跑出这个效果,本身就是里程碑。

第二,自出题训练的思路方向是对的。人类策划训练任务的瓶颈越来越明显:数据质量见顶、benchmark 越来越容易被刷、长尾任务没人写。如果模型能自己扩展训练课程,这条路再难也值得走。

第三,MIT 协议 + 开源权重 = 你可以自己验证。不像某些模型只能信官方数字,Ornith-1.5 的权重、评测脚本、模型卡全都在 HuggingFace 上。这意味着——

我可以自己跑一遍。这就是后面两篇要做的事。


六、后面两篇干什么

第二篇:纯数据对比。把 Ornith-1.5-9B 拉到一张表上,跟 Ornith-1.0-9B、Qwen3.5-9B、Gemma-4-31B、Qwen3.6-35B-A3B 逐条对比——编码、推理、检索、工具调用,哪些真的强、哪些其实被反超了。

第三篇:实机部署 + 亲身体验。在本地用 Ollama 跑起来,写代码、改 bug、用工具——看看 70.6 的 SWE-Bench 分数,在日常开发里到底兑不兑现。

三篇走完,"自改进是真的还是假的"这个问题,就有答案了。


七、一句话

Ornith-1.5 最牛的不是它的分数——是它让你无法简单地用"又一个刷分模型"打发它。+48 分的 DeepSWE 提升、9B 打出 35B 的编码分数、全开源 MIT 协议——哪怕它有自评分的硬伤,也比大多数"号称突破"的发布更值得认真看一眼。

但它是不是真的"自改进",我们后面见。


本文数据基于 Ornith AI 官方公告(ornith.ai/ornith_1_5.html)、HuggingFace 模型卡(ornith-ai/Ornith-1.5-9B)、Ollama 库、Byteiota 及 RuntimeWire 分析整理。Benchmark 数据均为官方自测,尚未经独立第三方复现。截稿于 2026-08-20。

这是 Ornith-1.5 系列第一篇。下一篇会做纯 Benchmark 横评,看看数字背后的真实差距。你觉得自改进这条路走得通吗?评论区聊聊。


附:核心信源

事项来源
Ornith-1.5 发布及技术细节ornith.ai/ornith_1_5.html
9B 完整 Benchmark 数据HuggingFace: ornith-ai/Ornith-1.5-9B
模型规格(架构/上下文/量化)HuggingFace model card、Ollama library
DeepSWE +48 分分析Byteiota 深度评测
社区质疑 / 技术背景RuntimeWire、Hacker News 讨论
递归自改进质疑MIT Technology Review(2026-08-18 发文)
Jack Clark 评论Byteiota 引用
MIT 许可证 / 开源协议HuggingFace、ornith.ai 官方文档
http://www.cnnetsun.cn/news/4169502.html

相关文章:

  • 学生党开学季显示器选购指南:泰坦军团26款型号深度解析
  • 大厂 MCP 面试实录:可复用模板工作流与向量检索结合方案设计
  • 卖货难、招商难、运营难:你的私域系统真的在解决问题吗?
  • 从 Scratch 到 NOI:一套能走通的科技特长生培养路径
  • 爬虫老手转大模型:数据能力凭什么从采集变成 RAG 的护城河
  • 数学建模期末高效复习:从知识地图到代码模板的实战指南
  • AI大模型人才争夺战:技能要求与求职指南
  • 小批量梯度下降(MBGD)原理、实现与调优:从数学建模到深度学习实战
  • C++可变参数模板深度解析:从习题到工程实践
  • LangChain.js与Nuxt.js:AI全栈开发实战与招聘风向解读
  • Rust专属招聘平台RustyBoard的技术架构与实现
  • FCL启动器全面指南:从零搭建与管理Minecraft模组环境
  • 聚宽、米筐、掘金、优矿与QMT参数迁移:类型、单位和默认值必须同存
  • GitHub大项目断点续传实战:从浅克隆到渐进式获取的完整方案
  • Kafka Producer事务与幂等性原理及生产实践
  • Windows 11虚拟机搭建指南:VMware Workstation安全测试环境配置
  • Windows账户锁定策略详解与实战解锁指南
  • Grok 4.6多模态大模型实测:中文语音、代码生成与本地部署指南
  • 从LLM API窃取推理轨迹:安全风险与模拟验证
  • Git指令速查表:从核心概念到实战场景的高效开发指南
  • 多尺度混合世界模型:让AI在动态环境中稳健学习与决策
  • Canal数据同步实战:自定义JSON格式优化与Kafka集成方案
  • dsh-tui:将AI编程助手无缝集成到终端工作流的实践指南
  • 信息论与决策树在算法竞赛小球称重问题中的应用与实现
  • 深入Eigen源码:揭秘C++高性能数值计算的模板元编程与表达式模板
  • 2026年8月移动硬盘选购指南:16款高性价比型号横向评测
  • TraceId日志追踪实战:从原理到Spring Boot落地
  • 层次分析法实战指南:从数学建模到多准则决策
  • GitHub项目目录结构设计:从入门到精通的工程实践指南
  • SpringBoot整合MinIO实战:对象存储接入与工具类封装