当前位置: 首页 > news >正文

Agent 的能力不靠模型靠「装备」:NUS JIT-Agent 即时生成操作框架,最高涨 20.2 分还反超 GPT-5.6

Agent 的能力不靠模型靠「装备」:NUS JIT-Agent 即时生成操作框架,最高涨 20.2 分还反超 GPT-5.6

Hugging Face 每日论文(2026-08-27 精选)

同一个大模型,换一套「怎么用它的操作框架」,成绩能差出 20 分。新加坡国立大学 LV-NUS 实验室 8 月 27 日挂在 arXiv 上的 JIT-Agent(arxiv:2608.25593),把这句话做成了可复现的实验:模型权重一字不改,只把 Agent 的「记忆怎么管、计划怎么排、动作怎么做、工具怎么调」这套外挂配置从人工手写换成模型即时生成,几个主流开源模型在 DeepSearchQA、OdysseyBench、AgentIF 等四个 Agent 基准上的成绩集体上涨,最高涨 20.2 分,其中一款模型在 DeepSearchQA 上以 +9.1 分反超 GPT-5.6。8 月 27 日这篇论文登上 Hugging Face 每日论文榜,拿到 47 个 upvote。

这件事对正在做 Agent 产品的研究者意味着:当大家都在堆参数、换更大的模型时,JIT-Agent 给出的是一条完全不同的涨分路径。它证明「Agent 的智能不只在模型权重里,也在模型外面那层会随任务变化的外挂装备里」,而这层装备第一次可以被另一个模型即时生成、即时修复、即时进化。

为什么「怎么用模型」和「用哪个模型」一样重要

过去两年训练 Agent 的默认思路是:把推理和行动能力塞进模型权重,模型越大越强,Agent 就越强。这个思路对了一半。JIT-Agent 论文给出的判断是:Agent 的最终能力由两个因素共同决定,一个是产生推理与动作的基础模型,另一个是把模型放到闭环执行环境里的那层 harness。harness 决定保留哪些历史、形成什么意图、暴露哪些工具、动作怎么执行、什么时候触发验证与恢复。

「一个强模型放进错误的记忆、规划、动作协议里也会翻车」这句话听起来像常识,但过去很少有工作把它当成一个可训练的对象来对待。JIT-Agent 的核心主张是把 harness 从「工程实现细节」提升为「和模型权重同等重要的一等公民」。它甚至更进一步,提出一个问题:如果 harness 这么重要,为什么不让一个模型专门负责即时生成 harness?

论文里给出一个直观比喻:模型是引擎,harness 是变速箱和方向盘。同一台引擎,配错挡位和方向盘的用法,跑出的成绩天差地别;配对了,发动机的动力才能真正发挥出来。

提前编译 vs 即时生成:AOT 与 JIT 的分野

harness 优化并不是全新方向,最近一年已有不少工作在做 test-time harness 优化:从轨迹和反馈里优化 harness 代码、prompt、工具、记忆、技能或控制策略。但 JIT-Agent 论文指出,这些工作大多共享一个「提前编译」(AOT, Ahead-of-Time)假设:把 harness 当成一个要长期优化的产物,希望优化出来的结果能泛化到未来的任务、领域或模型版本。

AOT 思路在部署分布稳定、同质时很有效,但它要求优化循环在见到每个具体问题之前,就先预编译出一套足够通用的 harness。问题在于:不同任务需要完全不同的 harness 先验。广搜类任务适合并行证据探索;终端类任务适合精简的串行 ReAct 循环;深研类任务需要承载检索证据的工作记忆;从自然语言到代码仓库的任务天然适合以文件系统为中介。合适的 harness 不仅随领域变化,甚至随实例变化。

JIT-Agent 给出另一种答案:模型即 harness(Model-as-a-Harness)。用一个经过训练的元模型(meta-agent),在见到具体任务的当下,当场合成一套任务专属 harness,然后任意一个现成的 Agent 模型在这个 harness 下执行。harness 不再是一个「提前编好的通用产物」,而是一个「见到题就现场写」的即时产物。

对比维度AOT 提前编译 harnessJIT 即时生成 harness
何时构造见到任务前预先优化见到任务当场生成
泛化方式靠产物泛化到未来任务靠生成器即时适配当前任务
对任务分布变化的适应弱(部署分布变则失效)强(每任务独立生成)
核心成本大规模搜索 + 海量轨迹积累训练一个紧凑的 harness 生成器
代表系统多种 test-time harness 优化方法JIT-Agent

四模块协议:把 harness 变成机器可生成的产物

要让模型能即时生成 harness,第一步是把 harness 形式化成机器可生成、可组合的产物。JIT-Agent 论文给出的做法是固定一套四模块协议:

第一,记忆模块。决定 Agent 保留哪些历史、遗忘哪些信息、如何组织长期与短期记忆。
第二,规划模块。决定 Agent 如何拆解任务、如何组织子目标、如何调度执行顺序。
第三,动作模块。决定 Agent 以什么协议与环境交互,是串行 ReAct 循环、并行探索还是别的执行范式。
第四,能力模块。决定 Agent 暴露哪些工具与技能、如何调用、如何做工具链编排。

四个模块不是孤立的,它们被组织成一个可执行、可状态化的协议。JIT-Agent 在推理时接收任务描述、协议定义、可执行工具注册表,以及一小段从历史 harness 库检索到的先例上下文,然后输出一个针对当前任务定制的可执行 harness。生成的 harness 再去包裹一个现成的 Agent 模型执行。

这里的关键动作是「实例化」而不是「组合」。JIT-Agent 不是把几个固定模块简单拼起来,而是根据任务结构实例化出不同的执行协议与状态组织。深研任务的 harness 与代码生成任务的 harness,走的是两套不同的记忆组织、规划节奏与动作协议,但它们都遵守同一个四模块协议。

三种 harness 智能:自适应、可靠、可进化

把 harness 生成当作训练目标,论文提炼出三组核心要求,它们一起定义了「harness 智能」:

第一,自适应性(Adaptivity)。生成的 harness 要匹配当前任务与底层模型。同一个任务换一个模型,最优 harness 可能完全不同,生成器要能跟着变。
第二,可靠性(Reliability)。生成的 harness 必须可执行、行为稳定;合成失败时还要能恢复,不能生成一套跑不起来的配置。
第三,可进化性(Evolvability)。执行过程中积累的反馈与轨迹要能被转译成更强的未来 harness,让整个系统越用越强。

围绕这三组要求,JIT-Agent 走的是一个三阶段训练配方。第一个阶段面向自适应,在协议诱导出的 harness 空间里训练生成器学会按任务合成合适配置;第二个阶段面向可靠性,训练生成器在合成失败时识别并修复,保证可执行;第三个阶段面向可进化性,让生成器从不断扩充的历史 harness 配置库里蒸馏性能信号,实现自我进化。训练完成后,生成器本身是固定的,但它在推理时生成的 harness 会随任务与反馈不断演化。

智能维度要解决的核心问题训练阶段运行时表现
自适应生成的 harness 匹配任务与模型阶段一:任务适配合成每任务现场生成专属配置
可靠保证可执行并能在失败时恢复阶段二:失败识别与修复合成失败自动修复重试
可进化把执行反馈变成更强的未来 harness阶段三:历史配置蒸馏越用越强,harness 库持续扩充

权重不动、分数涨 20 分:四个基准的实验结果

JIT-Agent 的实验横跨 DeepSearchQA、OdysseyBench、AgentIF 与工作区类任务四个代表性 Agent 基准,覆盖深度研究、日常任务、规划、工作区四类场景。论文给出的核心结果分三块:

第一块,用 JIT-Agent 当 harness 助手后,一款开源模型在 DeepSearchQA 上拿到 +9.1 分、在 OdysseyBench 上拿到 +4.3 分,反超 GPT-5.6。这是「不换模型、只换操作框架」就能打败更大模型的直接证据。

第二块,另一款本身已经很强的开源模型,在 JIT-Agent 生成的 harness 帮助下最高涨 +20.2 分。说明「强者配好装备」的增益比「弱者配好装备」更夸张,基础模型越强,正确 harness 释放的潜力越大。

第三块,在受控对比评测里,JIT-Agent 生成的 harness 与成熟 Agent 运行时 OpenCode、Claude Code 的默认配置性能相当,同时能一致改进多个规模的模型家族。也就是说,它不是只在某个特定模型上有效,而是对多代际、多规模的开源模型都稳定涨分。

评测对象基准结果
开源模型 A + JIT-AgentDeepSearchQA+9.1 分,反超 GPT-5.6
开源模型 A + JIT-AgentOdysseyBench+4.3 分,反超 GPT-5.6
开源模型 B + JIT-Agent最强基线的对应基准最高 +20.2 分
JIT-Agent 生成的 harness受控对比与 OpenCode、Claude Code 性能相当
多规模开源模型家族四个基准一致改进

第三块数据里还有一个常被忽略的工程含义:JIT-Agent 是「紧凑」模型,作为 harness 生成器的成本远低于再训练或再买一个更大的主模型。把「模型变大」这条路的边际成本,换成了「装备即时生成」这条路的低边际成本。这正好对上了论文反复强调的一句话:harness 智能是独立于模型规模、可训练、可迁移、可叠加的能力维度。

为什么「即时生成」在工程上成立

「当场生成 harness」听起来像多绕了一层,工程上真的划得来吗?论文给出的逻辑有三层:

第一层,harness 是实例相关的。不同任务需要不同 harness,这个事实让「提前编译一个通用 harness」这件事天然低效。与其在巨大的设计空间里搜索一个能覆盖所有任务的产物,不如训练一个紧凑生成器,在每个任务到来时只生成针对它的配置。后者省掉的搜索成本,远大于生成器本身的推理成本。

第二层,harness 是低频更换的。一个任务跑起来之后,harness 可以稳定用很久,中途只需按反馈做小修。所以「即时生成」的成本是一次性的,而收益是整次任务全程的。

第三层,harness 库是可累积的。每跑完一个任务,生成的 harness 与它的执行反馈会回到历史库里,成为下一次生成的先例上下文。这是一个复利结构:跑得越多,生成器能参考的好配置越多,后续任务涨分越快。

这三层加在一起,回答了「为什么不是预先优化而是即时生成」这个根本问题。它不是工程上的倒退,而是把 harness 设计从「一次性人工工程」改造成了「持续自我进化的生成式基础设施」。

留给 Agent 研究者与工程团队的三件事

第一件:把 harness 当成和模型权重并列的一等公民来优化。JIT-Agent 用 +20.2 分和反超 GPT-5.6 的结果证明,模型外那层操作框架的增益,一点不比换更大的模型小。预算有限时,先看看是否还能在 harness 层挤出分数。

第二件:放弃「一套 harness 打天下」的假设。任务实例相关的本质意味着,最合适的状态是每个任务类甚至每个任务实例都有自己的配置。与其维护一整套过度工程化的通用框架,不如把精力花在训练一个能按需实例化的生成器上。

第三件:让 harness 配置沉淀成复利资产。执行反馈、任务轨迹、修复记录,这些都应被持续回收进历史配置库,成为下一次生成的先例。harness 智能不是一次性买断的能力,而是会随使用次数不断叠强的能力。

JIT-Agent 给出的不只是一个新模型,而是把「Agent 为什么强」这个问题的答案从「模型权重」扩展到「模型 + 装备」两个维度。对 2026 年的 Agent 研究者来说,这可能比再堆一个 10 倍参数的模型更值得关注。

http://www.cnnetsun.cn/news/4293396.html

相关文章:

  • 魔镜占卜 H5 小游戏:AI 占卜 + 周易,支持多平台运行
  • Matlab地图可视化实战:用scatter与plot实现数据空间分布与关联分析
  • Ganzlab‑Glink 深度解析:国产化 MBD 图形化建模环境入门与实战
  • 配电变压器检测数据集构建与YOLO模型训练全流程实战
  • 【效率封神·续】快捷管家:把 AHK 菜单做成可扩展的「私人指挥部」
  • MySQL 中的事务隔离级别有哪些?默认的事务隔离级别是什么?为什么选择这个级别?
  • 从失忆到第二大脑:AI Agent 记忆系统的三次范式跃迁
  • 蓝桥杯嵌入式国赛ADC按键设计:从电路原理到软件滤波实战
  • HDMI数据的接收发送实验(二十五)
  • 林伽一 · AI科技日报 | 2026年08月28日
  • C++函数模板:从重复代码到泛型编程的核心利器
  • 常州市本地维修壁挂炉师傅|上门维修壁挂炉电话|故障码不点火维修|本地口碑维修推荐
  • 模拟退火算法:从冶金原理到数学建模实战优化
  • 发布日之后如何持续被发现:从社区机制到创始人长期运营策略
  • 受控英语:让大模型与多Agent协作更稳定可解析
  • Partmode开源CAD:浏览器里的SolidWorks替代方案体验与部署评估
  • AI走进实验室:从数据分析到自动化实验的科研新范式
  • MATLAB优化工具箱实战:从标准规划问题到求解器深度解析
  • 颠簸路段百遍循环测试方案:车辆耐久与感知鲁棒性验证
  • 社区论坛整站源码部署与二次开发实战指南
  • 字节成立AI数据部门,数据工程成模型能力新天花板
  • MATLAB线性规划建模与求解实战:从数学建模到工程优化
  • 基于MATLAB的航天器软着陆轨道优化与闭环控制仿真实践
  • Java SpringBoot选课系统:高并发与事务一致性实战指南
  • Python游戏开发入门:用Pygame实现《外星人入侵》项目
  • 仿网易云音乐静态页:纯CSS实现高分前端教学范本
  • T-DFNN:基于增量学习的入侵检测系统如何克服灾难性遗忘
  • 图论最短路径算法实战:从Dijkstra到Floyd,数学建模竞赛核心应用解析
  • YOLOv11工业视觉实战:从数据标注到模型部署的针织品瑕疵检测全流程
  • 华为MetaERP # Oracle EBS R12 AP:业务对象 (BO) 与逻辑实体 (LE)【聚合关系】深度解析## 前置概念界定(UML 标准 + EBS 落地口径,区分组合 / 聚合