当前位置: 首页 > news >正文

一眼看穿idea潜力!创智×复旦提出RL新范式,让大模型拥有科研品味

什么样的研究值得做?创智&复旦团队让 AI 学到了"科研品味"——不仅能判断研究的潜在影响力,还能构思更优的科研想法。

顶尖的科学家不但学识渊博,更具备一种优秀的的科研判断力和前瞻力,这与人们说的 “科研品味” 密切相关。

AI 能学习科研品味吗?

本研究将“科研品味”定义为判断和构思高影响力研究想法的能力,并将其转化成一个偏好建模与对齐问题,提出了 Reinforcement Learning from Community Feedback(RLCF,基于社区反馈的强化学习)新范式。

利用大规模科研社区的反馈信号,团队训练出 Scientific Judge 来判断科学研究的影响力,进而训练 Scientific Thinker 用于构思高影响力的科研思路。

实验表明,模型成功学到了科研品味并能有效泛化,这是迈向人类专家级 AI 科学家的关键一步。

〓 图1:(左图)研究训练的Scientific Judge(★)科研判断力超过闭源模型;(右图)Scientific Thinker科研想法构思力相比训前大幅提升。

论文标题:

AI Can Learn Scientific Taste

论文作者:

仝竞奇(博士生),李明哲,李航成等(导师:邱锡鹏)

论文链接:

https://arxiv.org/abs/2603.14473

项目网站:

https://tongjingqi.github.io/AI-Can-Learn-Scientific-Taste

代码仓库:

https://github.com/tongjingqi/AI-Can-Learn-Scientific-Taste

数据和模型:

https://huggingface.co/collections/OpenMOSS-Team/ai-can-learn-scientific-taste

科研品味:AI 科学家缺失的关键能力

“科研品味” 是一种主观任性的偏好吗?

并非如此。休谟指出,品味的标准源于“合格评判者的共同裁决”;康德也将品味视为一种共识性的判断力。

在科研领域,这种共同裁决体现为社区的长期互动,被广泛复用和延伸的工作,正是契合了社区集体判断,从而产生高影响力的工作。

因此,本研究将科研品味定义为:判断和构思高影响力研究想法的能力,有科研品味的 AI 同时具备强大的科研判断力与构思力。

如今的 AI 科学家已能查阅文献、写代码、跑实验,但缺少这种判断“什么值得做”并构思高影响力方向的能力。本研究的目标,就是让 AI 迈出这关键一步。

RLCF:从社区反馈中学习科研品味

〓 图2:RLCF 流程,先收集社区反馈(如引用数),随后训练奖励模型(Judge),最后训练策略模型(Thinker)。

研究团队提出 Reinforcement Learning from Community Feedback(RLCF,基于社区反馈的强化学习)范式。

科研构思没有标准答案,RLVR 无法适用;RLHF 也有局限:人工标注既昂贵,又难以反映社区级别的集体偏好。

RLCF 的核心洞察是:有影响力的工作会被广泛复用和延伸,形成大量科研社区的反馈信号,如最普遍的文章引用数。

基于此,RLCF 分为三步(图2):

第一步:收集社区反馈。获取海量论文及其引用数,在相同领域和发表时间内按引用高低构建偏好对。

第二步:训练偏好模型(Scientific Judge)。用 GRPO 训练,使其学会精准推理出两篇论文哪个影响力更大。

第三步:训练策略模型(Scientific Thinker)。同样用 GRPO 训练,给一篇论文让其提出后续的研究思路,用 Judge 作为生成式奖励模型,对一组想法进行两两比较,以组内胜率作为奖励。研究团队称其为 “基于比较的 GRPO”。

Scientific Judge:AI 可以学习科研判断力

Scientific Judge 的任务:输入两篇论文的标题和摘要,通过推理判断哪篇有更高的影响力(如高引用数)。

为了训练与评测,团队构建了大规模数据集 SciJudgeBench:包含 70 万对 arXiv 论文,每对论文在领域和发表年份上严格匹配,且具有显著引用数差异。

在 24 年及之前的数据上训练后,Scientific Judge 展现了强大且可泛化的科研判断力:

数据和模型的 Scaling Effect:模型表现与训练数据量近似呈对数线性关系(图3),且模型越大性能也越强,充分证明了科研判断力学习是可扩展的。

〓 图3:30B 和 4B 的 Scientific Judge 训练的 Scaling Effect

超越顶尖模型:基于 Qwen3-30B 训练的 Judge 超越 GPT-5.2、Gemini 3 Pro 等顶尖闭源模型(表1)。

〓 表1:域内评测结果

三方面的域外测试均展现良好泛化:

  • 穿越时间:对于晚于训练数据的 2025 年论文,判断准确率依然大幅提升(表2)。

〓 表2:时间域外评测结果,在晚于训练数据的论文上测试

  • 跨越领域:仅用 CS 领域论文训练,判断力有效迁移到数学、物理、生物等其它领域(表3)。

〓 表3:领域域外评测结果,只训练 CS 大类论文,在其它领域的论文上测试

  • 通用标准:用引用数训练的模型,判断 ICLR 论文评审分数高低同样准确(表4)。

〓 表4:指标域外(ICLR 分数比较)评测结果

总之,Scientific Judge 从科研社区反馈中学习到了一种超越具体领域、时间、指标的可迁移的 “科研判断力”。

AI 不仅会做科研,更能学会判断什么样的科研有高影响力,这正是科研品味的核心一面。

Scientific Thinker:学会构思更有影响力的科研想法

Judge 是科研工作的鉴赏家,而 Thinker 则是构思科研想法的 “创作者”。

Scientific Thinker 的任务:给一篇论文,构思一个高潜力的后续想法。

训练巧妙利用 Scientific Judge:利用 Judge 对 Thinker 生成的一组想法两两比较潜在影响力,以 “组内胜率” 作为奖励信号,引导 Thinker 持续优化。

在 2025 年 1~7 月的高引论文上训练(仅 4K 数据),Scientific Thinker 学到了可泛化的 Ideation 能力:

〓 图4:Scientific Thinker 在不同策略模型和奖励模型下相比训前的胜率,第一行使用 Scientific Judge 作为奖励模型,第二行使用基线奖励模型。

科研构思能力的跃升。SciThinker-30B 和 SciThinker-4B 模型构思的想法,相比训练前的胜率达到 70~80%,且有效泛化到晚于训练数据的论文(即 “未来” 的研究主题)上(图 4 上方)。

Scientific Judge 是训练 Thinker 的 “金牌导师”。使用 Scientific Judge 作为奖励模型训的 Thinker 显著优于直接使用训练前的 Judge(图 4 中上下对比)。证明了更好的判断力,能催生更好的创造力。

〓 表5:30B 的 Scientific Thinker 对战 SOTA 模型的胜率

与 SOTA 模型可匹敌。SciThinker-30B 与 GPT-5.2、GLM-5、Gemini 3 Pro 进行 “Idea 对决”,也展现出强大表现(表5)。

至此,“科研品味” 学习的形成闭环:Scientific Judge做科研影响力判断,并促成Scientific Thinker 提出更优的科研想法。

总结

本研究说明,“科研品味” 并非人类科学家的专属天赋,通过 RLCF 范式从大规模社区反馈中学习,AI 既能精准判断研究的潜在影响力,也能构思出更优的科研想法。这是迈向人类级别 AI 科学家的关键一步。

更多阅读

#投 稿 通 道#

让你的文字被更多人看到

如何才能让更多的优质内容以更短路径到达读者群体,缩短读者寻找优质内容的成本呢?答案就是:你不认识的人。

总有一些你不认识的人,知道你想知道的东西。PaperWeekly 或许可以成为一座桥梁,促使不同背景、不同方向的学者和学术灵感相互碰撞,迸发出更多的可能性。

PaperWeekly 鼓励高校实验室或个人,在我们的平台上分享各类优质内容,可以是最新论文解读,也可以是学术热点剖析科研心得竞赛经验讲解等。我们的目的只有一个,让知识真正流动起来。

📝稿件基本要求:

• 文章确系个人原创作品,未曾在公开渠道发表,如为其他平台已发表或待发表的文章,请明确标注

• 稿件建议以markdown格式撰写,文中配图以附件形式发送,要求图片清晰,无版权问题

• PaperWeekly 尊重原作者署名权,并将为每篇被采纳的原创首发稿件,提供业内具有竞争力稿酬,具体依据文章阅读量和文章质量阶梯制结算

📬投稿通道:

• 投稿邮箱:hr@paperweekly.site

• 来稿请备注即时联系方式(微信),以便我们在稿件选用的第一时间联系作者

• 您也可以直接添加小编微信(pwbot02)快速投稿,备注:姓名-投稿

△长按添加PaperWeekly小编

🔍

现在,在「知乎」也能找到我们了

进入知乎首页搜索「PaperWeekly」

点击「关注」订阅我们的专栏吧

·

http://www.cnnetsun.cn/news/1417587.html

相关文章:

  • Sentaurus实战解析:HFET_pGate_GaN器件仿真中的关键层定义与掺杂控制
  • 2026最新!千笔·降AIGC助手,专科生毕业论文降重神器
  • 电阻标识解析与实用电路设计技巧
  • Windows环境下MIMIC III数据库的快速部署与优化指南
  • Gemini CLI初体验:除了聊天,用它快速生成代码和文档的5个实用命令
  • 从手势控制到智能监控:ST-TR网络在5大场景中的落地指南
  • 2026 零显卡|Python 本地离线部署大模型 8G内存可用|一键运行+8大避坑指南
  • 微信小程序登录的那些坑:如何正确处理wx.login()返回的code和session_key
  • Win11Debloat:终极Windows系统优化指南 - 如何快速清理预装软件并提升性能
  • lingbot-depth-vitl14镜像免配置优势:预装OpenCV+Pillow+NumPy开箱即用图像处理
  • 向量重排序不等于堆模型,Dify生产环境Rerank QPS翻倍,Latency降低63%,我们做对了这7件事
  • ollama-QwQ-32B提示工程:提升OpenClaw指令遵循准确率
  • 电商运营中的数据质量管理策略
  • Qwen3-32B-Chat百度百科编辑助手:事实核查+条目扩写+多语言版本同步
  • 你的小程序技术博客还缺什么?试试用Towxml 3.0渲染Markdown,打造沉浸式阅读体验
  • Audio Pixel Studio实战教程:用晓晓音色生成营销文案语音并分离背景乐
  • PHP开发者必看:5种常见RCE漏洞场景及安全编码实践
  • 海康摄像头插件在iframe中位置错乱?3步搞定动态调整方案(附完整代码)
  • 百考通:AI赋能任务书生成,高效完成内容搭建让科研与项目启动更高效
  • 统计学必备:如何用不完全伽马函数推导卡方检验的P值?分步图解教程
  • SolidColorBrush在非UI线程创建的避坑指南(WPF MVVM绑定场景)
  • CRNN识别双层车牌?一个‘偷懒’却有效的思路,给算法工程师的思维拓展课
  • 对比Claude:百川2-13B模型在代码生成任务上的效果展示
  • 直接上结论:全场景通用降AIGC工具,千笔·降AIGC助手 VS 笔捷Ai
  • FPGA实战:手把手教你用DDS技术生成10Hz-5MHz可调信号(附Quartus配置)
  • WSL2 子系统 SSH 连接终极指南:从零配置到 MobaXterm 完美适配
  • 嵌入式Linux驱动工程师求职经验与硬件项目辨析
  • WRF新手必看:Single Domain Case模拟全流程详解(附常见错误排查)
  • Qwen3-TTS-12Hz-1.7B-Base实操手册:如何用curl命令绕过Web界面直接调用TTS API
  • Java初学者项目实战:创建一个基本的用户管理系统