当前位置: 首页 > news >正文

蚂蚁:适配信息缺失的强化学习框架

📖标题:Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning
🌐来源:arXiv, 2608.16554v1

🛎️文章简介
🔸研究问题:当用户查询缺少得出唯一答案所需的关键前提时,大语言模型应如何避免幻觉并做出有用响应?
🔸主要贡献:论文提出了ACA-RL框架及MPB基准,通过结构化奖励训练模型在信息缺失时主动询问、条件化回答或弃权。

📝重点思路
🔸构建推理图引导的数据合成流水线,将良构问题转化为带有局部缺口标注的缺失前提训练实例,生成12万条高质量数据。
🔸设计包含五种行为分类的结构化奖励函数,优先奖励主动询问和条件化,惩罚幻觉和无支持猜想。
🔸引入人工验证的MPB基准,涵盖数学、逻辑及现实场景,用于评估模型识别欠定任务及处理不确定性的能力。
🔸采用冷启动SFT结合PPO算法进行训练,平衡缺失前提鲁棒性与常规推理能力,避免过度拒绝导致的性能下降。

🔎分析总结
🔸ACA-RL在MPB及第三方不可答基准上显著优于Vanilla PPO和IDK-RL,证明仅靠答案导向的RL无法有效处理缺失前提。
🔸模型行为呈现阶段性演变,早期快速学会弃权,后期逐渐转向更具信息量的条件化表达和主动询问,超越了简单的“我不知道”。
🔸在保持GSM8K、AIME等常规推理任务竞争力的同时,ACA-RL未出现严重的过度拒绝现象,LiveBench得分与基线持平。
🔸推理图引导的合成数据比随机截断或现有不可答数据集更能提升模型对逻辑缺口的敏感度及行为得分。

💡个人观点
论文重新定义了推理模型的成功标准,从单纯追求正确答案扩展到识别任务欠定性并建设性响应,核心突破是将模糊的“不确定性”拆解为可优化的具体行为层级。

http://www.cnnetsun.cn/news/4252497.html

相关文章:

  • 2026年8月六西格玛培训周期全解析:黑带认证到底要多久?
  • Physical AI进入经验工程时代,全链路数据基建如何落地
  • AutoDL实例中ambertools的安装
  • Python分支编程进阶:从if-else到规则引擎的设计与重构
  • Excel数组公式从入门到实战:批量计算思维一次讲清
  • TUI邮件客户端与Messenger式布局:从设计到Python原型
  • 基于SpringBoot的服装商城平台系统(源码+讲解视频+LW)
  • 基于SpringBoot的同城宠物服务管理系统(源码+lw+部署文档+讲解等)
  • 【计算机毕业设计单片机案例】基于 STM32 的 OLED 实时显示智能水杯硬件控制系统设计 基于 STM32 的红外感应定时饮水提醒设备设计与开发(011805)
  • API对接实战:从协议分层到生产级错误排查的完整方法论
  • 玄戒O3 AI处理器解析:折叠屏端侧算力如何落地?
  • TUSB320详解:Type-C CC逻辑检测与角色协商实战
  • C++泛型编程与模板技术:从基础语法到高级应用实战
  • LeetCode hot100——随机链表的复制
  • 零基础学Python,哪些趣味知识点不必死记硬背|零壹教育分享
  • 第六代小型化硅电视调谐器:从铁壳到3mm芯片的设计与调试
  • 中秋国庆投票活动全指南:节日主题评选策划与快速落地方案
  • 机器人竞速项目实战:从仿真到实机的稳定复现与排错指南
  • C语言的编译和链接
  • C语言strlen函数模拟实现与底层原理剖析
  • 用Claude生成会断电自救的赛博城市:单文件HTML状态机实战
  • HMI人机交互界面开发全解析:从架构到部署的工程实践指南
  • 基于SpringBoot的校园爱心志愿管理系统的设计与实现源码+文档
  • phys_pud_init、phys_pmd_init、phys_pte_init
  • NVIDIA GPU环境搭建与排错实战:驱动、CUDA、Docker和NIM
  • 数字电源赋能LED驱动:从PFC到LLC的效率革命
  • 响应渲染 render(render/ 包)
  • Open-Spec i.MX6 UL DAQ板卡:从硬件选型到Linux驱动实战指南
  • AI服务器内存优化实战:从显存估算到系统排查
  • 跨境ETF套利策略实战:从均值回复原理到Python回测全解析