蚂蚁:适配信息缺失的强化学习框架
📖标题:Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning
🌐来源:arXiv, 2608.16554v1
🛎️文章简介
🔸研究问题:当用户查询缺少得出唯一答案所需的关键前提时,大语言模型应如何避免幻觉并做出有用响应?
🔸主要贡献:论文提出了ACA-RL框架及MPB基准,通过结构化奖励训练模型在信息缺失时主动询问、条件化回答或弃权。
📝重点思路
🔸构建推理图引导的数据合成流水线,将良构问题转化为带有局部缺口标注的缺失前提训练实例,生成12万条高质量数据。
🔸设计包含五种行为分类的结构化奖励函数,优先奖励主动询问和条件化,惩罚幻觉和无支持猜想。
🔸引入人工验证的MPB基准,涵盖数学、逻辑及现实场景,用于评估模型识别欠定任务及处理不确定性的能力。
🔸采用冷启动SFT结合PPO算法进行训练,平衡缺失前提鲁棒性与常规推理能力,避免过度拒绝导致的性能下降。
🔎分析总结
🔸ACA-RL在MPB及第三方不可答基准上显著优于Vanilla PPO和IDK-RL,证明仅靠答案导向的RL无法有效处理缺失前提。
🔸模型行为呈现阶段性演变,早期快速学会弃权,后期逐渐转向更具信息量的条件化表达和主动询问,超越了简单的“我不知道”。
🔸在保持GSM8K、AIME等常规推理任务竞争力的同时,ACA-RL未出现严重的过度拒绝现象,LiveBench得分与基线持平。
🔸推理图引导的合成数据比随机截断或现有不可答数据集更能提升模型对逻辑缺口的敏感度及行为得分。
💡个人观点
论文重新定义了推理模型的成功标准,从单纯追求正确答案扩展到识别任务欠定性并建设性响应,核心突破是将模糊的“不确定性”拆解为可优化的具体行为层级。
