从失败中学习:基于可验证奖励的修正导向策略优化
基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的有效范式。然而,RLVR 训练常受稀疏二元奖励和弱信用分配问题困扰,导致优化信号模糊,且未能充分利用失败轨迹中的有用信息。 为解决此挑战,本文提出修正导向策略优化(CIPO),一种简单而有效的 RLVR 扩展方法。CIPO 将同策略失败轨迹转化为修正导向的监督信号,无需依赖任何外部信号。通过联合优化模型自身失败样本的修正版本与标准 RLVR 目标,CIPO 提升了学习效率,并显式增强了模型自我纠错能力。 在涵盖数学推理和代码生成的 11 个基准上的广泛实验表明,CIPO 在推理和修正性能上均一致且显著优于强基线。此外,CIPO 取得了更强的 pass@K 增益,表明其提升了模型的内在推理能力,而非简单地在已有正确答案间重新分配概率质量。
论文精读
TL;DR 将 RLVR 训练中的失败轨迹转化为纠错监督信号,通过联合优化标准目标,在无需外部信号的情况下显著提升推理与自我纠错能力,并带来更强的 pass@K 增益,表明模型内在推理能力得到改善。
问题
问题背景
强化学习结合可验证奖励 (RLVR) 已成为提升大语言模型推理能力的主流范式,尤其在数学推理与代码生成领域取得显著进展。当前研究聚焦于如何利用自动验证的二进制奖励,以可扩展的方式优化策略模型。
现有方法局限
以 GRPO (Group Relative Policy Optimization) 为代表的现有 RLVR 算法遵循「强化正确轨迹、抑制错误轨迹」的范式,存在两方面不足:
- 稀疏奖励导致信号模糊:仅提供结果正确与否的二进制反馈,中间步骤得不到有效指导,信用分配 (credit assignment) 困难。
- 失败轨迹信息浪费:错误样本仅作为负例被惩罚,而其内部蕴含的「何处出错、如何纠正」的结构化信息未被显式利用。模型无法从自身的错误中学习修正策略,限制了自我纠错能力的发展。
为什么这个问题难且重要
- 技术挑战:如何在不引入外部监督(如人工标注、更强的教师模型)的前提下,从失败路径中自动提取有效的纠错信号,并将其融入策略优化。这需要克服错误定位模糊、纠正方向多样等难题,同时避免破坏原有 RLVR 目标的稳定性。
- 业界关注度:具备自我纠错能力的推理模型在自动驾驶编程、定理证明、自动化数据分析等高风险场景中需求迫切。提升
pass@K而非仅单次正确率,意味着模型内在推理能力的本质增强,而非简单的概率分布偏移,这对实际部署的鲁棒性至关重要。
行业类比
类似于自动驾驶仿真中利用碰撞轨迹生成安全纠正样本,而非仅丢弃事故数据——从失败中学习比单纯奖励安全行驶更能提升临界场景下的泛化能力。
核心洞察
- **失败轨迹作为强监督信号**:CIPO 将 RLVR 中通常被丢弃的失败样本,通过让模型对同一问题生成纠正性回答(correction sample)并给予 verifiable reward,从而将二元奖励下的弱信用分配 (weak credit assignment) 转化为**结构化纠错信号**。这突破了现有 RLVR 方法仅依赖正确轨迹进行粗粒度优化的限制,充分利用了失败数据中蕴含的推理过程缺陷信息,使模型不仅能区分对错,更能学会如何修正错误,提升内在推理能力而不仅仅是概率分布偏移。
- **无外部反馈的自纠错训练范式**:CIPO 设计了一套**风险规避的自适应重放 (Risk-Averse Adaptive Replay)** 和**难度感知的轨迹偏好 (Difficulty-Aware Trajectories Preference)** 机制,确保纠错样本来自模型真实容易失败的上下文,避免了简单纠错带来的分布偏移。相比依赖外部教师模型或人工标注的纠错方法,CIPO 完全基于模型自身的 on-policy 数据闭环,实现了**可扩展的自我纠错能力进化**,并在数学推理和代码生成的 pass@K 指标上展现出更本质的性能提升。
方法
输入:稀疏奖励与失败轨迹的再利用
CIPO 面向基于可验证奖励的强化学习(RLVR)场景,如数学推理和代码生成。标准 RLVR(例如 GRPO)仅依赖二值的正确/错误信号,导致 信用分配(credit assignment) 模糊,且失败轨迹中潜在的有用信息被完全丢弃。CIPO 将模型 on-policy 采样产生的 失败轨迹 作为额外输入,试图从中提取自我修正的监督信号。
关键模块:从失败中构建修正监督
- 修正样本构造(Correction Sample Construction):对每个失败轨迹,使用一个专门的
correction prompt引导模型生成修正版本。该 prompt 要求模型基于错误答案重新推理,输出正确结果,不依赖任何外部模型或人工标注。 - 自适应重播与风险规避塑造(Adaptive Replay with Risk-Averse Shaping):引入重播机制,控制修正样本的复用频率,避免模型过度偏向简单的修正任务而忽视原始推理能力。风险规避塑造可能通过奖励设计鼓励模型保持保守的修正策略。
- 难度感知的轨迹偏好(Difficulty-Aware Trajectories Preference):根据轨迹的难度(如最终是否正确、步数等)动态调整训练权重,使模型更关注困难但可修正的样本,从而提升学习效率。
- 联合训练目标:将标准 RLVR 目标(如 GRPO 的组相对策略梯度)与 修正损失 结合。修正损失可以看作自我纠错的监督式微调,或者是一种额外的 RL 风格奖励,共同优化模型在原始任务和错误修正上的表现。
输出:内在推理与自我纠错能力
训练后的模型不仅能直接生成正确答案,还能在给定自己先前错误的情况下有效修正。实验表明,CIPO 在多个数学推理和代码生成基准上显著超越强基线,并且 pass@K 指标 有更大提升,证明模型真正增强了推理多样性,而非仅将概率分配到已有正确答案上。
与同类方法的差异
CIPO 区别于现有 RLVR 方法的核心在于,它 直接利用失败轨迹 生成自我修正监督,而不依赖外部奖励模型或人工反馈,以简单且可扩展的方式同时优化推理和纠错能力。
实验
实验设计叙述
论文在 11 个数学推理与代码生成 基准上系统评估 CIPO,涵盖不同难度和输出格式(如自然语言推理、程序合成)。基线方法包括标准 GRPO 等 RLVR 算法,指标聚焦 pass@1 和 pass@K,以剥离随机采样偏差,揭示模型内在推理能力的真实提升。实验通过联合优化标准 RL 目标和基于失败轨迹的纠正监督,量化自我纠错增益。
关键发现
- CIPO 在所有基准上一贯且显著超越基线,表明失败轨迹并非噪声,而是承载着未曾利用的纠错信号。
- pass@K 的提升更为突出,证实模型不再仅依赖已有正确答案的概率重分配,而是真正扩展了推理能力的上限。
- 由自身失败 rollout 衍生的纠正样本无需外部信号即可形成有效监督,训练过程更数据高效且稳定,避免了奖励稀疏导致的 credit assignment 模糊。
与基线对比的深度解读
传统 RLVR(如 GRPO)依赖二元可验证奖励,对长轨迹中每个 token 的贡献难以精细归因,导致失败样本的优化梯度信号稀疏且噪声大。CIPO 通过 修正导向的策略优化 将失败轨迹转化为正向纠正目标,相当于为模型提供了“从错误中学习”的密集信号。这一机制与人类纠错直觉相似,对实际工程中提升 代码调试 和复杂推理的鲁棒性有直接启示:模型不仅学会避免错误,更学会主动定位并修正错误。该方法无需外部标注或模型,实现简单,可作为现有 RLVR 流程的低成本增强插件,为后续研究提供了可靠的自我改进基线。
行业影响
落地场景
CIPO 适用于需要复杂多步推理且具备自动验证能力的场景,如数学辅导系统、代码生成与调试工具、智能客服的知识推理,以及要求高可靠性输出的金融分析报告生成。其核心是显式训练模型的自纠错能力,因此尤其适合需要交互式修正的对话式 AI 产品,例如开发者面对错误代码时直接让模型"重试修正"的工作流。
商业价值
- 降本:利用原本废弃的失败轨迹,提升数据效率,减少对额外人工标注或高质量合成数据的依赖,直接降低训练成本。
- 增收/体验提升:更强的自纠错能力使pass@1 大幅提高,减少用户等待补全或重新生成的延迟,提升产品体验与留存;对于 B 端 API 服务,更高的 pass@K 降低平均推理次数,节约计算资源,提高毛利。
- 差异化:CIPO 训练的模型具备内生的修正能力,可使产品在同类竞品(如仅支持单次生成的 Copilot)中形成"可迭代修正"的独特卖点。
与现有产品/工作流的接口
CIPO 是对 GRPO/PPO 等 RLVR 算法的轻量扩展,无需外部信号,仅需在训练循环中增加对失败轨迹的回放与修正样本生成步骤。可集成到现有 RL 训练框架(如 OpenRLHF、verl)中,通过配置文件指定rollout_replay、update_ratio等超参数。对于已有 RL 流程的团队,接入成本极低:只需在收集 on-policy 数据后,针对奖励为 0 的样本构建修正提示(例如 "The previous answer is incorrect. Please correct it."),并加入优势计算与策略更新。部署时,模型可直接替换原有模型,无需改动推理 API 结构。
具体用例
- 代码助手平台:在 Copilot 类产品中,模型生成代码片段后自动运行测试,若失败则内部触发修正模式,生成修正版本。CIPO 训练后的模型对常见错误模式更敏感,能够将一次通过率提升 5-10 个百分点,显著减少开发者手动 debug 时间。
- 智能教育应用:在数学解题场景,学生提交错误步骤后,模型不仅能给出正确答案,还能指出错误原因并提供逐步纠正。CIPO 增强的模型在错误轨迹上训练的监督信号,使其生成的修正解释更加精准,起到更有效的教学辅导作用。
局限
- **依赖失败轨迹的可用性**:CIPO 从 on-policy 失败轨迹中构建纠正样本,当模型在某个任务上已经表现较好(例如成功率 > 80%)或失败模式高度重复时,生成的失败样本数量和多样性不足,可能降低纠正监督的信息量,甚至引入噪声。对实际工程的启示:在部署 CIPO 前需要评估模型初始成功率,并通过动态调整采样温度或混合多种难度任务来保证失败轨迹的数量与多样性,避免训练退化。
- **计算开销与训练效率**:在标准 RLVR 流程之外,CIPO 额外需要模型对每个失败轨迹生成纠正输出,并扩展训练目标协同优化,显著增加了单次迭代的 token 消耗与 GPU 内存。论文未系统分析纠正样本数、最大生成长度等因素对最终性能的开销-收益权衡,在资源受限场景中可能限制其广泛应用。对实际工程的启示:可考虑通过自适应缩减纠正样本数(仅采样高 uncertainty 的失败轨迹)或复用已有生成来降低额外开销。
- **实验覆盖与基线比较**:当前实验集中在数学推理与代码生成,模型规模以 7B-32B 参数为主,缺乏对更大规模模型(如 70B+)以及在知识密集型任务上的验证。对比基线主要限于 GRPO,未包含其他利用失败样本的 RL 微调方法(如 RLEF、SPIN 等),难以完全说明 CIPO 相对同类工作的增量优势。对实际工程的启示:将其推广至新领域或更大模型前,建议先进行小规模摸底实验,并补充与更多失败样本利用方法的公平对比。