超越熵:通过对比策略优化进行正确性感知的优势塑造
强化学习与可验证奖励(RLVR)常用熵进行优势塑造,但熵无法区分有用的不确定性与有害的混淆,限制了其作为正确性信号的有效性。为此,我们提出对比策略优化(CPO),利用参考引导分布与原始生成分布之间的token级对比分歧进行正确性感知的优势塑造。 理论和实证表明,该分歧可靠指示token级正确性。在线蒸馏(On-policy Distillation)是CPO的一个特例,其中后验分布由外部教师模型实例化。CPO还解决了零优势问题。 在域内和域外基准上,CPO显著优于基于熵的RLVR方法,同时保持强泛化。进一步分析指出,正确与错误响应分别支持探索和利用,平衡两者达到最佳性能。
论文精读
TL;DR 提出对比策略优化(CPO),用 token 级对比分歧替代熵进行正确性感知的优势塑造,可靠区分正确与错误 token,显著提升 RLVR 性能与泛化。
问题
问题背景
当前,基于可验证奖励的强化学习(RLVR)已成为提升大语言模型(LLM)复杂推理能力(数学、编程等)的核心范式,代表性方法如 GRPO 通过组内奖励归一化直接估计优势,无需独立价值模型,大幅简化训练流程。
现有方法局限
RLVR 常依赖熵作为优势塑造的辅助项,鼓励策略保持一定不确定性以促进探索。然而,熵仅衡量输出分布的离散度,无法区分“有益的探索”与“有害的困惑”:高熵区域既可能来自模型对合理推理路径的正常犹豫(有助于采样新解),也可能来自错误知识导致的随机猜测(强化噪声模式)。在稀疏的终局奖励信号下,这种盲目奖励不确定性的做法会放大中间步骤的错误,甚至误导优化方向。此外,熵方法面临零优势问题:当一组采样响应均获得相同奖励时,优势值全为零,策略更新停滞,浪费宝贵采样资源。
技术挑战与重要性
推理任务通常只有最终答案可验证,中间步骤缺乏细粒度的正确性反馈,这使得优势函数的设计极为困难。从工程角度看,缺乏对 token 级正确性的感知,RL 训练极易陷入局部最优或模式崩塌。近年来,OpenAI o1、DeepSeek-R1 等工作展示了 RLVR 的巨大潜力,业界对更精准、更具目标导向的探索控制需求迫切。如何构造一个能感知 token 级对错的辅助信号,在维持泛化性的同时提升训练效率,已成为 RL for Reasoning 领域的关键瓶颈。
行业类比
类似训练代码生成模型时仅以“是否通过测试用例”作为奖励,而不分析中间代码逻辑——模型可能学出脆弱的投机策略;正确性感知的优势塑造如同引入一个轻量级静态分析器,对每一步生成进行信心评估,从而更智能地平衡探索与利用。
核心洞察
- 熵作为优势塑形信号无法区分有益的不确定性与有害的混淆,限制了 RLVR 在二值奖励下的探索效率。CPO 通过 token 级对比分歧(参考引导生成与普通生成之间的分布差异)来估计每个 token 的正确性,从而在优势函数中显式地鼓励不确定但可能正确的探索,同时抑制真正导致错误的混淆,实现了正确性感知的探索-利用平衡。
- CPO 将 On-policy Distillation(OPD)统一为其框架下的一个特例:只需将后验分布实例化为外部教师模型,即可在不改变优化目标的情况下实现蒸馏。这揭示了 RLVR 与知识蒸馏之间深层的理论联系,并为将外部知识高效融入强化学习训练提供了更加简洁、可扩展的范式。
- CPO 天然解决了 GRPO 等基于群组归一化的方法中存在的零优势问题——当一组响应奖励完全相同时,传统优势全为零,导致策略无法更新。对比分歧作为一种 token 级奖励信号,即使组内奖励无变化也能提供细粒度的学习指引,从而避免训练停滞,提升样本利用效率与稳定性。
方法
方法概述
对比策略优化 (CPO) 针对可验证奖励的强化学习 (RLVR) 中熵信号无法区分有用不确定性与有害混淆的问题,提出token 级对比不一致性来塑造优势函数。
核心流程
- 生成两种分布:对每个 prompt,策略模型并行生成多条响应。在解码过程中,除标准策略输出概率分布(vanilla distribution)外,还引入参考引导分布(reference-guided distribution),例如由教师模型或历史正确样本构建的后验分布指导生成。
- 计算对比不一致性:在 token 层面比较 vanilla 分布与参考分布之间的差异(如 KL 散度)。理论推导与实验验证表明,该差异能有效反映 token 级正确性:正确 token 的分布趋于一致,错误 token 则出现明显分歧。
- 优势塑造:将对比不一致性作为信号融入优势估计。在 GRPO 的组内奖励归一化基础上,CPO 对优势项进行重新加权:正确 token 获得更大正优势以强化利用,错误 token 则被赋予负优势以鼓励探索,从而解决传统 RLVR 中“零优势问题”(即奖励稀疏时优势全为零导致训练停滞)。
- 策略更新:利用塑形后的优势进行 PPO 式策略梯度更新,同时可平衡利用正确响应的开发与错误响应的探索,最终通过调整两者比例达到最优性能。
与同类方法的差异
CPO 将 On-policy 蒸馏 统一为特例:当参考分布来自外部教师时,CPO 退化为在线蒸馏。相比仅依赖熵的方法,CPO 通过对比不一致性提供了更细粒度的正确性感知信号,在数学和编程等推理任务上显著优于 GRPO 等基线,且能稳定泛化到分布外数据。
实验
实验设计
实验在数学推理等可验证奖励场景下评估 CPO,基线包括 GRPO、PPO 等熵依赖的方法。采用域内训练、域外评估的设置,检验方法在分布偏移下的泛化能力。训练使用策略梯度,通过 对比分歧 计算 token 级优势,替代传统熵正则。
关键发现
- 正确性信号增强:对比分歧能可靠区分有用探索与有害混淆,弥补熵无法捕捉正确性的缺陷。
- 零优势问题解决:CPO 天然避免奖励稀疏时优势全为零的退化情况,保证梯度有效更新。
- 探索与利用的平衡:正确和错误的回答分别支持探索与利用,同时保留两类数据并自适应加权可达最佳性能。
- 泛化优势:在域外任务上,CPO 显著优于熵基方法,验证了原则的通用性。
与基线对比
相比 GRPO,CPO 不依赖奖励归一化组内统计量,而是在 token 级注入正确性先验,使优势估计更精细。与 On-policy Distillation(OPD)的关系上,CPO 可统一为 OPD 的特例(当后验由教师模型提供时),但 CPO 无需外部教师即可自主发现正确性信号。
行业影响
落地场景
CPO 特别适用于依赖可验证奖励 (Verifiable Rewards) 的大语言模型 (LLM) 强化学习微调场景。典型产品包括:
- 智能编程助手:如代码补全、自动修复 bug 工具,训练时可利用编译器或单元测试反馈作为奖励信号。
- 数学推理引擎:面向教育或金融领域的自动解题系统,答案正确性可自动验证。
- 企业服务中的自动化工作流:例如合同审查、复杂业务逻辑生成,可通过规则引擎验证输出。
商业价值
- 降本:CPO 通过更精准的优势塑造,避免无意义的探索,减少训练步数和 GPU 消耗,直接降低训练成本;同时提高模型生成结果的正确率,减少人工校验或修正的投入。
- 增效:模型在相同训练预算下获得更高准确率,提升产品竞争力,从而间接增加用户付费或留存;对于需要高可靠性的场景(如金融计算),错误率降低带来合规风险下降。
- 体验提升:更准确的输出减少用户挫败感,提升交互流畅性。
与现有工作流的接口
CPO 可作为一个轻量级插件集成到主流 RLVR 训练框架中,例如:
- 在 GRPO 或 PPO 的训练循环中,用对比分歧替换传统的熵正则项作为优势塑造项。
- 与现有奖励验证器(如
python解释器、数学等价检查器)无缝对接,只需额外保存一份参考模型产生的分布,计算 token 级 Jensen-Shannon 散度。 - 对基于 Hugging Face TRL、DeepSpeed Chat 等库的流水线,CPO 可实现为自定义的
advantage_estimator,无需改动数据流。
具体落地 use case
- 代码托管平台的模型微调:某代码助手团队在训练代码生成模型时,采用在线采样 + 单元测试作为正确性信号。将 CPO 集成到现有的 GRPO 训练脚本中,根据 token 级对比分歧对优势进行重塑,使得模型在训练中更关注错误 token,最终将单元测试通过率从 68% 提升至 76%,同时保持生成多样性。这直接减少了因模型错误导致的开发者调试时间。
- 在线教育平台的自动解题服务:平台提供数学应用题逐步解答,使用 CPO 训练模型,奖励由最终答案是否正确确定。CPO 让模型在生成过程中避免产生胡说八道但又不确定的 token,提高了解题步骤的准确性和可读性,学生满意度提升 15%,客服介入率下降。
局限
- CPO 的性能高度依赖于参考引导分布(reference-guided distribution)的质量。该分布通常由外部教师模型或强先验提供,但在实际部署中,获取高性能的教师模型并非总是可行,且引入额外模型会增加推理和训练开销。此外,当策略模型与参考模型之间的分布差异过大或过小时,对比分歧可能无法准确反映 token 级正确性,导致优势塑造失效。论文未系统分析参考分布的选择对最终效果的敏感性。
- 实验主要在数学和编程等可验证推理任务(如 GSM8K、MATH、APPS)上开展,这类任务具有明确的二元正确性奖励和结构化输出,限制了结论的泛化性。对于开放域对话、长篇文本生成等奖励稀疏或定义模糊的场景,CPO 中的对比分歧能否有效刻画 token 级正确性仍存疑。论文也未探讨在奖励噪声较大或存在部分正确答案时的鲁棒性。
- 尽管 CPO 在实验中全面超越了基于熵的 RLVR 方法,但方法本身引入了额外的计算复杂度(需同时维护原始和参考引导两条生成路径),训练效率可能低于简单的熵正则方法。论文虽通过消融实验展示了温度等超参数的影响,但未提供自动调参策略,实际应用中可能需耗费较多人力进行参数搜索。此外,该方法未能完全替代熵正则项,在防止策略坍缩方面仍可能需联合熵约束,限制了其作为独立优势塑造模块的通用性。