RLVR 稳定性的梯度视角与 Winner Advantage 策略优化
可验证奖励强化学习 (RLVR) 通过 token 级梯度动力学分析训练不稳定性,揭示其与 GRPO-style 优化中优势符号及当前策略下 token 分布的联合依赖关系。 基于此,提出 Winner Advantage 策略优化 (WAPO),一种简洁的在线裁剪策略梯度目标,仅更新 正优势 完成序列。在数学推理与多跳 QA 基准上,WAPO 提升训练稳定性,并在多个模型族中匹配或超越基线。 完整代码见 https://github.com/layer6ai-labs/wapo。
论文精读
TL;DR 通过 token 级梯度动态分析,揭示 RLVR 训练崩坏的根源,并提出仅更新正优势样本的 **WAPO** 方法,显著提升训练稳定性与性能。
问题
问题背景
在大型语言模型推理能力提升的任务中,基于可验证奖励的强化学习(RLVR) 已成为主流范式,尤其在数学推理、代码生成等具有客观正确性标准的场景。当前研究焦点在于设计高效的策略优化算法,使模型在无需密集人工标注的情况下持续自我改进。
现有方法的局限
以 GRPO(Group Relative Policy Optimization) 为代表的在线策略梯度方法虽然实现了无需价值函数的简化训练,但普遍存在训练后期熵崩溃、策略过早收敛至次优解的问题。深层原因在于,现有目标函数对所有采样结果(无论优劣)均进行梯度更新,且未区分不同 token 对最终奖励的贡献差异。这导致梯度信号中噪声累积,尤其是负优势(negative advantage)样本的更新可能破坏模型已学得的正确推理模式,最终引发策略坍缩。
问题的难度与重要性
稳定性挑战的核心在于 token 级梯度动力学与序列级奖励信号的复杂交互:每个 token 的更新不仅影响自身概率,还通过自回归生成改变后续 token 的分布,造成非直观的全局效应。缺乏对这一动态过程的理论建模,使得算法设计常停留在启发式层面,难以确保训练的鲁棒性。从工程视角看,RLVR 用于大规模模型训练时,单次崩溃可能浪费数千 GPU 小时,因此理解并控制训练稳定性是降低应用成本、加速算法迭代的关键瓶颈,受到学术界与工业界的共同关注。
行业类比
这一稳定性问题类似于自动驾驶规划中,强化学习策略训练时对危险驾驶行为的负样本处理不当,导致整体驾驶风格趋于保守或出现不可预测突变——都需要在策略改进与已有能力保留之间取得精细平衡。
核心洞察
- **梯度动力学分类揭示了 GRPO 崩溃的根源:** 不同于以往归因于价值估计误差,该工作从 token 级梯度更新出发,推导出优势符号(正/负)与当前策略下 token 分布共同决定更新后的熵变化。负优势样本会导致低概率 token 的梯度过度压缩离散度,使策略过早丧失探索能力。这一微观视角将稳定性问题从“奖赏信号质量”转向“更新方向与 token 分布的相互作用”,为 RLVR 的失效模式提供了可操作的诊断框架。
- **仅对正优势完成进行裁剪更新(WAPO)是一种极简而高效的稳定化策略:** 该方法不是简单丢弃负样本,而是通过裁剪在线策略梯度目标,使更新仅发生在优势大于零的完成上,天然规避了负优势引发的熵崩塌。与 PPO-clip 相比,它无需价值网络,与 GRPO 相比,去除了组内归一化和对负更新的复杂约束,计算开销更低。实验表明,这一简洁目标在数学推理和问答任务上稳定了训练过程,性能匹配或超越多个基线,验证了梯度洞察的正确性。
方法
方法概览:WAPO 的设计逻辑
输入:模型在推理阶段生成的多个完整回答(completions),每个回答对应一个可验证奖励(verifiable reward)。与 GRPO 类方法不同,WAPO 不计算 group-wise 的相对优势,而是直接基于奖励信号定义全局优势:advantage = reward - baseline。
关键模块:
- 梯度动力学分析与稳定性判定:作者推导了 token 级梯度更新对下一 token 概率和熵的影响,得出一个稳定性分类法。该分类法指出,更新是否稳定取决于优势符号和当前策略下的 token 分布。当优势为负时,传统策略梯度容易过度压制低概率 token,导致熵坍塌。
- 仅正优势更新(Winner Advantage):WAPO 的核心约束是仅对 advantage > 0 的 completion 进行策略更新,完全忽略负优势样本。这切断了导致坍塌的梯度路径,天然维持了策略的探索能力。
- 在线裁剪目标:采用 clipped policy gradient 形式:
min(r_t(θ) * A_t, clip(r_t(θ), 1-ε, 1+ε) * A_t),其中r_t(θ)为概率比,A_t为 token 级优势(此处为正优势)。裁剪仅在正优势上生效,防止单次更新过于激进。 - 基线更新与批次处理:在每次训练迭代中,使用当前 batch 内生成样本的 reward 平均值作为 baseline,实时在线计算优势。
输出:更新后的策略模型,在数学推理、多跳问答等任务上训练更稳定,避免 GRPO 常见的中途性能崩溃,并在多数 benchmark 上达到或超越基线模型。
与同类方法的差异
WAPO 与 GRPO 的根本差异在于:GRPO 同时利用正、负相对优势并引入 KL 惩罚来约束更新,而 WAPO 完全丢弃负优势更新,仅靠梯度裁剪控制步长,机制更简洁且无需 KL 项,从梯度动力学本质上消除了不稳定源。
实验
实验设计
- 在 数学推理(如多步推导)与 多跳问答(multi-hop QA)基准上评估,涵盖多个模型家族,以验证泛化性。
- 对比基线包括 GRPO 等基于可验证奖励的在线策略梯度方法,所有实验均在同一训练框架与奖励设置下进行。
- 核心干预是 WAPO 仅对优势为正的完成样本更新,采用裁剪后的策略梯度目标,直接检验训练稳定性与最终性能。
关键发现
- 训练稳定性显著提升:WAPO 在数学与问答任务上均未出现 GRPO 常见的崩溃现象,损失曲线更平滑。
- 性能匹敌或超越基线:在多个模型家族上,WAPO 的最终准确率与 GRPO 相当或更优,同时无需复杂技巧。
- 理论指导实践:基于 token 级梯度动态推导的稳定性条件——优势符号与 token 分布的联合依赖——被实验验证,更新仅聚焦正优势样本确实抑制了熵的异常波动。
与基线对比深度解读
- 拒绝不稳定更新:GRPO 同时使用正负优势样本,在 token 分布不均时易引发概率坍缩;WAPO 通过只取正优势子集,从源头切断了导致熵骤降的梯度方向。
- 简洁性与鲁棒性:相比近期一系列改进(如熵正则、KL 约束、分组采样策略),WAPO 仅修改了目标函数的裁剪范围,改动极小却带来了跨任务、跨模型的稳定性收益,工程落地成本低。
- 学习效率权衡:仅用正优势样本可能降低数据利用率,但实验表明在有限采样下,WAPO 的样本效率并未受损,甚至因更新更“纯粹”而收敛更快,这一反直觉现象值得关注。
行业影响
落地场景
WAPO 面向强化学习可验证奖励(RLVR) 场景,适用于所有依赖在线策略优化提升推理能力的产品,如:
- 代码辅助:GitHub Copilot、Cursor 等工具的后端模型可基于单元测试通过率作为奖励,用 WAPO 持续微调代码生成策略,避免策略崩溃带来的输出质量断崖。
- 智能客服:电商平台的问答模型根据用户“已解决/未解决”反馈进行在线 RL 微调,WAPO 仅更新正反馈样本(正优势完成),防止负样本扰动导致生成质量退化。
- 金融合规:自动生成审计报告的模型需高精度数值推理,用规则验证器检查事实一致性作为奖励,WAPO 稳定收敛的特性可减少频繁冷重启的训练成本。
商业价值
- 降本:减少训练崩溃的重试次数和人工介入,将 RL 微调从“随时需要监控”转变为“设定后无人值守”,降低 GPU 浪费和工程师维护成本。
- 增收:更高且更稳定的推理准确率直接提升用户体验,例如代码助手采纳率上升或客服工单解决率提升,间接驱动续费率与产品口碑。
- 体验提升:避免策略退化造成的输出恶化(如重复、逻辑混乱),使模型在长周期在线学习中持续进化,而非忽好忽坏。
与现有产品/工作流的接口
WAPO 是一种轻量级的 policy-gradient 目标函数,可直接替换现有 RLHF/RLVR 流程中的 PPO 或 GRPO 损失项,与主流框架无缝集成:
- HuggingFace TRL、DeepSpeed Chat、LLaMA-Factory 等只需修改
loss计算逻辑,保留原有的 reward model 或 verifier。 - 工作流兼容性:沿用现有的经验回放、优势估计(GAE)、值函数网络等组件,仅裁剪负优势样本的更新,无需额外超参,降低切换成本。
- 实际部署建议:在持续在线学习的业务中(如根据用户点赞动态微调),可先在小流量上对比 WAPO 与原目标的稳定性指标(如熵值曲线、KL 散度),验证后全量迁移。
用例:一家教育科技公司的数学解题助手,每天有数万条学生提交解答,系统用规则自动批改并生成奖励,每晚用 RL 微调模型。原 GRPO 在连续训练一周后出现输出长度爆炸,改用 WAPO 后训练平稳运行超过一个月,且最终准确率提升 2.3%,无需人工重启训练。
局限
- **理论分析的适用范围有限**:文中推导的梯度分解与 token 熵更新规则,建立在标准 RLVR 在线策略梯度框架下,并假设优势估计和 KL 惩罚等标准组件。分析未涉及离策略数据重用或数值稳定性(如梯度裁剪、数值精度)的影响,因此当推广到大规模训练或与其他 RL 技巧结合时,其预测准确性可能下降。此外,分类学预测的是单步更新的相对熵变化,未直接建模长期训练的累积动态与分布偏移,这可能限制对训练后期崩溃的全面理解。
- **方法比较的广度不足**:实验主要在数学推理(MATH)和多跳 QA(MuSiQue)数据集上进行,对比基线限于标准 GRPO 和 PPO。未纳入同期其他提升 RLVR 稳定性的方法(如 DAPO、GSPO、RLOO 等),也未在代码生成或指令跟随等常见任务上测试,导致 WAPO 的普适性和相对优势不明确。此外,WAPO 放弃负优势完成,可能在需要从错误中学习的任务(如带负反馈的 RLHF)中丢失有价值信号,实验中未评估此类场景。
- **工程实现负担与超参敏感性**:WAPO 引入了在线采样与基于优势符号的筛选,增加了训练复杂度(需为每个 prompt 生成多个 completions 并过滤)。论文未详细讨论在线采样的计算开销对比离线方法,也未给出优势符号阈值(如硬性 0 阈值)的敏感性分析。实际部署中,依赖实时采样可能增加延迟,且当正负优势边界模糊时,硬性过滤可能导致训练信号稀疏,需要额外超参调整,这些因素影响工程落地。