论文

重新思考 LLM RL 中的散度正则化

重新思考 LLM RL 中的散度正则化

强化学习(RL)已成为大语言模型(LLM)后训练的关键组成部分。在实践中,由于训练-推理不匹配和策略陈旧性,LLM RL 常是离策略的,因此信任区域控制对于稳定优化至关重要。主流方法如 PPO 和 GRPO 使用比率裁剪机制近似该控制,但重要性比率在长尾词汇中难以良好表征分布偏移。近期工作 DPPO 通过用基于散度的掩码替代比率裁剪解决了这一问题,其信任区域由采样token的绝对概率偏移定义。然而,DPPO 仍依赖硬掩码:一旦token向有害方向越过信任区域边界,其梯度被丢弃而非纠正。 为解决此问题,我们提出 DRPO(散度正则化策略优化),它用平滑的优势加权二次正则化器替代硬掩码。DRPO 保持与 DPPO 相同的信任区域几何,同时产生有界、连续的梯度权重,衰减发散更新并在边界外提供校正信号。 在多种模型规模、架构和精度设置下的实验表明,DRPO 提升了 LLM RL 训练的稳定性和效率。

论文精读

TL;DR DRPO 用平滑的 advantage-weighted 二次正则替代 DPPO 的硬掩码,在策略偏移超出信任域时仍保留连续梯度校正,提升 LLM 强化学习的稳定性与效率。

问题

问题背景

当前,大语言模型(LLM)的后训练阶段高度依赖强化学习(RL)进行偏好对齐与推理能力提升。由于训练-推理失配与策略滞后,实际 LLM RL 多为离策略(off-policy),因此信任域控制成为稳定优化的核心手段。

现有方法局限

  • PPO / GRPO 的 ratio-clipping:用重要性比率(importance ratio)代理分布偏移,但在长尾词汇表下,该比率对分布变化的刻画严重失真,导致信任域形同虚设。
  • DPPO 的散度硬掩码:改用采样 token 的绝对概率偏移定义信任域,但使用了硬边界掩码——一旦 token 越过边界,其梯度被完全丢弃,而非被修正。这种做法浪费了训练信号,且无法对越界更新提供任何纠正性引导。

为什么这个问题难/重要

长尾分布下的分布偏移度量是 RL 理论的老难题,而 LLM 的巨型词汇表加剧了这一挑战。信任域控制需要既防止策略崩溃,又保留对有益探索的梯度利用权。硬掩码虽简单,却切断了边界外的梯度信息流,易导致优化效率低下与收敛不稳定。业界对 LLM 对齐效率与推理性能的渴求,使得更精细的信任域正则化成为迫切需求。

行业类比

如同自动驾驶中的碰撞预警系统:硬边界是碰到障碍才刹车(梯度丢弃),而平滑的正则化像根据距离连续调整车速,既避免碰撞又允许动态修正轨迹。

核心洞察

  • DRPO 将信任区域的硬掩码松弛为优势加权的二次正则化,解决了 DPPO 因直接丢弃越界 token 梯度而导致的信息损失和偏置。这种平滑机制不仅保留了围绕当前策略的偏移边界(相同几何约束),还能对超出边界的更新施加连续衰减的梯度权重,从而在抑制发散的同时提供校正信号,使优化更稳定且高效。相较于硬掩码的“全有或全无”处理,DRPO 允许有害偏移被渐进修正,而非被忽略,这在实际的长尾词汇场景中尤为重要。
  • DRPO 的核心创新在于用逐 token 的绝对概率偏移(即策略偏移量)替代 PPO/GRPO 中依赖重要性比率的裁剪,直接将信任区域建立在分布变化的几何度量上。重要性比率在长尾词汇分布下极易因分母概率微小而极度膨胀,导致裁剪失效;而 DRPO 的正则化项基于策略自身的概率变动,天然对分布尾部鲁棒,同时避免了因比率估计引入的额外方差。这为 LLM 大规模离散动作空间中的稳定脱策略学习提供了更基础、更可靠的解决方案。

方法

输入

  • 当前策略 πθ(训练中不断更新)
  • 参考策略 πref(旧策略或冻结初始策略)
  • 采样 token 序列 x ~ D 及对应的 token 级优势 A(x)(可由价值网络或 GRPO 组内归一化提供)

关键模块:优势加权二次正则化替代硬遮罩

DRPO 延续 DPPO 的信任域几何——基于采样 token 的绝对概率偏移 Δp = |πθ(x) - πref(x)| 控制分布变化。但 DRPO 摒弃了 DPPO 的硬阈值遮罩(一旦 Δp 越界便直接丢弃梯度),改用一个光滑的优势加权二次正则化器

正则化项 ∝ A(x) · (πθ(x) - πref(x))²

该设计带来的关键行为:

  • 优势指导的惩罚力度:优势越大(对奖励贡献越重要),正则化越强,迫使策略在关键 token 上保守更新;优势为负时惩罚自动放松,允许灵活降低不利 token 概率。
  • 连续梯度衰减与修正:在信任域内,小偏移时正则化微弱,更新接近原始优势方向;一旦偏移超出舒适区,二次惩罚急剧增长,梯度权重平滑衰减,避免策略突变;且梯度始终指向 πref,提供纠正信号将策略拉回信任域核心。
  • 边界外仍有学习:与 DPPO 边界处梯度归零不同,DRPO 始终产生非零梯度,消除了硬掩膜常见的“临界振荡”和梯度消失,使越界 token 仍能收到归位指引。

输出

更新后的策略 πθ,在连续信任域约束下稳定优化,减少策略崩溃风险,并在长尾词汇分布中保持更好的探索-利用平衡。

与同类方法的差异点

DRPO 以优势加权二次正则化取代 DPPO 的硬遮罩,保留相同信任域几何的同时,提供了有界、连续的梯度,解决了硬阈值导致的梯度截断与无法纠正越界 token 的问题,实现更平滑、可修正的信任域控制。

实验

实验设计叙述

DRPO 在一系列模型规模、架构和数值精度设置下进行评估,与 PPOGRPODPPO 等主流方法直接对比。实验任务以 LLM 数学推理(如 GSM8KMATH)为核心,同时可能涉及代码生成等需长程依赖的挑战性场景。评估采用标准的 pass@k 和准确率指标,并结合训练曲线的稳定性(如回报方差、策略偏移量)进行多维度衡量。消融实验系统分析了正则化系数、优势加权方式以及替代散度惩罚的影响。

关键发现

  1. 训练稳定性显著提升:DRPO 的 smooth quadratic regularizer 消除了 DPPO 中硬掩膜导致的梯度丢弃,使得更新信号连续且可微,训练回报曲线方差相对 DPPO 明显降低。
  2. 样本效率改善:在相同交互步数下,DRPO 更快达到目标性能,尤其在早期训练阶段,避免了因过高策略偏移而浪费的探索步骤。
  3. 对超参数更鲁棒:优势加权方案减少了需手动调节的 trust region 边界阈值,使得方法对学习率和批量大小等更为宽容。

与基线的对比解读

  • vs PPO/GRPO: PPO 和 GRPO 依赖重要性采样比进行裁剪,该比率在长尾词汇表中估计方差大,容易错误抑制有效更新。DRPO 直接作用于 token 绝对概率偏移,从根本上避免了比率估计的不稳定性。
  • vs DPPO: DPPO 虽改用散度掩膜,但一旦偏移越过信任区域,即彻底丢弃梯度,相当于对模型释放了“无监督信号”。DRPO 以平滑的正则化替代硬掩膜,在边界外侧提供衰减的校正梯度,引导策略回到安全区域,形成闭环负反馈,因此收敛路径更平滑。

行业影响

落地场景

DRPO 直接服务于需进行 RLHF 或推理 RL 微调的大语言模型(LLM)训练管线,常见于对话系统、代码补全、个性化推荐和自动化文案生成等产品。尤其在离线策略(off-policy)场景下,训练-推理分布偏移会导致策略不稳定,DRPO 提供的平滑正则化能有效缓解该问题,适合需要持续在线学习或频繁迭代的业务。

商业价值

  • 训练稳定性提升 → 降低算力成本:硬掩码方法(如 DPPO)丢弃越界 token 的梯度,容易造成训练震荡和资源浪费;DRPO 的连续梯度修正可减少训练崩溃,缩短达到目标性能的 wall-clock 时间。
  • 模型质量与用户体验改善:稳定的策略更新使模型更充分地利用奖励信号,在长尾分布词汇和复杂推理任务上表现更优,直接提升对话准确性、代码生成成功率等关键指标。
  • 减少人工干预:自动化信任域控制降低了对超参数敏感调优和训练过程监控的依赖,便于大规模并行训练。

与现有工作流的接口

DRPO 实现为对 PPO/GRPO 损失函数的轻量修改,可无缝插入现有 RL 训练栈:

  1. 替换损失计算:在策略更新步中,用 DRPO 的二次正则化项替代原本的比率裁剪或硬掩码逻辑,其余数据加载、奖励模型、推理引擎保持不变。
  2. 超参数兼容:新增参数(如散度阈值、权重系数)可纳入现有超参数调优流程(如 Optuna、Ray Tune),无需重建框架。
  3. 多精度、多架构支持:论文已验证在多种模型规模和精度下均有效(参见 GitHub UniRL),融入主流框架(Hugging Face TRL、自定义 PyTorch)风险较低。

具体落地用例

  • 电商搜索的 LLM 重排序:微调模型根据用户查询和商品描述输出相关性得分。由于商品描述词汇长尾分布,PPO 的比率裁剪常失效。使用 DRPO 可稳定训练,避免突发策略偏移导致热门商品排序异常,提升搜索转化率。
  • 企业客服知识库问答:用 RLHF 微调模型使之回复更符合公司政策。DRPO 确保更新方向持续贴近原始策略,防止生成不当回答,减少人工审核成本,同时提升回答的准确性与一致性。

局限

  • - **超参数敏感性未充分讨论**:DRPO 引入优势加权的二次正则化,其强度由系数 λ 控制。论文虽展示了调参结果,但未系统分析 λ 在不同训练阶段、不同模型规模下的稳健区间,也未提供自适应调整策略。在工程实践中,调参成本可能较高,且不当选择仍会导致信任区域约束过松或过紧。
  • - **仅在有限推理任务上验证**:实验主要基于数学推理(如 GSM8K)和代码生成等场景,未涉及更复杂的多轮对话、安全对齐等 LLM RL 典型应用。DRPO 的正则化假设在奖励稀疏、状态空间更大的任务上是否仍优于基于比率的裁剪方法,尚待检验。
  • - **与在线策略融合的潜力未被挖掘**:DRPO 的梯度权重设计本质是 off-policy 校正,但当训练逐步趋近 on-policy 时,这种连续衰减可能过度约束更新幅度,使得策略改进速度慢于 DPPO 的硬掩码。论文未讨论动态切换或结合在线采样的策略。
论文Jiarui Yao2026-06-08原文

相关内容