论文

超越稳定性-探索困境:用于 LLM 策略优化的环境正则化

超越稳定性-探索困境:用于 LLM 策略优化的环境正则化

大语言模型的策略优化面临稳定性与探索之间的权衡,当前通常依赖行动端的 Policy-KL 正则化器。这使从业者陷入两难:保留 Policy-KL 会约束响应行为并消耗行动端的探索预算,而丢弃它则使优化缺少显式的漂移控制。我们提出一种替代方案,通过将正则化转移到输入侧来打破这一困境。随着训练进行,当前策略在训练查询上诱导的分布会不受控制地偏离其 RL 前的参考分布。 具体地,环境正则化策略优化 (ERPO) 引入了 Query-KL (QKL) 项来约束查询分布漂移,并借助参考分布派生的静态逐查询权重,将每个查询的更新偏向于参考下典型的查询。QKL 梯度仅通过查询似然传递;策略梯度估计器使用的响应得分函数不参与 QKL 项,因此 QKL 不会对响应分布产生直接梯度压力——探索得以保留。ERPO 可无缝接入 GRPO、PPO、REINFORCE 等流程,无需额外的前向传播。 在六项数学推理基准上,ERPO 取代标准 Policy-KL 正则化器,有效控制查询分布漂移,并在高温采样和长时程训练下实现更强的准确率和显著更稳定的行为。代码已开源:https://github.com/alibaba/ERPO。

论文精读

TL;DR ERPO 用输入侧 Query-KL 替代传统 Policy-KL,约束查询分布漂移而不压制响应探索,打破稳定-探索两难,在数学推理任务上取得更优精度与稳定性。

问题

问题背景

当前 RLVR(Reinforcement Learning with Verifiable Rewards)已成为提升 LLM 数学推理与代码生成能力的主流范式,但策略优化始终面临稳定性与探索性的两难。

现有方法局限

现有主流做法是在动作侧加入 Policy-KL 正则,约束当前策略与参考策略在响应分布上的差异。这带来双重困境:

  • 保留 Policy-KL 会压缩响应层面的探索空间,限制模型发现新解的能力,使训练收益趋于保守;
  • 直接移除 Policy-KL 后,优化过程失去显式漂移控制,尤其在长时训练或高温解码下,由当前策略诱导的训练查询分布会逐渐偏离预训练参考分布,最终导致奖励黑客、训练崩溃或指标不稳定。

论文指出,真正需要被约束的并非仅响应分布,而是输入侧查询分布的环境漂移;可惜长期以来这一维度未被显式建模。

为什么难/重要

核心挑战在于稳定性与探索性的控制信号作用在不同分布:政策梯度估计器天然作用于响应分布,而查询分布的变化直接影响策略所面对的训练环境。传统的单一动作侧正则难以同时兼顾两者。

在数学推理、代码生成等稀疏奖励且验证器精确的任务中,长周期 RL 训练已是业界常态,对训练稳定性的要求也随之提高。无控制的查询漂移会逐轮累积,导致模型在后期训练的查询分布与奖励验证器期望的分布错位,进而引发性能骤降。

行业类比

类似自动驾驶的强化学习训练:既要让策略在多样化场景中探索新路线,又要防止车辆偏离安全参考轨迹。将约束从具体动作层转移到场景采样层,才可能同时保留探索与稳定。

核心洞察

  • ERPO 将正则化从动作侧迁移至输入侧,通过约束查询分布漂移而非响应分布来解耦稳定性与探索。与标准 Policy-KL 不同,Policy-KL 直接在响应分布上施加梯度压力,会消耗动作侧探索预算;ERPO 的 Query-KL 梯度仅流经查询似然,不触碰响应 score function,因此完整保留响应多样性。这种结构解耦打破了现有 RLVR 中稳定性-探索的二难选择,为策略优化提供了新的正则化思路。
  • ERPO 引入数据集静态参考导出的查询权重,并结合 Query-KL 项实现零额外前向传递的即插即用正则化。相较于需要额外 critic 或多次采样参考模型的方法,ERPO 仅需缓存参考查询似然,通过重加权将每个查询更新偏向参考分布下的典型样本,同时无缝嵌入 GRPO/PPO/REINFORCE,不增加推理开销。这为工程实践提供了一种低成本的漂移控制手段,且不影响响应侧探索预算。

方法

输入设置

ERPO 面向 RLVR(Reinforcement Learning with Verifiable Rewards)训练流程,接收当前 policy、一批训练 query、以及预训练阶段得到的 query 参考分布。对每个 query 采样 response 后,使用可验证奖励计算 policy gradient 信号。

关键模块

Query-KL 正则项:计算当前 policy 诱导的 query 分布与参考分布之间的 KL 散度,作为损失附加项。其梯度仅通过 query 的条件概率回传,不经过 response 的 score function,因此不对 response 分布施加直接梯度压力,保留了探索能力。

Dataset-static per-query weight:根据参考分布为每个 query 赋予静态权重(参考分布下更典型的 query 权重更高),在逐 query 更新时向典型 query 倾斜。该权重在训练前计算一次,不随训练动态变化。

PG-compatible surrogate:将上述两个组件嵌入 GRPO/PPO/REINFORCE 的策略梯度目标中,替换原 Policy-KL 项。实现上仅需修改 query 侧损失项,不需要额外的 forward pass 或缓存 response 分布。

输出与控制效果

优化后的 policy 在保持 response 探索的同时,将 query 分布漂移限制在参考分布附近。实验显示在六个数学推理基准上提高了准确率,并在高温解码和长时训练下显著增强稳定性。

与同类方法的差异点:Policy-KL 从动作侧约束 response 分布,消耗探索预算;ERPO 将正则化转移到输入侧,通过 Query-KL 和 query reweighting 实现稳定性与探索的结构性解耦。

实验

实验设计

论文在六个数学推理基准上验证 ERPO,将其直接替换标准 Policy-KL 正则项,并集成到 GRPO / PPO / REINFORCE 风格流程中,无需额外前向传播。评估覆盖高温度解码与长时训练两种关键场景。

关键发现

  • ERPO 引入 Query-KL 项,约束查询分布漂移,但梯度只流经查询似然,不直接作用于响应分布,因此保留探索能力。
  • 实验表明 ERPO 在六个基准上比替换前的 Policy-KL 基线取得更强准确率,且在高温度解码下稳定性大幅提升。
  • 长时训练中,ERPO 有效抑制环境漂移,避免策略过早收敛或崩溃。

与基线对比的深度解读

标准 Policy-KL 在动作侧施加约束,直接限制响应分布,消耗探索预算;ERPO 将正则化移到输入侧,控制查询分布对参考分布的偏移,同时不影响响应空间探索。这种结构性解耦使优化过程在高温度采样和长期训练中更稳健,避免“稳定性—探索”两难。工程上,ERPO 可即插即用,不增加额外前向成本,对现有 RLVR 管线改动极小。

行业影响

落地场景

ERPO 适用于基于 RLVR(可验证奖励强化学习)的 LLM 后训练流程,尤其适合需要长程推理或高温度采样探索的业务。例如:

  • 在线教育平台的数学解题助手:用 ERPO 替换 Policy-KL 后,训练可保持响应分布探索性,避免过早收敛到低多样性答案,提升复杂题目的准确率。
  • 电商智能客服与导购:对商品咨询、规则解释等场景做 RL 优化时,ERPO 能抑制查询分布漂移,让策略在真实用户问题分布附近稳定更新。

商业价值

  • 降低训练成本:无需额外前向传播,直接集成到 GRPO/PPO/REINFORCE,节省算力。
  • 提升模型质量:实验显示在六个数学推理基准上准确率更高,高温度解码和长程训练下更稳定,减少 reward hacking 导致的体验下降。
  • 减少人工干预:替代需要反复调参的 Policy-KL,使 RL 训练更易维护,加速产品迭代。

与现有工作流的接口

ERPO 作为 drop-in 修改,只需在损失函数中加入 Query-KL 项和查询重加权,不改变数据管道和训练框架。可在现有 RLHF/RLVR 代码库中直接替换正则化器,兼容 PPO/GRPO/REINFORCE。对于已经上线 RL 训练的团队,可低成本验证 ERPO 在自身数据上的稳定性收益。

局限

  • - 实验仅在六个数学推理基准上验证,任务类型较为单一。数学推理的查询分布通常简短、结构明确,而真实应用中的查询(多轮对话、代码生成、开放域问答等)分布更复杂。ERPO 依赖 **Query-KL** 对查询似然的估计,在处理变长上下文、多模态输入或非参数化查询分布时可能失效。需要更广泛的任务验证才能证明其通用性。
  • - **QKL** 正则化依赖于参考模型对查询似然的准确估计。若参考模型本身与目标分布偏差较大,或查询空间巨大导致似然估计方差高,则正则化方向可能误导训练。此外,该方法未直接约束响应侧漂移,当奖励函数存在漏洞时,策略可能通过选择高奖励但分布异常的查询来获得收益,导致查询分布坍缩或 reward hacking,需进一步机制防止。
  • - 相较标准 **Policy-KL**,ERPO 缺少与其他稳定性技术(如 trust region 约束、adaptive KL、clip 范围调整)的系统对比。虽然替换 Policy-KL 后效果提升,但未证明其优于所有现有稳定方法。在实际工程中,ERPO 可能需要额外维护参考模型和缓存查询概率,对内存和计算基础设施有额外要求(尽管作者声称零开销,但需进一步验证)。
论文Xianlei Zhou2026-08-24原文

相关内容