论文

ReSPO:面向离策略学习中梯度饥饿的重塑序列策略优化

ReSPO:面向离策略学习中梯度饥饿的重塑序列策略优化

RLVR(Reinforcement Learning from Verifiable Rewards)常常在多次策略更新中重复使用同一批 rollout,导致当前策略与数据生成策略之间的错配不断加剧。作者识别出裁剪式策略优化中一种依赖符号的梯度饥饿 问题:裁剪机制在低重要性权重尾部抑制了生成不足的正向响应,却允许严重过度生成的负向响应在高权重尾部占据主导。 为此,作者提出 ReSPO(Reshaped Sequence Policy Optimization),用一个平滑的双分支序列级核函数替代裁剪操作,该核函数由 α-divergence 变分目标与指数型方差控制倾斜项推导而来: - 正向分支:为生成不足的正向响应保留非零的梯度权重; - 负向分支:抑制被严重过度生成的负向响应。 实验表明,即便累积的策略漂移把长正向推理轨迹推到低重要性权重尾部,ReSPO 在训练早期仍能有效从中学习。在稠密与 MoE 版本的 Qwen3 模型上,ReSPO 加快了早期优化、提升了最终训练分数,并在 rollout 复用的设定下取得更高的留出基准表现,验证了该工作对离策略学习中重要性权重尾部控制的有效性。

论文精读

TL;DR 针对 off-policy 学习中裁剪策略优化导致的符号依赖梯度饥饿,ReSPO 用 α-散度变分目标导出的平滑双支序列核替代裁剪,保留低权重正样本梯度并抑制高权重负样本,在 Qwen3 上加速早期训练并提升基准性能。

问题

问题背景

RLVR(基于可验证奖励的强化学习)在推理模型训练中广泛采用 rollout 重用 策略,即同一批生成轨迹被多个策略更新周期反复使用。这一做法显著提升了样本效率,但随着策略更新,数据生成策略与当前策略的差异不断累积,off-policy mismatch 成为影响训练稳定性和收敛速度的核心因素。

现有方法局限

以 PPO/GRPO 为代表的 clipped policy optimization 通过裁剪重要性权重来限制更新步长,但其裁剪操作是符号无关的,导致两类梯度饥饿:

  • 正样本梯度饥饿:对获得正奖励但当前策略下生成概率较低的响应(under-generated positives),其重要性权重处于低权重尾部,裁剪后梯度权重被压为 0,模型无法从这些长正轨迹中学习。
  • 负样本梯度失控:对获得负奖励且当前策略下生成概率过高的响应(over-generated negatives),其重要性权重处于高权重尾部,裁剪未能有效抑制其梯度贡献,导致负样本主导更新方向。
    这种符号依赖的梯度饥饿使得训练早期对长正推理轨迹的学习严重不足,同时被负样本带偏。

为什么这个问题难/重要

难点在于:重要性权重分布与优势符号的耦合关系复杂,需要设计一个平滑且不对称的核函数,既要保留对高权重负样本的抑制能力,又要为低权重正样本保留非零梯度信号,同时不能引入过大方差。业界对 RLVR 数据重用的依赖日益加深,梯度饥饿直接限制了长期轨迹的利用效率和最终推理性能,尤其在数学、代码等需要长思维链的任务中影响显著。

行业类比

类似推荐系统中的离线策略评估:重放历史日志时,如果只简单裁剪重要性权重,会完全忽略低曝光但高价值的正反馈物品,同时过度惩罚高曝光负反馈,导致长尾兴趣建模失效。

核心洞察

  • 剪切策略优化中的梯度饥饿具有符号依赖性,正负样本在重要性权重尾部受到不对称抑制。ReSPO 的关键洞察是用双分支平滑核取代统一 clipping,对正轨迹保留低权重尾部的非零梯度,对负轨迹压制高权重尾部。与标准 PPO-style clipping 不同,这种做法显式建模了 off-policy 数据重用下策略漂移导致的权重分布偏移,避免了正样本学习不足和负样本过度主导的双重偏差。
  • ReSPO 的权重重塑核不是启发式设计,而是从 α-散度变分目标和指数倾斜导出,将序列级策略优化转化为 measure change 问题。相比现有重要性采样修正或 clipping 技巧,这一理论框架同时控制梯度方差和尾部行为,并且天然支持双分支解析形式。在 dense 和 MoE Qwen3 上的实验表明,该设计能加速早期优化、提升最终分数,并改善 rollout reuse 下的 held-out 基准表现。

方法

输入

ReSPO 接收离线策略 rollout:序列级优势估计 A_hat、当前策略与数据生成策略的 重要性权重 W,以及每个序列的正/负响应标签。这些输入通常来自多次策略更新后的旧数据,导致 W 分布高度偏斜。

关键模块

梯度饥饿诊断:标准 clipped policy optimization(如 PPO、GRPO)在 W 极低时硬裁剪梯度,导致 under-generated positive responses 完全失去学习信号;同时在 W 极高时未充分抑制 severely over-generated negative responses,使其主导更新。

两分支重塑核:ReSPO 用平滑的序列级核函数替代硬裁剪,分为:

  • 正分支:基于 α-散度变分目标 推导,保留低 W 尾部的非零梯度权重,允许模型从长 positive 推理轨迹中学习,即使策略漂移使其落在低权重区间。
  • 负分支:引入 指数倾斜 控制方差,在高 W 区域强抑制负响应,防止过采样负样本主导梯度。

两个分支均在 log 空间实现以保证数值稳定性,并通过超参数(如 α=2、倾斜系数 λ)平衡偏差与方差。

输出

输出为加权后的序列策略梯度,用于更新当前策略。该梯度对符号和幅度敏感,避免了硬裁剪造成的尾部信号丢失。

与同类方法差异

与 PPO/GRPO 的硬裁剪相比,ReSPO 通过 符号依赖的两分支平滑重塑(而非固定裁剪阈值)精确控制重要性权重尾部,使正负样本的梯度贡献更符合期望偏差-方差权衡。

实验

实验设计:基于 RLVR 流程,在 Qwen3 dense 与 MoE 模型上对比 ReSPO 与标准 clipped policy optimization。采用 rollout reuse 设置,多次策略更新复用同一批轨迹,加剧离策略程度。评估指标包括训练奖励分数与 held-out benchmark(如 DAPO-MATH),并补充长度分层分析与 MoE 路由重放等鲁棒性检查。

关键发现

  • 梯度饥饿缓解:ReSPO 将裁剪替换为平滑双分支序列级核;正分支保留低重要性权重下的非零梯度,负分支通过指数倾斜抑制高权重负样本的过度生成。
  • 长轨迹学习:即使策略漂移使正推理轨迹落入低权重尾部,模型仍能从中获取梯度,加速早期优化。
  • 性能提升:ReSPO 提升最终训练分数与 held-out 性能,特别是在 rollout reuse 场景下。

基线对比解读

标准 clipped PPO 在正样本低权重区域直接裁剪为零,造成有效梯度样本减少;同时负样本高权重区域未被限制,导致方差膨胀。ReSPO 的 α-散度变分核与指数倾斜从机制上平衡了这两个尾部,更适合数学推理等稀疏奖励的离线数据重用。工程上,该方法无需大幅调整训练框架,只需替换重要性权重函数,便于在现有 RLVR 流水线中部署。

行业影响

落地场景

ReSPO 主要针对 RLVR (reinforcement learning from verifiable rewards) 场景,尤其是 rollout 复用导致 off-policy 偏差加剧的 setting。典型产品/业务包括:

  • 数学推理 / 代码生成助手:这类产品依赖长思维链,训练中常大量复用 rollout,且正负样本重要性权重分布极端。ReSPO 能保留低权重但正确的长推理轨迹,减少梯度饥饿,提升模型生成复杂推理步骤的能力。
  • 企业级 Agent 工作流:Agent 执行多步工具调用,最终奖励稀疏且可验证。训练时 replay buffer 中旧策略样本占比高,ReSPO 能抑制过度采样的失败轨迹,同时不丢弃偶然成功的罕见路径。
  • 电商/内容平台的对话式推荐:利用 verifiable reward(如点击、购买)做策略优化,离线数据与在线策略存在漂移,ReSPO 可改善低权重正样本的利用效率,提升推荐多样性与准确性。

商业价值

  • 降本:减少训练所需 rollout 数量与更新轮次,通过更好地利用已有样本(尤其是低重要性权重正样本)提升数据效率,缩短训练时间和 GPU 成本。
  • 提升模型质量:加速早期优化,提高最终训练 scores 和 held-out benchmark 性能,直接改善用户可感知的推理准确率、回答完整度。
  • 稳定训练:指数倾斜控制方差,降低 off-policy 训练中的梯度噪声,减少训练崩溃风险,为大规模生产训练提供可靠性。

与现有产品/工作流的接口

ReSPO 替换的是 policy optimization 中的 clipping 操作,核心是一个 two-branch sequence-level kernel,可以无缝嵌入现有 RLVR 训练框架:

  • 在 OpenRLHF / verl / TRL 等框架的 PPO/GRPO 变体中,将 policy_loss 中的 clip 项替换为 ReSPO 的 kernel,只需在 advantage 归一化和 loss 计算处改动。
  • 与 group-normalized advantages 配合,超参数推导已给出默认值(如 α=2),可直接用于 Qwen3 dense/MoE 等模型。
  • 日志空间实现保证数值稳定,适合混合精度训练。
  • 可保留现有 reward model 与 rollout pipeline,作为 drop-in 模块。

具体 use case:

  1. 代码生成 Agent 训练:某 AI 编程助手用 GRPO 训练模型生成多步代码修改。旧 rollout 中很多正确的长修改路径因策略漂移变成低重要性权重,clip 导致梯度消失。接入 ReSPO 后,模型能继续从这些“低频但正确”的路径学习,提升修复复杂 bug 的成功率。
  2. 数学推理题库优化:在线教育平台的解题模型用 RLVR 强化训练,正样本多为长推理链,负样本短且易过度采样。ReSPO 的负分支抑制高权重负样本,防止模型退化为只输出短答案,保持解题过程完整。

官方开源代码:ReSPO-code,项目主页提供实验配置与推导细节。

局限

  • 方法依赖优势估计和重要性权重的准确性,在高 off-policy 漂移下,重要性权重可能极端,指数倾斜虽能控制方差,但引入的偏差与超参数(α、λ+、λ-)选择强相关。论文给出了超参数选择原则,但未提供自动调参机制,实际部署时可能需要针对不同奖励尺度和任务进行网格搜索,增加工程成本。
  • 实验主要在数学推理任务(DAPO-MATH)和 Qwen3 模型上验证,模型规模未明确披露,可能集中于中小规模。缺乏在代码生成、多轮对话等 RLVR 任务上的验证,且与 GRPO、KTO 等最新基线对比有限,难以全面评估方法在不同任务分布下的鲁棒性。
  • 方法针对 rollout 重用场景设计,但在完全在线或低重用率下是否仍优于标准裁剪未充分研究。双分支核的平滑性可能滤除部分尖锐梯度信号,影响探索效率;同时论文以实验为主,缺乏收敛性理论保证,难以从理论层面证明其对所有 off-policy 场景的普适性。
论文Yihang Chen2026-09-28原文

相关内容