论文

学习未掌握的部分,而非已精通的部分:多奖励策略优化中的饱和感知优势重加权

学习未掌握的部分,而非已精通的部分:多奖励策略优化中的饱和感知优势重加权

基于组相对优势的强化学习已成为语言模型推理器后训练的事实标准。然而,当优化多个奖励目标时,现有方法通常先在组内标准化之前,以固定加权和将奖励向量标量化。我们表明,这种设计导致两个根本问题:具有不同奖励分布的rollout可能获得相同的优势,并且所有目标都以固定相对权重进行优化,而不管其当前的饱和程度。结果,训练继续将梯度预算分配给已解决的目标,而不是集中在那些具有更大剩余空间的目标上。 我们引入了SA-MRPO(Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization),它独立标准化每个奖励目标,并根据批量级的目标饱和估计自适应地折扣其贡献。这动态地将优化工作重新分配给未充分优化的目标,同时经验上保持已很好满足的目标的性能。我们进一步表明,饱和感知重加权可以反转更新的符号,而不仅仅是重新缩放其幅度。 在数学推理方面,使用两目标和三目标奖励组合,与GDPO相比,SA-MRPO在15个基准比较中的12个上提高了较难的正确性目标,在AIME24上增益高达5%。在自适应推理上,它提高了所有五个基准的准确率,平均提高3.8%,在AMC23上最高达9.2%;在编程基准上,它提高了高达2.3%的通过率,而在所有设置中,较容易的目标保持在其已满足的水平附近。

论文精读

TL;DR SA-MRPO 对多奖励目标独立标准化,按批次饱和度自适应折扣优势,将梯度预算从已饱和目标转向尚有上升空间的目标,避免固定权重标量化下的优化浪费。

问题

问题背景:当前 RLVR 与 group-relative advantages 已成为后训练语言模型推理器的标准范式,但多奖励目标组合时,如何分配梯度预算仍是一个开放问题。

现有方法局限:常见做法是先将奖励向量用固定权重标量化,再做组内标准化。这带来两个技术缺陷:

  • 不同 reward profile 的 rollout 可能获得相同的 advantage,削弱奖励信号对策略的区分能力;
  • 所有目标始终以固定相对权重更新,无论其是否已经饱和,导致已解决任务继续占据梯度,而欠优化目标得不到充分训练。

为什么难/重要:多奖励目标之间难度和饱和速度差异大,静态权重无法感知 batch 级饱和度;仅重缩放 advantage 幅度往往不够,某些情况下需要反转更新符号才能把优化重心从已饱和目标转移。在数学推理、自适应推理、代码生成等场景中,正确性硬指标与格式/长度等软指标组合时,这种动态重加权对算力效率和最终性能影响明显。

行业类比:类似多任务学习中 GradNorm 或 uncertainty weighting 动态调整各任务损失权重,SA-MRPO 将动态加权思路引入 RLVR 的 group-relative advantage 计算,解决“已学会的不再学”问题。

核心洞察

  • 在多奖励策略优化中,固定权重标量化后做 group-wise 标准化会导致不同奖励轨迹获得相同优势,且已饱和的目标持续占用梯度预算。SA-MRPO 的核心洞察是将每个奖励目标独立标准化,并用 batch 级饱和估计自适应折扣其贡献,从而动态重分配优化信号到仍有提升空间的目标。其独特之处在于不仅缩放梯度幅度,还能反转优势符号、改变更新方向,这区别于仅调整权重的动态多目标方法。
  • 这项工作揭示多目标 RLVR 中饱和本身是一个易得且有效的调度信号:通过 batch 内各目标的达成率估计饱和程度,无需额外模型或复杂元学习即可引导训练重点。与基于梯度冲突、帕累托前沿或约束优化的方法相比,SA-MRPO 直接操作 advantage 而非奖励标量,计算开销低,可直接嵌入现有 GRPO 流程,并在数学、自适应推理和编程任务上普遍提升困难指标,同时保持简单指标不退化。

方法

输入与总体流程

SA-MRPO 的输入为每个 rollout 的多目标奖励向量,例如数学推理中的 正确性 与 格式规范 两个奖励。与传统方法(如 GDPO)先对奖励向量做固定加权和再执行 group-wise 标准化不同,SA-MRPO 直接对每个奖励目标独立进行标准化,得到各目标的相对优势。

关键模块:饱和感知优势重加权

核心创新在于 饱和感知重加权(Saturation Aware Advantage Reweighting)。对于每个奖励目标,算法在 batch 内估计其 饱和程度:若某个目标在当前 batch 中大多数样本都已获得高分,则该目标被认为接近饱和,其对应的优势项会被自适应地 折扣;相反,对于仍有较大提升空间的目标(即 batch 内得分较低、方差较大),其优势贡献被保留甚至放大。

具体地,SA-MRPO 为每个目标计算一个 饱和系数,该系数基于 batch 内该目标的得分分布(例如平均分或高分比例)。优势项由原始标准化优势乘以该饱和系数得到,然后所有目标的加权优势求和,形成最终用于策略更新的总优势。

输出与符号反转特性

最终输出是一个标量优势值,用于计算策略梯度并更新语言模型策略。值得注意的是,饱和感知重加权不仅改变更新幅度,还可以反转更新方向:当某个已饱和目标的优势会促使策略偏离其他未饱和目标时,折扣系数可能使该目标的贡献变为负值,从而在总优势中抵消,让优化重心完全转移到未饱和目标上。

与同类方法的差异

与 GDPO 等固定权重标量化方法相比,SA-MRPO 动态调整各目标的相对权重,并根据 batch 级饱和估计将梯度预算从已解决目标重新分配给仍欠优化的目标,因而在保持易达标目标性能的同时,显著提升较难目标的最终表现。

实验

实验设计

SA-MRPO 在数学推理、自适应推理、代码生成三类任务上评估,与 GDPO 基线对比。数学推理使用 2 和 3 目标奖励组合,包括 AIME24 等基准;自适应推理包含 AMC23 等 5 个基准;代码生成使用通过率指标。

关键发现

  • 数学推理:15 个基准比较中 12 个优于 GDPO,AIME24 提升高达 +5%。
  • 自适应推理:所有 5 个基准平均提升 +3.8%,AMC23 最高提升 +9.2%。
  • 代码生成:通过率最高提升 +2.3%。
  • 容易目标保持接近已满足水平。

与基线对比解读

SA-MRPO 独立标准化每个奖励目标并自适应折扣饱和目标,动态重分配优化预算,不同于 GDPO 的固定加权求和后组标准化。该方法能够反转更新符号,而非仅缩放幅度,从而集中优化欠优化目标。在难目标(正确性)上显著提升,同时不牺牲已掌握目标,验证了饱和感知优势重加权的有效性。

行业影响

落地场景

在多目标 RLVR 后训练中,SA-MRPO 适用于需要同时优化多个奖励信号的 LLM 产品:如 代码助手 需兼顾代码正确性、风格规范、运行效率;数学辅导产品 需平衡最终答案正确性、解题步骤可读性、格式合规;企业级 Agent 需协调任务完成度、安全合规、响应长度。这些场景常见“简单目标已饱和、困难目标欠优化”的问题,SA-MRPO 可动态重分配梯度预算。

商业价值

主要降本增效:避免对已饱和目标继续投入算力,减少无效训练步数;无需人工频繁调整多奖励权重,降低调参成本。在论文实验中,SA-MRPO 在数学推理 AIME24 上正确率提升最高 5%,在自适应推理五个基准平均提升 3.8%,代码生成 pass rate 最高提升 2.3%,同时保持简单目标不退化。对模型厂商而言,这意味着在同等训练资源下,将能力提升集中在用户最关心的困难指标(如复杂推理准确率),可提升产品竞争力与付费转化。

与现有工作流接口

SA-MRPO 可作为 优势计算模块 插入现有 RL 训练栈(如 TRL / OpenRLHF / veRL)。实现上,将原先对奖励向量加权求和的步骤替换为:独立标准化各目标 → 按批次饱和度计算折扣系数 α_i → 重加权优势。需要暴露的配置项包括饱和度估计窗口、折扣强度超参数。与 GDPO 等固定权重方法相比,它的改动集中在 compute_advantage 函数,不改变策略网络结构或采样流程,迁移成本低。

具体落地用例:某电商平台的智能客服 Agent 同时优化“答案正确性”和“响应长度合规”。早期正确性容易达标,长度控制长期不收敛。使用 SA-MRPO 后,正确性奖励被自动降权,梯度集中到长度控制,最终在不损失正确率的前提下缩短平均响应长度,降低 token 成本。另一用例为 自动驾驶仿真评估模型 同时优化碰撞率、交通规则遵守率、舒适度评分,避免舒适度已达标后继续占用梯度。

局限

  • **批量级饱和估计的敏感性与偏差**:SA-MRPO 的核心是根据当前 batch 内各目标的奖励分布估计饱和程度,并据此自适应折扣优势。这种估计依赖于 batch 的统计特性,当 batch size 较小时,分布估计方差大,饱和系数可能剧烈波动,导致优化方向不稳定。此外,若 batch 中某一目标长期处于低饱和状态(如数据分布偏离),其优势权重将被持续放大,可能过度聚焦于该目标而忽略其他目标的重要性,甚至造成训练失稳。论文尚未分析 batch size 对饱和估计精度的影响,也缺乏相应的鲁棒性验证或自适应调整机制。
  • **实验覆盖领域与奖励组合有限**:验证集中在数学推理、自适应推理和代码生成三个领域,使用的奖励目标多为正确性、格式等可验证信号。真实生产环境中的多奖励 RLHF 常包含不可直接验证的人类偏好、安全性等目标,其奖励分布和饱和特性可能与这里使用的规则奖励存在显著差异。此外,论文只对比了 GDPO 一个主要基线,未与其他动态权重调整方法(如 Pareto 优化、基于不确定度的加权)进行系统比较,因此 SA-MRPO 的泛化优势和相对增益幅度在更广泛的基准中尚未得到充分证明。
  • **独立标准化与重新加权可能改变原始目标优先级设定**:SA-MRPO 根据饱和程度动态调整各目标的贡献,虽然有利于引导优化资源向未饱和目标倾斜,但这种自动重分配可能违背预设的奖励权重意图。例如,一个任务设计者可能希望某个目标始终保持较高的优化优先级,即使它在当前 batch 中已经饱和(如安全约束必须绝对满足)。SA-MRPO 的机制没有提供保留最小权重或硬约束的选项,可能在某些应用场景中导致关键目标的退化。论文未讨论如何与外部优先级约束结合,这限制了其在需要严格多目标平衡场景下的直接适用性。
论文Yixuan Wang2026-08-17原文

相关内容