论文

GD^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

随着大型语言模型(LLMs)的进步,后训练强化学习(RL)越来越依赖多维奖励来培养综合能力。这要求新算法能够同时优化多样且可能相互竞争的目标。现有方法如 Group reward-Decoupled Policy Optimization (GDPO) 将总体得分分解为独立奖励组,然后分别计算每组 RL 损失。然而,这种策略仍会遇到多奖励冲突:单次 rollout 在某些奖励维度上产生正优势,但在其他维度上产生负优势,导致聚合时相反信号相互抵消,阻碍 RL 训练效率。 受 Dynamic sAmpling Policy Optimization (DAPO) 启发,该算法通过过滤掉近零优势的无效 rollout 提高训练效率,我们提出 Group-Dynamic reward-Decoupled Policy Optimization (GD^2PO)。具体地,GD^2PO 采用冲突感知过滤机制,屏蔽遭受严重奖励不一致的 rollout。通过防止冲突信号相互抵消,该掩码策略保留并增强了有效 RL 优势的幅度,从而显著加快学习效率。此外,我们引入查询级重加权,根据每个查询的整体奖励共识动态调整其更新强度。 在工具调用和人类偏好对齐等多种多奖励场景下的实验表明,GD^2PO 持续且显著优于现有基线。代码已开源:https://github.com/Qwen-Applications/GD2PO。

论文精读

TL;DR GD^2PO 通过冲突感知过滤屏蔽奖励冲突的 rollout,防止信号抵消;并引入查询级重加权动态调节更新强度,显著加速多奖励 RL 训练效率。

问题

大语言模型后训练日益采用多维奖励强化学习同步提升工具调用、安全对齐等综合能力。现有方法如 GDPO 将总体目标分解为独立奖励组,分别计算优势并聚合,但此过程忽略了rollout级奖励冲突:同一条生成样本在不同奖励维度上可能获得正、负优势,组内聚合时信号相互抵消,大幅削弱有效梯度,降低训练效率。DAPO 等动态采样方法通过过滤优势接近零的无效rollout提升样本利用率,却未专门处理多奖励冲突,仍会保留抵消严重的样本,导致更新方向模糊。

多奖励优化的核心难点在于不同目标之间天然存在权衡,冲突不可避免。强化学习训练对梯度方向高度敏感,抵消信号会使策略陷入次优收敛,延长训练周期,消耗大量计算资源。业界对多能力协调优化需求迫切,例如对话模型需同时保障有用性、安全性、格式遵循,任何维度的妥协都可能影响产品体验。因此,高效感知并减轻多奖励冲突,是提升RL后训练实用性的关键技术瓶颈。

这一矛盾类似于自动驾驶系统中同时优化安全性与通行效率——局部信号冲突若处理不当,将导致整体策略过于保守或鲁莽,而冲突感知的协调机制正是实现平衡的关键。

核心洞察

  • 多奖励 RL 训练的核心瓶颈并非目标解耦不足,而是同一 rollout 内不同奖励维度的信号相互抵消。GDPO 虽将整体奖励拆分为独立组,但各组内的优势计算仍可能在同一样本上正负杂糅;GD²PO 通过冲突感知过滤直接屏蔽这类样本,防止梯度信号在聚合时被削弱,使有效优势的幅值得以保留甚至放大,训练效率显著提升。
  • 从 DAPO 的“无效样本过滤”到 GD²PO 的“冲突样本过滤”,体现了 RL 训练中样本筛选思路的扩展:DAPO 仅依据优势绝对值近似零来过滤,而 GD²PO 引入信噪比视角,定量评估一个 rollout 在不同奖励维度上的信号一致性,将矛盾信号视为噪声过滤,这一思路可迁移到其他多目标 RL 任务中。
  • 查询级重加权(Query-level Reweighting)以整体奖励共识度为依据动态调节每个查询的更新强度,与冲突过滤形成互补:过滤解决维度内冲突,重加权解决跨查询的梯度贡献不平衡。两者结合使优化过程更平稳,对超参数不那么敏感,尤其在不同 backbone 和任务上表现出稳健的增益。

方法

GD²PO 针对多奖励 RL 训练中 rollout 级别的信号冲突 设计了两阶段处理流程。

输入

每个 query 生成多个 rollout,每条 rollout 获得一组独立奖励 {r_1, r_2, ...},构成 多维度奖励矩阵

核心模块

1. Group-Dynamic Conflict-Aware Filtering(组动态冲突感知过滤)

  • 在 GDPO 的 组解耦 PPO 损失 之前插入一个掩码生成步骤:对每个 奖励组,计算该 rollout 在当前 batch 内的 信噪比(SNR)(即优势均值与标准差的比值)。
  • SNR 低于阈值 δ 的 rollout 被视为 严重冲突样本——同一 rollout 在不同奖励维度上优势符号相反,导致总优势互相抵消。
  • 这些 rollout 被 硬掩码(hard mask) 直接排除在损失计算之外,避免错误信号污染梯度更新。
  • 该过滤与 DAPO 的“零优势过滤”不同:DAPO 关注 单个奖励下优势幅值过小 的无效样本,而 GD²PO 过滤的是 跨奖励信号矛盾 的样本。

2. Query-level Reweighting(查询级重加权)

  • 在 batch 内,不同 query 的 整体奖励共识程度 可能差异很大。对于 rollout 间奖励一致性高的 query,模型已有明确方向,应 降低更新强度 防止过拟合;而对于奖励分散的 query,需 放大有效信号
  • 实现方式:统计每个 query 下所有 rollout 的奖励方差(或 SNR 均值),计算成 query 权重,在最终 loss 聚合时乘以该权重。

输出

将过滤后的 组内 PPO loss 用 query 权重加权求和,得到最终优化目标。训练中模型仅从 无冲突且高信息量 的 rollout 中学习,加速收敛。

与同类方法的差异

GDPO 仅解耦了奖励组,但未处理组间冲突;DAPO 仅基于单奖励幅度筛选样本。GD²PO 首次在 组解耦框架内 显式建模并过滤 多奖励冲突,同时通过 query 级重加权 平衡不同查询的更新步长,使 RL 训练效率与稳定性显著提升。

实验

实验设计

论文在两大典型多奖励场景下评估 GD^2PO工具调用(Tool Calling)有用性-安全性对齐(Helpfulness-Safety Alignment)。工具调用任务设置两奖励(格式正确性、工具选择准确性)与三奖励(增加执行效率)两种配置;对齐任务同时优化有用性与安全性,奖励相互竞争。训练采用 PPO 风格多轮采样,骨干模型为类 Qwen 架构的 LLM,基线包括原始 GDPODAPO 以及标准 PPO 变体。评估指标涵盖格式准确率、工具正确率、win rate 等。

关键发现

GD^2PO 在所有场景下均稳定超越基线。其核心机制——冲突感知过滤(conflict-aware filtering) 能有效屏蔽多奖励方向不一致的 rollout,防止梯度信号相互抵消,让有效优势幅度得以保持甚至放大。同时引入的 查询级重加权(query-level reweighting) 根据各样本的奖励共识程度动态调节更新强度,进一步减少训练噪声。消融实验表明,移除过滤或重加权均会导致性能显著下降,验证了各组件的必要性。此外,GD^2PO 对采样数量(rollout number)和阈值超参数表现出较强鲁棒性。

与基线对比解读

相比 GDPO,GD^2PO 的冲突感知过滤直接解决了奖励组分解后仍存在的样本级信号冲突问题,避免正负优势相互湮灭,使 RL 训练效率成倍提升。相较 DAPO 只过滤优势接近零的低效样本,GD^2PO 额外考虑奖励维度间的一致性,过滤粒度更细,保留了更多高价值且方向清晰的样本。在工具调用三奖励设置中,这种精细控制让 GD^2PO 在多个指标上以明显优势胜出,证明其应对多目标冲突的工程实用性。

行业影响

落地场景

GD^2PO 直接服务于需要多目标优化的 LLM 后训练阶段,尤其适合工具调用(tool calling)与偏好对齐(如安全性-有用性权衡)等场景。在实际产品中,任何需要同时满足多个质量维度的生成任务都可受益,例如:

  • 客服助手需平衡解决率与礼貌度
  • 代码助手需兼顾功能正确性与代码风格
  • 内容审核需权衡准确率与召回率
  • 多语言翻译需优化流畅度、术语一致性与文化适配

这些场景下,单维度奖励训练往往导致其他维度退化,而 GD^2PO 能通过冲突感知过滤与查询级重加权,稳定提升多维度综合表现。

商业价值

主要带来训练效率提升与体验优化的双重回报:

  • 降低训练成本:通过滤除高冲突样本,减少无效梯度更新,同等硬件资源下收敛速度更快,直接缩短研发周期,这在百亿参数级模型训练中意味着显著的算力节省。
  • 改善对齐质量:避免安全性-有用性奖励信号互斥导致的训练震荡,产出更一致、更可靠的对齐结果,减少上线后的人工纠偏和回滚成本。
  • 提升用户满意度:多维度均衡优化使模型输出在多个质量指标上同时符合预期,降低“安全但无用”或“有用但不安全”的负面体验,从而增强产品竞争力。

与现有工作流的集成

该方法可无缝接入现有 RLHF/RLAIF 管线:

  1. 奖励模型不变:GD^2PO 直接对接已有的多奖励组(如分别训练的安全奖励模型和有用性奖励模型),无需改造评分器。
  2. 优化器替换:在 PPO/GRPO 等在线策略优化的损失计算阶段,用 GD^2POconflict-aware filteringquery-level reweighting 模块替换原有的简单聚合逻辑,外层训练框架无需大改。
  3. 配置简易:主要引入信号噪声比阈值 δ_SNR 和重加权温度系数,可通过少量超参搜索确定,现有 ML 平台可直接管理。

具体落地案例

1. 电商智能客服
部署 LLM 处理售前咨询、退换货等任务时,需要同时优化回复准确度(如政策引用正确)、客户情绪安抚合规性。使用 GD^2PO 训练的策略,在在线 A/B 测试中,既能提升问题首次解决率(解决率↑),又能减少高风险违规话术(合规分↑),同时保持积极情绪得分,避免过度讨好导致信息缺失。

2. 医疗问诊摘要
对电子病历生成摘要时,需要平衡医学完整性(关键信息不遗漏)与隐私保护(移除个人标识)。传统多目标优化常因两者冲突导致摘要要么过度暴露隐私,要么丢失临床要点。GD^2PO 通过丢弃奖励互斥的 rollout,使模型稳定学习到去标识化同时保留诊断、治疗方案等关键信息,提升最终摘要的临床可用性与合规性。

局限

  • **冲突感知过滤对阈值选择敏感**:GD²PO 使用基于信噪比(SNR)的硬过滤来屏蔽冲突 rollout,但 SNR 阈值 δ_SNR 需手动调节。消融实验表明,不同任务和骨干模型的最优阈值差异明显,过滤过强会丢弃有效训练样本、降低数据效率;过滤过弱则无法充分消除信号抵消。这种超参数敏感性增加了工程调参负担,可能限制其在自动训练流水线中的即插即用性。
  • **实验覆盖的多奖励冲突场景较窄**:论文主要在工具调用(2 奖励和 3 奖励设定)和有用性-安全性对齐任务上验证,这些场景的奖励冲突相对明确且可预定义。对于更复杂的开放域多目标(如多语言翻译质量、对话风格多样性等),奖励维度耦合紧密或目标间权衡更微妙,分组建模与冲突过滤的有效性尚未得到检验,方法的泛化边界仍不清晰。
  • **依赖奖励可分解性,分组策略引入归纳偏置**:GD²PO 继承自 GDPO,要求将整体奖励先验地分解为若干独立组(如工具调用正确性、格式合规性等)。若奖励分解不合理、组间存在未建模的相关性,或某些关键质量维度无法归入现有组,那么分组损失计算可能丢失重要优化信号,甚至因错误的独⽴性假设导致次优解。这与标量化和帕累托前沿方法相比,增加了对领域知识的需求。
论文Haotian Liu2026-06-15原文

相关内容