论文

DVAO: Dynamic Variance-adaptive Advantage Optimization 用于多奖励强化学习

DVAO: Dynamic Variance-adaptive Advantage Optimization 用于多奖励强化学习

强化学习已成为将大型语言模型与人类意图及任务需求对齐的标准范式。Group Relative Policy Optimization (GRPO) 作为 Proximal Policy Optimization (PPO) 的高效无值模型替代方案,在适应实际多奖励场景时仍面临挑战。标准标量化方法如 Reward Combination 和 Advantage Combination 存在显著缺陷:前者常产生平方幅度过大的优势,导致训练不稳定;后者依赖静态超参数,忽略跨目标相关性。 为解决这些问题,我们提出 Dynamic Variance-adaptive Advantage Optimization (DVAO),该方法基于经验奖励方差动态调整各目标的组合权重,有效增强强学习信号的目标,同时抑制噪声目标。我们数学证明 DVAO 能维持有界的优势幅度以确保训练稳定,并引入自适应跨目标正则化机制。 在数学推理和工具使用基准上,使用 Qwen3 和 Qwen2.5 模型的广泛实验表明,DVAO 显著优于基线方法,实现了更优的多目标 Pareto 前沿 和鲁棒训练稳定性。

论文精读

TL;DR DVAO 依据经验奖励方差动态调整优势权重,解决多奖励 RL 训练不稳定,实现稳定训练与更优多目标性能。

问题

问题背景

基于人类反馈的强化学习(RLHF)已成为对齐大语言模型的关键范式,Group Relative Policy Optimization (GRPO) 等免价值模型的方法因高效而受关注。然而,实际场景常需同时优化多个奖励目标(如帮助性、安全性、准确性),多奖励强化学习的稳定训练仍是一个开放挑战。

现有方法局限

标准的多目标标量化做法存在明显缺陷:

  • Reward Combination (RC):在奖励层面加权求和后计算优势,易产生优势平方幅值过大的问题,导致训练梯度爆炸或不稳定。
  • Advantage Combination (AC):在优势层面分别归一化后组合,但依赖固定的、手动设定的组合权重,无法适应训练过程中的奖励分布变化,且完全忽略不同目标间的相关性,导致优化信号次优。

总之,RC 引入数值不稳定,AC 则过于刚性,未能动态权衡各目标的学习强度。

为什么这个问题难且重要

多目标强化学习的核心难点在于如何动态平衡不同奖励信号:不同目标的奖励方差、学习难度和噪声水平差异巨大,静态权重或简单线性组合难以在全训练周期内保持有效。业界对 RLHF 的关注正从单目标向多目标对齐演进,如同时优化指令遵循、事实性和推理能力,因此亟需一种能自适应调节、且数学上保证训练稳定性的多目标策略。缺乏这种机制,训练极易陷入某一目标主导或优化震荡。

行业类比

类似自动驾驶系统中需同时权衡安全、舒适与效率,固定权重无法应对动态场景,自适应多目标优化同样是工业级 RLHF 落地的关键需求。

核心洞察

  • **动态方差加权解决了多奖励 RL 训练中优势幅度爆炸的问题**:标准 Reward Combination 在优势计算时导致平方项过大,而 DVAO 通过使用各目标在 rollout 组内的经验方差作为权重,对学习信号强的目标给予更高权重,同时抑制噪声目标,并理论上证明了优势幅度有界,从而保证训练稳定。这一做法无需像 Advantage Combination 那样依赖静态超参数,且能自动适应训练动态。
  • **方法隐含自适应跨目标正则化,提升多目标 Pareto 最优性**:DVAO 的方差自适应机制不仅稳定训练,还在数学上等价于一种跨目标正则化,通过方差大小调节各目标的影响,鼓励模型在多个维度上共同优化,而非牺牲某些目标。在数学推理和工具使用等复杂任务中,DVAO 实现了超越固定组合策略的 Pareto 前沿,验证了动态加权对平衡多目标的实用性。

方法

输入与组内采样

对每个 query,策略模型采样一组 $K$ 条响应,构成 rollout group。针对 $M$ 个奖励目标,每条响应获得一个标量奖励向量 $\mathbf{r} \in \mathbb{R}^M$。

关键模块:方差自适应权重生成

对每个奖励目标 $j$,在组内计算其经验均值 $\mu_j$ 和方差 $\sigma_j^2$。由于高方差目标通常对应噪声更大、学习信号更弱,DVAO 据此动态设定组合权重 $w_j$,例如 $w_j \propto \exp(-\sigma_j^2)$ 或 $w_j = 1 / (\sigma_j^2 + \epsilon)$,从而压制高方差目标、提升低方差目标贡献。随后,按 GRPO 方式为每个目标单独计算组归一化优势 $A_{i,j}$,再通过加权得到综合优势: $$A_i = \sum_{j=1}^M w_j \cdot A_{i,j}$$

输出与理论保障

  • 稳定化优势:加权后的优势经证明具有有界幅值(见论文 Proposition 1),解决了 Reward Combination 中优势平方和过大致使训练发散的问题。
  • 自适应跨目标正则化:在损失函数中引入由 $w_j$ 加权的策略一致性项,促使策略在不同奖励维度间获得更均衡的帕累托提升(Proposition 3)。
  • 最终,将 $A_i$ 带入 GRPO 的 clipped surrogate objective 进行策略更新。

与同类方法的差异

  • 相比 Reward Combination:不在奖励空间直接相加(易放大方差),而在优势空间动态加权,且权重随方差变化自适应调整。
  • 相比 Advantage Combination:彻底摆脱对固定超参数(如各目标奖励权重)的依赖,并利用方差信息隐式建模目标间相关性,实现更鲁棒的多目标训练。

实验

实验设计

DVAO 在数学推理工具使用两类多目标 RL 场景下进行评估,使用 Qwen3Qwen2.5 作为基座模型。对比基线包括奖励组合(Reward Combination)和优势组合(Advantage Combination)两种主流标量化方法,重点考察训练稳定性、最终性能以及帕累托前沿(Pareto frontier)的完备性。

关键发现

  • DVAO 在所有基准上均显著超越基线,收敛至更优的多目标帕累托前沿,表明其自适应权重机制能有效平衡不同目标的学习信号。
  • 训练过程中,DVAO 的优势幅度稳定可控,未出现奖励组合中常见的优势值爆炸(exploding advantages)现象,验证了方差自适应正则化的有效性。
  • 在噪声目标存在时,DVAO 自动压低其权重,凸显有强学习信号的目标,从而提升整体训练鲁棒性。

与基线的深度对比

奖励组合直接对多个奖励加权求和,但易使优势的平方幅度过大,导致策略更新震荡甚至崩溃;优势组合虽在优势层面组合,却依赖固定的超参数且忽视目标间相关性。DVAO 在每个 rollout group 内依据各目标的经验奖励方差(empirical reward variance)动态调整组合权重,既保持了优势的有界性(数学证明),又引入了自适应的跨目标正则化,本质上解决了标量化过程中信号冲突方差失衡问题。这种无超参数依赖的自适应特性使其在复杂多任务对齐场景中更具工程实用性。

行业影响

落地场景

DVAO 为多目标强化学习在大语言模型对齐中的工业部署提供了一种训练稳定、避免手动调参的方案。尤其适用于需要同时优化多个质量指标的 LLM 应用,例如:

  • 对话助手:同时优化帮助性、安全性、流畅度等奖励信号。
  • 代码生成:兼顾功能正确性、执行效率、代码风格。
  • 内容审核:平衡准确率、召回率与公平性。

商业价值

  • 降低训练成本:通过自适应权重调整,避免因奖励组合不当导致的训练崩溃,减少试错所需的反复实验,节省 GPU 时间和人力调参开销。
  • 提升产品体验:在多个维度上获得更优的帕累托前沿,意味着可以在不牺牲某一目标的前提下提升整体性能,例如在保证安全合规的同时提高回答的有用性,直接改善用户满意度。
  • 加速模型迭代:DVAO 可作为一个即插即用的多奖励优化组件,无需为每个新任务重新设计复杂的奖励工程,缩短从研究到上线的周期。

与现有产品/工作流的接口

DVAO 可无缝集成到基于 GRPO 或 PPO 的 LLM 对齐流程中,仅需替换奖励组合方式。具体接口:

  • 奖励函数定义:保持现有各目标奖励函数不变,DVAO 根据每个 rollout group 内的经验方差动态计算组合权重。
  • 训练框架:可嵌入 OpenRLHF、DeepSpeed-Chat 等开源 RLHF 框架,在 advantage 计算步骤前插入权重自适应逻辑。
  • 超参数:去除了 Reward Combination 或 Advantage Combination 的静态系数,仅保留方差估计窗口等少量新增参数,降低配置复杂度。

具体用例

  1. 电商平台智能客服:需同时优化解决率、用户满意度、响应合规性。DVAO 可在训练中自动捕捉各指标信号强度,例如当合规性方差显示模型对此目标学习不充分时,自动加大其权重,最终上线后客服解决率提升且风险率下降。
  2. 企业级知识库问答:要求回答准确、全面且引用格式规范。使用 DVAO 训练后,模型在引用准确率与内容覆盖度之间取得更好平衡,避免传统固定权重下过度优化某一指标导致另一指标退化。

局限

  • **方差估计对小批次敏感**:DVAO 的动态权重完全依赖 rollout group 内的经验奖励方差,当每条 prompt 的采样数较少(例如 GRPO 中常见的 small group size)时,方差估计可能极不稳定,导致权重剧烈波动,反而引入新的训练噪声。论文未讨论不同 group size 下的鲁棒性实验,也未提供应对小批次场景的补偿策略(如贝叶斯平滑或先验正则)。
  • **任务与奖励类型有限**:实验仅在数学推理(MATH、GSM8k)和工具调用(ToolBench)两类任务上验证,奖励函数均为规则化/可自动评估的标量(如答案正确性、API 调用正确性),缺乏对开放式文本生成、人类偏好评分等多模态或主观奖励的探索。因此,当奖励分布具有不同尺度、相关性和动态范围时,DVAO 的自适应机制是否仍能保持优势尚不明确。
  • **理论假设与实际差距**:Proposition 1–3 的证明基于奖励分布独立且方差可精确估计的假设,但真实多奖励 RL 中奖励间常存在相关(如安全性和有用性可能正相关),且经验方差作为点估计会引入偏差。自适应正则化效应(Proposition 3)仅在渐近意义下成立,短期训练中动态权重可能放大个别高方差目标的梯度,造成策略坍缩。作者未分析该机制在非平稳训练早期的行为。
论文Guochao Jiang2026-05-25原文

相关内容