让稀疏奖励发挥作用:面向多奖励 RL 的密度感知奖励聚合
多奖励强化学习(multi-reward RL)旨在训练大语言模型同时满足多个行为目标。GDPO 中采用的按奖励归一化(reward-wise normalization)能在 rollout 组内保留各奖励的相对信息,但不同目标的学习进度仍可能不均衡。 本文通过 advantage energy 研究该现象,即某奖励在一个 batch 上平方优势之和。在理想化的 GDPO 归一化下,该能量与 active-group density(该奖励能提供非零相对优势的 rollout 组占比)成正比。这揭示了 batch 层面残留的信号不平衡,并为校准各奖励的贡献提供了依据。 据此,作者提出 Density-Aware Reward Aggregation (DARA):推导出逆平方根密度校正,为不常激活的奖励信号赋予更大权重。DARA 的权重由每个 rollout batch 直接计算,可在训练全程随奖励活跃度变化自适应调整,且不修改底层的策略优化目标。 在 tool calling 与数学推理 任务上的实验表明,DARA 比 GDPO 更快学到目标行为:tool calling 中达到高格式合规率最多减少 26% 训练步数,数学推理中达到接近饱和的长度合规最多减少 65% 步数,同时最终性能仍具竞争力。代码已开源于 https://github.com/zhaihaotian/DARA。
论文精读
TL;DR 多奖励 RL 中稀疏奖励信号易被淹没;DARA 用逆平方根密度校正动态加权稀疏奖励,不改优化目标即可加速收敛,最多减少 65% 训练步数。
问题
问题背景
多奖励强化学习 (multi-reward RL) 正成为大语言模型对齐与能力扩展的关键路径,业界关注如何同时优化多个行为目标,例如 工具调用 中的格式合规与参数正确,或 数学推理 中的答案准确与推理长度合规。
现有方法局限
以 GDPO 为代表的 reward-wise normalization 方法在每个 roll-out group 内对奖励分别归一化,保留了奖励特定的相对信息。然而,不同目标的学习进度仍然不均衡。本文通过 优势能量 (advantage energy) 分析揭示:在理想化 GDPO 归一化下,每个奖励的能量正比于其 活跃组密度 (active-group density) ——即该奖励在批次中提供非零相对优势的 group 比例。稀疏奖励(如格式合规)活跃密度低,导致其在批次层面的梯度信号被高密度奖励(如正确性)淹没,即使单组内已做归一化,批次级信号仍存在残余不平衡。
为什么这个问题难/重要
关键挑战在于:稀疏奖励的活跃模式随训练进程动态变化(例如格式合规逐渐饱和,密度上升),而固定权重无法适应。同时,直接修改底层策略优化目标(如 PPO/GRPO)会引入算法复杂度;需要在 不改变优化目标 的前提下,仅基于每个 rollout batch 统计量自适应校准奖励贡献。这对多目标 LLM 训练的效率与稳定性有直接影响,尤其在计算资源受限的情况下,加速收敛意味着更低的试验成本。
行业类比
类似多任务学习中针对不同任务损失进行动态加权,以解决任务间梯度量级不平衡的问题,本工作针对的是多奖励 RL 中稀疏与密集奖励的信号平衡。
核心洞察
- 通过 advantage energy 与 active-group density 的定量关系,揭示了多奖励 RL 学习进度不均的根源在于 batch 内信号密度失衡。不同于 GDPO 等仅做 reward-wise normalization 的方法,DARA 指出即使归一化保留了奖励间相对信息,稀疏奖励在大多数 rollout groups 中优势为零,导致其平方优势能量不足,进而贡献被压低。这一视角将问题从“幅度校准”转向“密度校准”,为多目标强化学习提供了可测量的诊断指标。
- DARA 提出 inverse-square-root density correction,对低频活跃奖励赋予更大权重,且权重从每个 rollout batch 动态计算,不改变底层策略优化目标。相比固定权重的 reward aggregation 或手工调参,DARA 能自动适应训练过程中奖励活跃度的变化,在 tool calling 和数学推理任务上加速收敛,例如格式合规性快 26% 步数、长度合规性快 65% 步数,同时保持最终性能竞争力。
方法
输入与背景
DARA 面向 多奖励强化学习 场景,输入为每个 rollout batch 内各奖励信号的优势值(advantages)。基线方法 GDPO 对每个奖励单独做 reward-wise normalization,以保留组内相对信息,但不同目标的学习进度仍不均衡。
关键模块:密度感知校正
DARA 首先计算每个奖励的 active-group density:在一个 batch 的所有 rollout group 中,该奖励能提供非零相对优势的比例。该密度反映了该奖励在当前 batch 中的“活跃程度”。
基于理论分析,在理想化 GDPO 归一化下,奖励的 advantage energy(batch 内优势平方和)正比于 active-group density。这意味着稀疏奖励(密度低)的能量被系统性压低,导致其梯度贡献不足。
DARA 从每个 batch 动态计算该密度,并对每个奖励的聚合权重施加 inverse-square-root density correction(密度倒数平方根修正),即:
- 低密度奖励 → 权重更高,放大其稀疏但重要的学习信号
- 高密度奖励 → 权重相对降低,避免主导优化
该权重仅作用于奖励聚合阶段,不改动底层策略优化目标(如 GRPO 的损失函数),因此可以直接嵌入现有流程。
输出
加权聚合后的多奖励信号送入策略优化,使模型在保持格式合规等高频稠密奖励的同时,加速学习工具调用正确性、推理长度合规等稀疏目标。
与同类方法的差异
不同于 GDPO 只做 reward-wise normalization、忽略 batch 级密度差异,DARA 显式建模并校准各奖励的活跃密度,在不改变优化器的情况下自适应平衡多目标学习速度。
实验
实验设计
论文在 工具调用 和 数学推理 两个任务上对比 DARA 与 GDPO。工具调用使用 BFCL-v4 协议评估格式合规与下游泛化;数学推理侧重长度合规、准确率等指标。训练过程监控 active-group density,验证密度—优势能量关系,并考察扩展到三奖励和 thinking-oriented 模型的情况。
关键发现
DARA 的 inverse-square-root density correction 为稀疏活跃奖励提供更高权重,有效补偿 batch-level 信号不平衡。工具调用任务中,达到高格式合规的训练步数最多减少 26%;数学推理中,达到近饱和长度合规的训练步数最多减少 65%。最终性能保持 competitive,未牺牲准确率。
与基线的对比解读
GDPO 的 reward-wise normalization 保留了组内相对信息,但不同目标的 active-group density 不同,导致优势能量在 batch 内分布不均。DARA 从理论推导出密度与优势能量的比例关系,据此动态校准各奖励贡献,且不修改底层策略优化目标。相比固定权重消融,这种随训练动态调整的密度感知聚合能更均衡推进多目标学习,加速稀疏奖励对应行为的收敛。
行业影响
落地场景
多奖励 RL 正成为 LLM 对齐的主流方式,DARA 适合需要同时优化多个行为目标的场景:电商客服机器人需兼顾格式合规、事实正确、安全合规;工具调用 Agent 需同时优化函数选择、参数格式、执行链路;教育解题模型需平衡答案正确与步骤可读。DARA 对稀疏出现的奖励信号(如格式违规、长度违规)自动加权,能加速此类行为的收敛。
商业价值
核心价值在降本增效。DARA 在工具调用上减少最多 26% 训练步数,在数学推理上减少最多 65% 步数,直接节省 GPU 算力与迭代时间,缩短模型上线周期。此外,多目标均衡可降低线上格式错误率,减少后续人工修复及客诉成本,提升用户体验。
与现有工作流接口
DARA 作为奖励聚合模块可无缝嵌入 GDPO 等多奖励 RL 流程,不改动底层策略优化目标,只需在每个 batch 计算 active-group density 并调整奖励权重,计算开销极低。可与 TRL、OpenRLHF 等 RLHF 基础设施集成,作为自定义 reward aggregation 层。
具体 use case:企业服务平台的 API 调用 Agent 需同时优化工具选择和 JSON 格式合规,格式奖励稀疏,DARA 可加速达到高格式合规率;在线教育数学辅导模型需同时满足解题正确和步骤长度限制,长度奖励稀疏,DARA 可显著减少达到长度合规所需的训练步数。
局限
- 方法高度依赖 active-group density 的估计精度。DARA 根据每个 rollout batch 中 reward 提供非零相对优势的组比例计算权重,当 batch size 较小或 reward 高度稀疏时,密度估计的方差会显著增大,导致权重在训练间剧烈波动,可能破坏优化稳定性。论文未在小 batch 或更极端稀疏场景(如单一正确动作)下做鲁棒性测试。
- 实验覆盖的任务类型有限。仅在 tool calling 和 mathematical reasoning 两个偏结构化输出的任务上验证,评价指标集中于格式合规和长度合规,对文本生成多样性、语义质量等更复杂维度缺乏考察。密度感知的权重调整是否适用于开放域对话、摘要等自由文本生成任务,仍需进一步验证。
- 与同类多奖励聚合方法的对比不足。论文主要与 GDPO 作为 baseline 比较,缺少与 scalarization、不同归一化策略或基于偏好学习的多目标 RL 方法的系统对比,难以全面定位 DARA 的贡献边界。此外,方法只测试了 binary reward 设置,对于连续奖励函数(如 BLEU 分数)的推广性未讨论。