CorrGRPO: 面向多奖励学习的相关性归一化 GRPO
Group Relative Policy Optimization (GRPO) 被广泛用于训练推理语言模型,它通过对同一 prompt 的多次 rollout 的奖励做中心化和归一化来计算优势值。当存在多个奖励时,GRPO 将各奖励分量求和,并用组内标准差对总奖励做归一化。此时方差等于所有成对奖励协方差之和:在中心化奖励固定的情况下,聚合协方差越大优势越小,反之亦然,从而使更新幅度能随奖励间的相关性自适应。但当相关的奖励尺度较大时,它会在归一化中占据主导,压制尺度较小奖励的信号。 为此,我们提出 Correlation-Normalized GRPO (CorrGRPO),将成对协方差归一化为 Pearson 相关系数。CorrGRPO 保持中心化后的总奖励不变,同时平衡不同尺度奖励对基于相关性的归一化的影响,使优势幅度能随奖励相关性自适应,而不再被大尺度奖励分量主导。 我们在 代码生成、工具调用与 agent 安全三类任务上,使用 0.5B 至 8B 参数的模型,将 CorrGRPO 与 GRPO 及其他变体进行对比。这些任务均涉及多个奖励,奖励之间可能同向提升,也可能存在权衡。结果显示三个领域均有提升。代码见 https://github.com/HKUST-KnowComp/CorrGRPO。
论文精读
TL;DR CorrGRPO 把 GRPO 的多奖励协方差归一化改为 Pearson 相关系数,避免大尺度相关奖励压制小奖励信号,在代码生成、工具调用与 Agent 安全任务上稳定提升。
问题
问题背景
多奖励强化学习(RLHF / RLVR)在训练推理型语言模型时广泛采用 GRPO,其优势计算依赖同一 prompt 下 rollout 组的奖励中心化与归一化。
现有方法局限
GRPO 将多个奖励分量直接求和后,按总奖励的组内标准差归一化。该方差等于所有成对奖励协方差之和(论文公式 L.1)。固定中心化总奖励不变时,总协方差越大、计算出的优势幅度越小;反之优势越大。这本身让更新幅度适应奖励依赖性,但存在一个关键缺陷:大尺度奖励分量会产生更大的协方差绝对值,即使其与目标任务的相关性并不更强,也会主导整个归一化分母。结果是,小尺度但重要的奖励信号(如格式正确性、安全约束)被压缩,模型优化方向被单一高方差分量劫持。
为什么这个问题难/重要
多奖励场景中,不同奖励分量的量纲、方差和相关性差异极大,例如代码生成中的正确性与执行效率、工具调用中的格式匹配与参数准确度、智能体任务中的效用与安全。奖励之间既可能共同提升,也可能构成 tradeoff。要设计一种归一化方式,既要保留对相关结构的自适应,又要避免绝对尺度主导,是当前多目标 RLHF 的核心技术挑战之一。业界对稳定、可解释的多奖励优化有强烈需求,因为这直接影响模型在部署后的行为安全与效用平衡。
行业类比
类似多目标推荐系统中,点击率目标的数值远大于时长目标时,直接加权会挤占时长信号;CorrGRPO 相当于把协方差换成 Pearson 相关系数做归一化,让每个目标按其真实关联度而非原始尺度影响模型更新。
核心洞察
- GRPO 多奖励学习中的方差归一化本质上是协方差归一化,且大尺度奖励会通过协方差和主导优势缩放,压制小尺度奖励信号。CorrGRPO 用 Pearson 相关系数替代协方差,解耦了尺度与相关性,使优势幅度只反映奖励间的相关性结构。此前多奖励 RL 方法多关注加权求和或缩放,未从协方差分解的角度解决尺度与相关性耦合导致的归一化偏差。
- CorrGRPO 只修改归一化分母为相关系数,保持中心化总奖励不变,从而在不改变奖励信号的情况下优化优势尺度。该方法与 DAPO、CISPO、GDPO 等现有 GRPO 改进兼容,可叠加使用,在代码生成、工具调用和代理安全等多个多奖励任务中均取得提升,显示出低侵入性和强泛化性。
方法
输入
同一 prompt 的多个 rollout,每个 rollout 生成多个奖励分量(如正确性、格式、安全性等),构成组内奖励向量。
关键模块
- 中心化总奖励:保留 GRPO 的做法,对每个 rollout 的总奖励(各分量之和)减去组内均值,得到中心化总奖励,作为优势的分子。
- 协方差到相关系数的转换:GRPO 的归一化分母是总奖励的标准差,其平方等于所有成对奖励协方差之和。CorrGRPO 将每个协方差除以对应两个分量标准差的乘积,转换为 Pearson 相关系数,从而消除各分量尺度的影响,得到基于相关性的归一化因子。
- 优势计算:优势 = 中心化总奖励 / 基于相关系数的归一化因子。该因子与各奖励分量的尺度无关,只反映分量间的线性相关性;相关性越高,因子越大,优势越小,反之亦然。
- 策略更新:与 GRPO 一致,使用计算出的优势进行策略梯度更新,无需价值网络。
输出
每个 rollout 的优势值,用于调整策略,使高优势轨迹的概率上升。
与同类方法的差异点:GRPO 直接使用总奖励标准差归一化,会被大尺度奖励分量主导;CorrGRPO 用相关系数替代协方差,实现对奖励尺度不变的归一化,从而平衡不同尺度奖励对学习信号的贡献。
实验
实验设计
- 在三个多奖励场景验证:代码生成(LeetCodeDataset 训练,HumanEval / MBPP / LiveCodeBench 评估)、工具调用(RLLA-4K 训练,API-Bank 评估)、智能体安全(AgentDojo 训练,Agent Security Bench / InjecAgent 评估)。
- 模型规模覆盖 0.5B 至 8B,对比 GRPO 及现有变体(CISPO / GDPO / DAPO)的兼容性。
- 核心机制:CorrGRPO 将 GRPO 中总奖励方差的协方差归一化替换为 Pearson 相关系数归一化,保持中心化总奖励不变。
关键发现
- CorrGRPO 在三个领域均报告一致提升,表明相关性归一化能更平衡地利用不同尺度奖励信号。
- 原始 GRPO 的总奖励方差受大尺度奖励主导,可能压制小尺度奖励的贡献;CorrGRPO 只调整归一化项,优势幅度适配奖励相关性而不被大尺度分量劫持。
- 实验显示该方法与 CISPO、GDPO、DAPO 等改进兼容,可叠加使用。
与基线对比
- 与 GRPO 相比,CorrGRPO 不改变奖励中心化,只修改标准化分母,因此训练稳定性更好;在奖励高度相关时,Pearson 系数比协方差更有效地消除尺度影响。
- 该方法本质是对优势估计的重新缩放,不引入额外超参数或计算开销,易于集成到现有多奖励 RLHF 流程。
行业影响
落地场景
CorrGRPO 适用于多奖励 RLHF 训练场景,尤其当不同 reward 尺度差异大且存在相关时。典型产品包括:代码助手(同时优化正确性、执行效率、代码风格)、工具调用智能体(兼顾调用准确率、格式合规、任务完成度)、企业级安全助手(平衡有用性与安全合规)。在这些场景中,传统 GRPO 易被大尺度 reward 主导,忽略小尺度但关键的安全或格式信号。
商业价值
- 提升模型综合表现:通过引入 Pearson 相关系数归一化,自动平衡不同 reward 的影响,改善多目标对齐效果,直接增强产品竞争力。
- 降低工程调参成本:避免手动调整 reward 权重或缩放,减少训练实验次数,节省 GPU 算力与人力投入。
- 提高训练稳定性:防止 reward 协方差过大导致 advantage 过小或过大,加速收敛,缩短迭代周期。
与现有工作流集成
CorrGRPO 实现简单,仅需在 GRPO advantage 计算中用 correlation 归一化替代 std 归一化,核心代码已在 GitHub 开源。可无缝嵌入现有 RLHF 框架(如 TRL、VeRL)或自定义训练脚本,与 DeepSpeed/FSDP 等分布式框架兼容。推理侧无需改动,部署成本几乎为零。
具体 use case:电商智能客服机器人需同时优化回答准确性、工具调用成功率、用户满意度、安全合规性。使用 CorrGRPO 训练,可让模型在安全合规等小尺度 reward 上获得充分学习信号,避免为提升满意度而牺牲安全,从而降低业务风险。
局限
- - 方法仅针对多奖励融合场景的归一化问题,在单一奖励设置下会退化为标准 GRPO,不带来额外收益。其优势依赖于多个奖励之间存在可被量化的相关性,若奖励之间相互独立或相关性极低,相关系数矩阵接近单位阵,归一化效果与直接使用标准差差异不大,方法的实际增益有限。
- - 实验所用模型规模最大为 8B 参数,未验证在更大规模模型(如 32B/70B)上的效果。多奖励学习中大模型往往具有更复杂的奖励分布和更长的训练周期,CorrGRPO 的相关系数估计在小批量(group size 有限)下可能噪声较大,影响稳定性。需要更多实验证明其对超大规模 RLHF 训练的适用性。
- - 与现有 GRPO 变体(如 DAPO、CISPO、GDPO 等)的兼容性仅在附录中简单讨论,缺乏系统性的消融和对比;同时,该方法假设奖励组件之间线性相加,无法处理非线性奖励融合或带约束的多目标优化问题,限制了其在更通用奖励建模中的应用。