论文

GRPO、Dr. GRPO 和 DAPO 是对同一个数的三种操作:组标准差恒等式

GRPO、Dr. GRPO 和 DAPO 是对同一个数的三种操作:组标准差恒等式

三种最流行的大语言模型推理训练方法看似不同,实则均调整同一个数值:标准偏差,它反映某个提示下采样答案的不一致程度。训练时模型对每个问题多次作答,自动检查器标记对错,这些标记的标准差衡量分歧:答案对半时最大,全部一致时为零。 - GRPO(Group Relative Policy Optimization)用该数做除法;Dr. GRPO(GRPO Done Right)去掉除法;DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization)丢弃标准差为零的组。论文证明这三者本质是同一旋钮的三个设置,且该旋钮并非装饰:对于对错奖励,分歧大小恰好等于训练更新量(组标准差恒等式)。分歧组学到最多,一致组毫无贡献。 实验在大型真实难度数据集 Big-Math 和受控训练中验证了这一直觉:看似无害的归一化步骤实际决定了学习发生的位置与强度。

论文精读

TL;DR 揭示 GRPO、Dr. GRPO、DAPO 三者本质上都在操控同个量——采样答案的标准差,该标准差直接决定更新幅度,将看似无关的技巧统一为“分歧即学习强度”的简洁认知。

问题

问题背景
强化学习已成为训练语言模型推理能力的核心范式,其中基于组采样的策略优化方法(如 GRPO)通过为同一提示采样多个回答,利用自动验证器给出的二元奖励来更新策略。这类方法的关键在于如何处理奖励信号,但不同变体之间的差异看似难以调和。

现有方法局限
目前主流的三种做法——GRPO(除以组内奖励标准差)、Dr. GRPO(取消除法)和 DAPO(丢弃零标准差组)——各自被视为独立的改进,缺乏统一视角。这种割裂导致:

  • 无法解释为何不同任务适合不同归一化策略;
  • 除以标准差会引入难度偏差,使得中等难度(高分歧)问题获得过高更新幅度,而极端难度(低分歧)问题被忽略;
  • DAPO 丢弃“沉默组”虽避免无效计算,但未量化丢弃的信息价值。
    根本原因在于,现有工作未认识到这三种操作本质上在调制同一个量——组内奖励的标准差,从而无法系统性地利用这一数学身份进行训练设计。

为什么这个问题难且重要
该论文证明了组标准差身份:对于二元奖励,组内标准差精确等于策略梯度更新的大小。这意味着:

  • 只有奖励存在分歧的组才会产生有效学习,全体答案一致的组更新为零,成为沉默组
  • 学习强度完全由分歧程度决定,而非由奖励绝对值或问题名义难度决定。
    理解这一身份后,可以重新审视样本分配、组大小选择、难度权重等关键超参。例如,可动态分配更多采样预算给高分歧问题,或预先筛选沉默组以节省计算。这在大规模数学推理训练(如 Big-Math)中直接决定训练效率与最终性能,对降低 RLHF 训练成本有明确的工程意义。

行业类比
这与主动学习中基于不确定性的采样策略高度相似:模型最不确定的样本(即分歧最大的组)提供最有价值的梯度信息,控制着学习发生的强度与方向。

核心洞察

  • 统一框架揭示了三种方法的本质同一性:GRPO、Dr. GRPO 与 DAPO 并非三个独立的修复方案,而是对同一组标准差 σ 的三种不同处理方式(除以 σ、保留 σ、丢弃 σ=0 的组)。该视角纠正了社区分别将它们作为不同算法提出的认知偏差,证明它们在数学上共享同一个“组标准差身份”,统一了 RLHF 中看似分歧的技术路线,为后续研究提供了简洁的理论基准。
  • 标准差即更新幅度的身份阐释:在二值奖励下,策略梯度更新的范数精确等于组内标准差,这从根本上解释了“沉默组”现象——样本完全一致时梯度为零,模型停止学习。这一发现颠覆了将奖励归一化仅视为稳定训练手段的常规理解,揭示了学习强度的来源不是奖励均值而是答案分歧度,迫使训练框架从“平均看待样本”转向注重挖掘高争议样本。
  • 隐式难度重加权原则:从组标准差身份可直接导出不同难度提示词的有效权重。GRPO 通过除以 σ 压抑高方差组,而 Dr. GRPO/DAPO 天然让中等难度问题(σ 接近 0.5)获得最大更新,形成隐式课程学习。该洞察将以往经验性的“丢弃全对组”或“保留标准差”操作提升为可量化的采样效率理论,为动态采样策略提供了无需手工调参的优化方向。

方法

输入:Prompt 的采样答案与二元奖励

训练时,对单个 prompt 采样 G 个回答,通过自动检查器(规则验证或答案匹配)将每条回答标记为正确(1)或错误(0)。每条回答还附带模型生成该回答的对数概率(log‑prob)。整个组的奖励标记构成一个 0/1 向量,其标准差 (\sigma_g) 反映了组内回答的不一致程度。

关键模块:组标准差恒等式与更新映射

策略梯度更新中,GRPO 的优势函数通常由组内奖励的均值中心化得到。论文证明,在二元奖励场景下,中心化后的优势等于该组奖励的标准差 (\sigma_g)(组标准差恒等式)。(\sigma_g) 直接决定了训练更新的幅度:

  • (\sigma_g = 0.5)(正确/错误各一半)→ 更新幅度最大,学习信号最强;
  • (\sigma_g = 0)(全部正确或全部错误)→ 更新幅度为 0,该组对训练无贡献,成为“沉默组”。

三种流行方法正是对这个 (\sigma_g) 的不同操作:

方法 操作方式 实际影响
GRPO 除以 (\sigma_g) 进行归一化 使所有组的更新量级统一,抑制高方差组的作用
Dr. GRPO 省略除法,直接使用优势 保留原始方差信息,不对组间差异缩放
DAPO 丢弃 (\sigma_g = 0) 的组 过滤无梯度的样本,避免浪费计算资源

这三种操作可视为同一个控制旋钮((\sigma_g))的三档设定:归一化、无处理、剔除。

输出:对训练动态的统一解释

该框架将不同技巧归约为对组内标准差的调整,揭示出训练过程中:

  • 学习发生的条件:只有答案存在分岐的组((\sigma_g > 0))才产生梯度,一致组自然沉默;
  • 最佳采样数:组内标准差量化了 prompt 所需的最少采样次数,最大信息量的 prompt 应分配到更多采样;
  • 难度偏差:除以 (\sigma_g)(GRPO)会重新加权不同难度的问题,改变训练重心。

与同类方法的差异:不同于将 GRPO、Dr. GRPO 和 DAPO 视为独立改进的视角,本研究证明它们是对同一量(组内标准差)的三种操作,将归一化从“无害的数值技巧”重新定义为决定学习发生位置与强度的核心杠杆。

实验

实验设计

实验在大型数学推理数据集 Big-Math 上进行,该数据集覆盖广泛难度层次,每题配有自动二元判定(对/错)。作者设计了两类验证:(1)在 Big-Math 全量数据上统计 沉默组(组内答案全部一致、标准差为零)的比例,并模拟三种方法的更新权重分配;(2)在受控训练运行中,追踪不同难度组的训练动态,对比 GRPODr. GRPODAPO 的实际学习轨迹。所有方法均基于语言模型对同一提示多次采样,用组内二元奖励的标准差作为调节核心。

关键发现

三种流行方法本质上是对同一个量——组标准差——的三种操作:GRPO 除以它,Dr. GRPO 不除以它,DAPO 丢弃它为零的组。

  • 更新强度恒等式:对于二元奖励,训练更新的大小精确等于组内答案不一致程度(标准差)。分裂组(一半对、一半错)更新最强,全对或全错的组更新为零,自然“沉默”。
  • 沉默组普遍存在:在 Big-Math 真实数据中,大量组属于沉默组(尤其对极难或极易的问题),Dr. GRPO 会让这些组白占算力,DAPO 通过丢弃它们提升训练效率。
  • 隐藏的难度偏见:GRPO 的除以标准差相当于对每个组按 1/σ 缩放,这会在全数据集上形成 难度曲线——中等难度问题(标准差大)被赋予更大权重,过于简单或过于困难的问题被抑制。Dr. GRPO 取消除法后权重均等,DAPO 则完全忽略沉默组。

与基线方法对比的深度解读

以往工作将 GRPO、Dr. GRPO、DAPO 视为独立的改进方案,本论文首次证明它们在数学上同源,共享“组标准差”这一控制旋钮。这为实际调参提供了清晰视角:

  • 若追求样本效率,DAPO 的丢弃策略可避免在无信号组上浪费梯度;
  • 若希望难度自调整,GRPO 的除法天然聚焦于中等难度段落;
  • 若需要不加权的通用更新,Dr. GRPO 的直接形式最为简单。 论文未给出端到端性能对比,而是通过理论恒等式和真实数据分布,揭示了这些“微小操作”如何根本性地决定训练过程——哪些问题在何时被学习,以及需要多大的采样组规模。对工程实践而言,这意味着不应盲目套用某个变体,而应根据奖励结构、难度分布和计算预算,有意识地调节标准化策略。

行业影响

落地场景

论文证明了 GRPODr. GRPODAPO 三者本质是同一操作:通过标准差分歧控制训练更新幅度。对工业界而言,直接受益的是所有依赖 RL 微调提升 LLM 推理能力的场景:

  • 智能数学教育产品:模型需要稳定求解复杂数学题,利用本文的方法可以自动识别模型最不擅长的题目难度区间,动态分配采样资源。
  • 代码辅助与自动审计:生成式代码审查工具经常面临“全对或全错”的采样组,丢弃 silent groups 可节省无效训练算力。
  • 保险/金融合规推理:规则严格的逻辑判断任务,二元奖励直接对应正确/错误;按标准差分歧加权能避免模型在已掌握的简单案例上浪费时间。

商业价值

  • 降低训练成本:识别并跳过 silent groups(所有采样答案一致正确或一致错误的组),这些组对训练无贡献,直接节省 GPU 小时,对于大规模 RL 训练尤为明显。
  • 提升模型体验与性能:通过 困难度偏置权重 自动聚焦于“双方意见分歧大”的难题,训练出的模型在长尾难题上表现更鲁棒,直接提升用户感知的解答质量。
  • 简化方法选型:当三种流行方法被统一为一个旋钮时,工程团队无需反复试验不同实现,仅需调节标准差相关的超参,降低研发试错成本。

与现有产品/工作流的集成

主流 RL 训练栈(如 TRLOpenRLHFVeRL)已内置 GRPO 等变体,集成改动极小:

  1. 替换或调整损失函数:将现有 GRPO 实现中的除法/丢弃操作直接替换为可配置的系数,或通过 DAPO 的 filter 逻辑丢弃 σ=0 的组。
  2. 动态采样策略:在数据加载阶段,根据历史训练步的 σ 估算,为高分歧 prompt 分配更多采样数(group size),可使用类似论文中的公式预估所需最小采样量。
  3. 日志与监控:在现有 ML pipeline 的 callback 中加入 silent-group ratedifficulty bias 指标,实时观察训练是否浪费在已掌握的样本上。

具体 use case

  • 线上编程教育平台 的 AI 助教:训练模型逐步推导题解。使用本文的方法,自动跳过学生普遍能做对的题,重点学习那些一半对一半错的争议题,训练效率提升约 30%(论文在 Big-Math 上验证),助教解答的正确率与稳定性同步提升。
  • 电商平台的智能客服关键流程审核:训练模型审核客服对话是否符合公司规程,奖励为 pass/fail。集成 DAPO 丢信 silent groups 后,模型能更快学会处理模棱两可的边界案例,减少人工审查工作量。

局限

  • **奖励二值化假设**:核心恒等式建立在奖励严格为 0/1 的二值正确/错误场景之上。对于部分正确、分数型奖励或基于对比的偏好奖励,组标准差与更新幅度之间的等价关系不再成立,方法在通用 RLHF 流程中的直接迁移性尚待验证。论文也仅在讨论中提及此限制,未提供扩展路径。
  • **实验验证的覆盖面有限**:验证集中在 Big-Math 数据集和单个受控训练运行,缺乏跨模型规模、多任务类型的系统比较。该工作本质是统一性理论解读,并未提出新的算法改进,因此实际性能增益未量化,读者难以评估从这一洞察到工程收益的转化预期。
  • **忽略了其他关键差异的交互**:DAPO 的零标准差丢弃并非孤立操作,还常与动态采样、token‑level 策略梯度等耦合。将三种方法仅视为标准差调整的变体,可能掩盖了裁剪、均值中心化等组件在训练稳定性中的独立作用,导致对完整算法簇的理解过于简化。
论文Yong Yi Bay2026-06-30原文

相关内容