组自适应裁剪策略优化
可验证奖励强化学习(RLVR) 中的 组相对策略优化(GRPO) 通常对所有 rollout 使用固定的重要性采样(IS)比率裁剪边界。我们发现一个关键局限:较难问题上稀有的正确 rollout 与较易问题上大量的正确 rollout 被以相近的比率裁剪,尽管它们携带的学习信号差异很大。组成功率较低的 rollout 具有更大的 IS 比率,携带更强的探索和解决新问题的梯度信号,却不成比例地被固定裁剪抑制。 为解决这一问题,我们提出 组自适应裁剪策略优化(GAPO),这是一种对 GRPO 方法的即插即用修改,可根据 rollout 优势自适应调整裁剪边界。GAPO 受到 反向 KL 信任区域 视角的启发,该视角认为学习信号越大的 rollout 应获得按比例更大的更新空间。GAPO 不需要奖励塑形,仅调整裁剪阈值,同时保留标准 PPO/GSPO 替代目标。在 Qwen 和 Llama 模型上,相对固定裁剪和优势塑形基线,GAPO 在基础模型通过率较低的教学推理和代码基准上持续提升了 Pass@1 和 Pass@k。
论文精读
TL;DR GAPO 让 GRPO 的裁剪边界随 rollout advantage 自适应变化,避免固定裁剪对难问题稀有正确样本的过度抑制,从而保留强学习信号,提升数学与代码任务 Pass@1/Pass@k。
问题
问题背景:
在 LLM 后训练中,RLVR 已成为提升数学推理与代码生成能力的主流范式。GRPO 等组相对策略优化方法通过组内相对优势估计梯度,并引入重要性采样(IS)比率裁剪来维持信任域约束。
现有方法局限:
GRPO 通常对所有 rollout 采用固定裁剪阈值(如 clip_ratio=0.2),该设计忽略了不同样本学习信号的显著差异:
- 在高难度 prompt 上,正确 rollout 极为稀少,其 IS 比率 往往远大于 1,携带强烈的探索与解题信号;
- 在低难度 prompt 上,正确 rollout 大量出现,IS 比率 接近 1,梯度贡献微弱;
- 固定裁剪却以相同比例截断两者,导致难题上的关键信号被过度抑制,简单题上的冗余更新未受约束。
此外,固定阈值无法适应训练中策略分布的变化,容易在探索与稳定之间失衡。部分优势塑形方法尝试调整信号强度,但常需奖励塑形或修改代理目标,引入额外复杂度。
为什么这个问题难且重要:
RLVR 的奖励稀疏且二元化,难题上的正确解是稀缺资源,其梯度对模型在 unseen 难题上的泛化至关重要。被固定裁剪抑制后,模型可能倾向于保守地重复简单题解,Pass@k 难以提升;而阈值过大又可能导致策略崩溃。业界对 RLVR 的样本效率与训练稳定性高度关注,如何在保持信任域的同时最大化有效学习信号,是当前亟待解决的核心矛盾。
行业类比:
类似推荐系统中对长尾正样本的过度降权会导致模型只推热门物品,RLVR 中固定裁剪让模型偏向简单题,削弱对难题的攻克能力。
核心洞察
- 固定裁剪边界忽略了不同难度问题下 rollout 学习信号的差异,导致低成功率组中稀有的正确轨迹被过度抑制。GAPO 通过将裁剪阈值与 rollout advantage 关联,让高 advantage 的样本获得更大更新 headroom,从而保留探索新问题的强梯度信号。与 DAPO、Dr. GRPO 等 advantage shaping 方法通过修改奖励或 baseline 来调节学习信号不同,GAPO 直接作用于裁剪机制,不引入额外 reward shaping 或超参,保留了标准 PPO/GSPO surrogate 的稳定性,因此可以即插即用到现有 GRPO 实现,且对超参更鲁棒。
- GAPO 从 reverse-KL 信任域视角推导出自适应裁剪公式,将“学习信号强度”与“更新 headroom”原则性地关联,突破了传统 PPO 中全局统一 epsilon 裁剪的假设。在 RLVR 场景下,正确轨迹稀疏且 advantage 方差极大,固定裁剪会同时抑制重要和无关更新。GAPO 让更新幅度与样本重要性成正比,这比 reward shaping 更直接地作用于梯度流,避免了 reward 变换引入的偏差。实验证明在低 pass rate 的数学推理和编码基准上,GAPO 相比固定裁剪和 advantage-shaping baselines 均能提升 Pass@1 和 Pass@k,且无需复杂调参。
方法
输入与背景
在 RLVR 中,每个 prompt 生成一组 rollouts,由组内相对优势 A_i 表征每个 rollout 的贡献。传统 GRPO 对所有 rollouts 使用同一个固定重要性采样(IS)裁剪边界 ε,导致困难问题上稀有正确样本与简单问题上大量正确样本被同等强度裁剪,削弱探索信号。
关键模块:自适应裁剪阈值
GAPO 的输入包括每个 rollout 的策略比率 r_i(θ) 和组相对优势 A_i。其核心是从 reverse-KL 信任域 视角推导最优 IS 比率与优势的关联:优势越大的 rollout 应获得更大的更新空间。据此,GAPO 在标准 PPO/GSPO 代理损失中保留 clip 函数形式,但将固定阈值 ε 替换为随 A_i 变化的动态边界。具体地,裁剪上界随优势增大而放宽,裁剪下界随优势减小而收紧,不再使用全局常数。这一改动不接触奖励塑形、优势估计或 loss 的其他部分。
输出与效果
经过动态裁剪后的代理损失用于策略梯度更新,使低组成功率 rollout 的高 IS 比率得以保留,从而把稀有正确的强梯度信号传回策略;同时高成功率 rollouts 仍保持较小更新幅度,维持信任域稳定性。在 Qwen 和 Llama 模型上,GAPO 在数学推理与编码基准上较固定裁剪和 advantage-shaping 基线提升了 Pass@1 与 Pass@k。
与 DAPO 等 advantage-shaping 方法不同,GAPO 只调整裁剪阈值,不修改优势项本身,因此完全保留标准 PPO/GSPO 代理形式。
实验
实验设计
GAPO 在数学推理和编程基准上评估,覆盖 Qwen 和 Llama 系列模型(如 DeepSeek-R1-Distill-Qwen-1.5B、Qwen2.5-1.5B-Math、Llama-3.2-3B-Instruct)。基线包括固定裁剪的 GRPO 和优势塑形(advantage-shaping)方法,指标为 Pass@1 和 Pass@k。实验重点选择基础模型通过率相对较低的任务,以检验对低成功率 rollout 信号保留的效果。
关键发现
GAPO 在所有测试模型上一致提升 Pass@1 和 Pass@k。自适应裁剪机制根据 rollout 优势调整 IS 比率裁剪边界,使得低组成功率的 rollout 获得更大的更新空间,保留了探索新问题的强梯度信号。消融研究证实自适应裁剪与优势相关性的必要性。
基线对比解读
与固定裁剪相比,GAPO 避免了对稀有正确 rollout 的不成比例抑制;与优势塑形相比,GAPO 无需修改奖励函数,仅调整裁剪阈值,保持了标准 PPO/GSPO surrogate 的简洁性。作为插件式修改,GAPO 易于集成到现有 GRPO 训练流程,并在困难问题上表现出更明显的增益。
行业影响
落地场景
GAPO 适合所有使用 GRPO 做 RLVR 训练的产品团队,尤其是数学推理和代码生成任务。例如:在线教育平台的解题助手,可提升数学题正确率;编程辅助工具(IDE 插件、代码生成 API),可提升生成代码通过单元测试的比例;企业数据分析 Agent 需要生成可验证的 SQL 或 Python 脚本,也能通过 GAPO 改善准确率。
商业价值
- 降本:无需额外 reward shaping,减少人工设计奖励函数的工作量;样本效率提升,相同训练数据获得更高 Pass@1,间接降低标注和训练成本。
- 增收/体验:提高模型在低基础通过率任务上的 Pass@k,直接减少用户等待和重试次数,提升产品体验与留存率。
- 相比固定裁剪的 GRPO 和优势塑形基线,GAPO 在模型初始通过率较低的数学、代码基准上改进更显著,适合需要突破难点的团队。
与现有产品 / 工作流的接口
GAPO 是插件式改动:在训练循环中根据 rollout advantage 计算自适应裁剪阈值,替换原有固定 clip_ratio,不改动 reward 函数、模型结构或采样策略。可无缝接入 OpenRLHF、verl、TRL 等 RLVR 训练框架,只需增加一个 clip 阈值计算函数,几乎没有额外计算开销。已开源在 GitHub,可直接集成进现有 RLHF 管线,替换现有 GRPO 实现中的 clip 步骤。
局限
- **适用范围有限**:论文聚焦于数学推理与编程等可验证奖励任务,且实验所选基础模型在这些基准上的通过率相对较低(如 Qwen2.5-1.5B-Math、Llama-3.2-3B-Instruct)。作者在结论中明确提到该方法适用于“低通过率”场景;对于模型已经表现良好的简单任务,自适应裁剪可能引入不必要噪声,导致收益不明显甚至轻微退化。这限制了 GAPO 在更广泛任务上的直接迁移,实际部署前需要先评估任务难度是否匹配。
- **核心机制单一**:GAPO 仅根据 rollout advantage 调整 importance-sampling 裁剪上界,保留了标准 PPO/GSPO surrogate 不变。这种 plug-in 设计虽然集成简单,但并未解决 GRPO 中 advantage 估计方差、group 内采样偏差或 reward hacking 等根本问题。如果 advantage 信号本身有偏或噪声较大,自适应裁剪可能放大错误更新,需要额外正则或改进 advantage 估计来配合,否则在复杂环境中稳定性存疑。
- **实验规模与领域有限**:实验所用模型规模较小(1.5B-3B),且仅在少量 math/coding 数据集上验证,缺乏更大模型(如 7B、70B)或更多领域(如指令跟随、安全对齐)的证据。此外,论文未充分讨论自适应裁剪引入的超参数(如裁剪界调整系数)的敏感性和自动调节策略,实际调参成本可能较高,限制了方法的工程易用性。