论文

DiffGate:用于同策略蒸馏的难度门控教师引导

DiffGate:用于同策略蒸馏的难度门控教师引导

同策略蒸馏(OPD)已成为大语言模型后训练的常用范式,通过在学生自身生成的轨迹上监督,缓解传统蒸馏的训练--测试失配。但现有 OPD 目标大多是 token 局部 且 结果无关 的:只在每个前缀上优化教师--学生一致性,而推理质量实际由轨迹层面决定。 带可验证奖励的强化学习(RLVR),尤其是 Group Relative Policy Optimization(GRPO),提供了互补的结果级监督,却受限于奖励稀疏与信用分配粗糙。我们发现二者存在互补盲区:教师信号密集,但与 rollout 正确性对齐较弱;组相对奖励反映任务成败,但 token 级信用粗糙,且在全员失败的组上消失。 我们提出 DiffGate,一个结果门控目标,把 GRPO 与选择性、有界的教师指导结合:教师监督只作用于失败轨迹,按组难度缩放,并做平滑有界处理,避免极端的教师--学生差异主导优化。验证器决定哪些轨迹获得教师指导,教师则在其中提供密集的 token 级更新方向。 在 Qwen3-0.6B 与 Qwen3-1.7B 学生模型上,DiffGate 相比匹配的 GRPO 使代码 avg@8 提升 +1.7 与 +1.8 分,pass@8 提升 +1.6 与 +5.7 分;数学上 avg@8 与 GRPO 差距在 0.5 分内,pass@8 分别提升 +1.1 与 +3.9 分。在全部四种模型--领域设定下 pass@8 均有提升,表明评测协议下解法覆盖度得到改善。

论文精读

TL;DR DiffGate 将 GRPO 与有界教师蒸馏结合:仅在失败轨迹上按组难度施加 token 级教师信号,缓解奖励稀疏与信用分配粗糙,在代码和数学任务上提升 pass@8。

问题

问题背景

当前 LLM 后训练主流转向 on-policy 方法,On-Policy Distillation (OPD) 与 RLVR (GRPO) 成为提升推理能力的常用范式,目标是减少训练与推理分布不匹配。

现有方法局限

  • OPD 在 student 自生成轨迹上对齐 teacher 的 token 级分布,但逐 token 优化不感知整条轨迹的最终正确性,teacher 的局部指导可能与 rollout 结果弱相关甚至冲突。
  • GRPO 用 verifiable rewards 提供结果级监督,但 reward 稀疏、token 级 credit assignment 粗糙;当一组采样全部失败时 group-relative advantage 退化为零,梯度信号消失。
  • 两者盲点互补,但直接相加会引入 teacher 信号与结果信号的冲突,缺乏对“何时给指导、给多强指导”的显式控制。

为什么这个问题难/重要

关键在于同时利用密集局部监督与稀疏结果监督,并动态平衡教师信号的可靠性与优化稳定性。DiffGate 通过 difficulty gating 只在失败轨迹上施加 bounded teacher guidance,让 verifier 决定指导范围,teacher 负责 token 级更新方向,从而提升 pass@k 和 avg@k 的覆盖。业界对降低后训练成本、提高采样效率有强烈需求,这类 outcome-gated 混合目标具有直接工程价值。

行业类比

类似代码生成场景:单元测试能判断最终程序对错但无法定位具体错误行,IDE 实时 lint 提示给出局部修正建议却可能在整体逻辑错误时误导。DiffGate 相当于只在测试失败的代码上启用 lint 修复,并根据任务难度调节建议强度。

核心洞察

  • DiffGate 的核心思路是将教师指导作为结果条件化的局部信号,仅在验证器判定失败的轨迹上启用,并根据组难度缩放强度。这不同于传统 OPD 对所有轨迹无差别做 token 级蒸馏,也不同于 GRPO 只依赖组相对奖励而丢失 token 级细节。它直接让结果正确性决定教师是否介入,使教师信号集中于探索失败的样本,同时弥补 RLVR 稀疏奖励与 OPD 结果不敏感的互补盲点,从而提升 pass@k 的覆盖率。
  • DiffGate 中的有界教师项防止极端师生分歧主导优化,本质上将 token 级教师优势动态缩放并截断后加入策略梯度,这在此前 OPD 与 RLVR 的简单组合中未被显式处理。与直接相加教师 KL 损失相比,DiffGate 提供了一种平滑且可证明稳定的融合方式,实验显示其在 code 任务上 pass@8 提升 +1.6 至 +5.7 点,而 avg@8 仅小幅变化,表明该机制主要增加解的多样性而非单纯提高平均奖励。

方法

输入

学生策略针对每个训练问题采样一组 rollout 轨迹,由任务 验证器 (verifier) 判定每条轨迹是否成功。同时提供 教师模型 对轨迹中每个 token 的预测分布,用于 token 级蒸馏监督。

关键模块

  1. 难度门控 (Difficulty Gating)
    根据组内失败轨迹的比例估计 组难度,用该难度缩放教师监督强度。组内全部失败 (all-failure) 时组难度最高,教师项权重相应调整,避免奖励消失时失去学习信号。

  2. 选择性教师指导 (Selective Teacher Guidance)
    教师蒸馏损失只施加在 失败轨迹 上。成功轨迹已经由验证器给出正向奖励,无需额外 token 级纠正;失败轨迹则获得密集的教师方向,补足 GRPO 稀疏奖励的不足。

  3. 有界机制 (Bounded Teacher Term)
    对教师-学生 token 分布差异施加 平滑上界 (smooth bound),防止个别 token 上的极端差异主导整体梯度,保持优化稳定。

  4. 与 GRPO 组合
    最终目标函数包含两部分:GRPO 的 组相对策略梯度项 (group-relative advantage) 和上述 有界、难度缩放的失败轨迹教师蒸馏项。两者在同一个 on-policy 批次内联合优化。

输出

每个训练步输出更新后的学生策略参数。验证器决定哪些轨迹需要教师指导,教师提供 token 级更新方向,难度门控调节指导强度,有界项限制梯度范围。

与同类方法的差异

相比于将 OPD 和 RLVR 直接相加的基线,DiffGate 通过 结果门控 只对失败轨迹注入教师信号,并用 组难度缩放 和 有界约束 抑制教师与轨迹正确性弱对齐带来的噪声。

实验

实验设计

DiffGate 在 Qwen3-0.6B 和 Qwen3-1.7B 两个学生模型上进行验证,任务覆盖代码生成与数学推理两类可验证奖励场景。基线为匹配设置的 GRPO,并纳入 OPD 相关对照。评估指标包括 avg@8 与 pass@8,前者衡量平均性能,后者衡量至少一次通过的解空间覆盖。

关键发现

  • 在代码任务上,DiffGate 较 GRPO 在 avg@8 上分别提升 +1.7(0.6B)和 +1.8(1.7B)点;pass@8 提升 +1.6 和 +5.7 点。
  • 在数学任务上,avg@8 与 GRPO 差距在 0.5 点以内,基本持平;但 pass@8 提升 +1.1 和 +3.9 点。
  • 总体上,DiffGate 在所有四个模型-领域组合上均提升了 pass@8。

与基线的深度对比

GRPO 依赖组内相对奖励,当一组轨迹全部失败时奖励信号消失,难以更新;OPD 的教师信号虽稠密但与最终正确性弱相关。DiffGate 通过难度门控仅对失败轨迹施加教师引导,并按组难度缩放,同时用有界项限制极端差异,使验证器决定引导范围、教师提供稠密更新方向。这解释了为何 pass@8 普遍提升:失败轨迹获得了更有效的修正路径,促进了解决方案覆盖的多样性,而 avg@8 未受损说明引导未干扰已有正确解。

行业影响

落地场景

DiffGate 适用于需要高覆盖率推理答案的产品,例如代码生成 IDE 插件与数学解题 API。在代码助手场景,模型需在多次采样中提高 pass@8,DiffGate 通过失败轨迹的教师引导能显著提升正确解法覆盖率。教育辅导产品中,数学推理步骤的中间过程常需局部修正,DiffGate 的 outcome-gated 机制可在不牺牲最终答案准确率的前提下改善步骤合理性。

商业价值

对模型提供商而言,DiffGate 允许以较小学生模型逼近更大教师模型在复杂推理任务上的表现,降低线上推理成本(同等 pass@k 下部署更小模型)。同时,它在 GRPO 基础上进一步优化 pass@8,直接提升用户可感知的答案可用率,减少重复生成与人工筛选成本。在按调用计费的 API 业务中,更高的一次通过率可改善客户体验与留存。

与现有工作流集成

DiffGate 可作为现有 RLVR + 蒸馏后训练栈的增强模块:只需在 GRPO 损失中追加一个有界教师项,输入为组内 rollout 的 verifier 结果与教师 logits。无需额外标注数据,适合已有 on-policy 蒸馏或 GRPO 基础设施的团队平滑切换。实现上可封装成 DiffGateLoss,在训练框架中插入。

局限

  • - **对 verifier 质量的依赖较强**:DiffGate 的核心设计是在 verifier 判定为失败的轨迹上施加 teacher 引导,因此 verifier 的准确性与细粒度直接决定引导的有效性。论文未系统评估 verifier 噪声(如误判、奖励稀疏或不完全客观)下的鲁棒性,在实际部署中,若 verifier 存在系统性偏差,可能导致 teacher 信号被错误抑制或放大,进而影响策略优化。
  • - **实验覆盖范围有限**:论文主要在 **Code** 和 **Math** 两类具有可验证奖励的任务上验证,未涉及开放式文本生成、多轮对话或安全对齐等更复杂的后训练场景。模型规模限于 **Qwen3-0.6B / 1.7B / 4B**,缺乏 7B 以上大模型的验证,因此该方法在大规模模型及不同任务分布上的泛化能力仍待进一步检验。
  • - **引入额外超参数与工程复杂度**:DiffGate 需要同时运行 student 和 teacher 模型,并维护 group 难度统计、计算 bounded teacher term,增加了训练时的显存与计算开销。此外,difficulty scaling、bounded term 系数等超参数需针对不同任务进行搜索,论文虽提供了 hyperparameter sweep,但实际应用中可能仍需额外调参成本,对工程落地不够友好。
论文Karn Tiwari2026-10-03原文

相关内容