为 On-Policy Distillation 校准 Teacher--Student 差异
On-policy distillation(OPD) 通过学习更强 teacher 与 on-policy student 之间的 token 级别差异来提升推理模型。然而,这一差异并不纯粹反映 teacher 与学生之间的能力差距:其中还包含源自 teacher 自身的偏离,这些偏离被混入观测到的 teacher--student 差异,并被标准 OPD 在训练中不加区分地学习。privileged OPD 会进一步加剧该问题——特权信息引发更大的 teacher 侧似然偏移,从而促使 student 学到更多 teacher 自身的偏离。 为此,作者提出 Calibrated On-Policy Distillation(Cal-OPD):通过正向与负向特权干预估计 teacher 的自偏离区域,并据此校准原始 teacher--student 差异,仅保留落在该区域之外的分量作为优化信号。 在数学推理基准上的实验表明,尽管只保留原始 teacher--student 差异的约 52--65% 作为优化信号,Cal-OPD 在不同模型规模上仍稳定优于标准 OPD 及其变体。
论文精读
TL;DR 本文揭示 on-policy distillation 中师生差异混入教师自身偏差,提出 Cal-OPD 校准该偏差,只保留真实能力差距作为优化信号,在数学推理任务上优于标准 OPD。
问题
问题背景
当前 On-policy Distillation (OPD) 已成为提升推理模型蒸馏效果的核心路线,通过 token-level 的师生似然差异传递知识。但这一差异信号的质量尚未被严格审视。
现有方法局限
标准 OPD 将 teacher-student discrepancy 整体视为教学信号,未区分其中包含的 teacher self-deviation(教师自身在没有外部干预时产生的似然波动)。这种偏差并非师生能力差距,而是教师模型自身的不确定性或先验偏好,被混入差异后会被学生无差别学习。尤其在 privileged OPD 中,额外特权信息会进一步放大教师似然偏移,促使学生学到更多教师自身偏差,反而损害蒸馏质量。
为什么这个问题难/重要
技术上难以直接分解差异来源:每个 token 的偏差都无法显式标注,必须通过正负特权干预间接估计 self-deviation 区域,并设定保留阈值;同时,校准策略需在信号保留与噪声剔除之间平衡(Cal-OPD 仅保留约 52–65% 原始差异作为优化信号)。业界普遍关注推理模型训练稳定性和对特权信息的有效利用:若忽略教师自身偏差,蒸馏收益可能被系统性噪声抵消,限制模型上限。
行业类比
类似推荐系统中若不校正 position bias,学习者(排序模型)会学到展示位置偏差而非用户真实偏好;在蒸馏中,剔除 teacher self-deviation 后才能学到真实的能力差距。
核心洞察
- 教师-学生 token 级差异并非纯粹的能力差距,而是混入了教师自身的“自偏差”(TSD),且特权信息干预会进一步放大这种偏差。标准 OPD 假设该差异完全代表教师相对学生的知识增益,但本文通过干预实验证明 TSD 在无任务知识时仍出现、对干预语义不敏感、集中于表面形式 token,表明它是教师模型的固有噪声而非监督信号。这解释了为何特权 OPD 可能适得其反,提示从业者需重新审视蒸馏信号的可信度。
- Cal-OPD 通过构造正负特权干预来定位教师自偏差区域,保留仅超出该区域的差异作为优化目标,实现了“少即是多”的蒸馏。与标准 OPD 试图利用全部差异和特权 OPD 直接加入特权信息不同,Cal-OPD 主动丢弃约 35–48% 的原始差异,却一致优于基线。这揭示监督信号质量比数量更重要:剔除教师自身噪声偏差后,剩余信号更纯净,模型学习效率更高。该方法无需额外任务数据,工程上易于集成。
- TSD 主要集中在表面形式 token 而非推理关键 token,且即使在正确轨迹中也普遍存在,这解释了标准 OPD 为何会学到与推理无关的语言模式。论文的 token 级分析表明,教师偏差并非局部错误,而是全局性现象,对干预语义不敏感。这提示在 on-policy 蒸馏的实际部署中,不应盲目信任教师的所有差异,而应识别并排除包含表面形式偏差的 token 区域,或采用类似 Cal-OPD 的校准策略,以保证学习信号聚焦于真正的能力差距。
方法
输入
- 学生模型生成的 on-policy rollout(token 序列)
- 教师模型用于计算 token-level likelihood
- 特权上下文(正干预:正确参考解;负干预:错误或无关信息)
关键模块
- Teacher Self-Deviation 估计:将同一 rollout 分别置于正、负特权上下文下,由教师模型重新打分,得到每个 token 上的 likelihood 变化区间。该区间反映教师自身对上下文干预的敏感度,与师生能力差距无关。
- 原始 Discrepancy 计算:沿用标准 OPD,计算教师与学生在该 rollout 上的 token-level likelihood 差异。
- 校准与过滤:将原始 discrepancy 与 self-deviation 区间比较,仅保留超出该区间的分量作为优化信号;落在区间内的 discrepancy 视为教师自身偏差,被衰减或置零。通过松弛因子 λ 调节保留比例,实验保留约 52–65% 的原始 discrepancy。
输出
- 校准后的 token-level discrepancy 信号,用于更新学生策略(作为加权监督目标或奖励塑形项)。
与同类方法的差异:相比标准 OPD 和 Privileged OPD,Cal-OPD 显式建模并剔除教师自身的上下文诱导偏差,避免学生模仿教师的非任务相关波动。
实验
实验设计
论文在数学推理基准 上评估 Cal-OPD,对比标准 OPD、特权 OPD 及其变体,覆盖不同模型规模。核心实验流程包括:(1) 使用正负特权干预估计教师的自偏差区域;(2) 通过校准仅保留超出该区域的教师-学生差异作为优化信号,保留比例约 52–65%;(3) 在多个推理任务上测试准确率与训练动态。
关键发现
- Cal-OPD 仅使用约 52–65% 的原始教师-学生差异作为优化信号,却在数学推理基准上一致优于 标准 OPD 及其变体。
- 教师的自偏差 并非可靠知识,其分布集中于表面形式 token,对干预语义不敏感。校准后能有效过滤这类噪声。
- 在特权 OPD 场景下,校准的增益更明显,因为特权信息会放大教师侧似然偏移,而 Cal-OPD 能够抑制这种偏差。
与基线对比
标准 OPD 将教师-学生差异 全部作为学习目标,会引入教师自身偏差;特权 OPD 进一步放大该问题。Cal-OPD 通过正负特权干预 显式估计并扣除自偏差区域,实现了更精准的知识迁移。实验表明,尽管优化信号减少,但性能提升,说明信号质量比数量更重要。该方法对实际工程的启示:在蒸馏中应甄别教师输出的可靠性,而不是盲目拟合全部差异。
行业影响
落地场景
Cal-OPD 主要适用于推理密集型产品,如:
- 在线教育的数学/逻辑解题助手(逐步推理并给出解释)
- 金融分析的报告生成(基于数据的链式论证)
- 企业级代码助手(复杂算法题生成、缺陷定位)
这些场景要求模型具备多步推理能力,且通常用大教师模型蒸馏小模型以降低延迟和成本。Cal-OPD 能在保留教师有效知识的同时过滤教师自身的随机偏差,提升小模型推理准确率。
商业价值
- 降本:Cal-OPD 仅保留约 52–65% 的原始 teacher–student 差异作为优化信号,训练更稳定、收敛更快,减少 GPU 资源和调参成本。
- 体验提升:过滤教师偏差后,学生模型输出更一致、可靠,减少幻觉和表面形式模仿。在数学基准上全面超过标准 OPD 及变体,意味着小模型能以更低的计算开销达到近似大模型的推理质量,直接改善终端用户的答案准确率。
与现有产品/工作流的接口
- Cal-OPD 可无缝嵌入现有 OPD 训练管线:只需在数据加载阶段为每个样本构造正/负特权干预(如加入正确答案提示 vs 错误提示),在损失计算时估计教师自偏差区域,替换标准 OPD 的 KL 散度目标。
- 对已使用 TRL、Axolotl 或自研训练框架的团队,只需新增一个
CalODPLoss模块,无需改动模型架构。 - 生产部署无需额外推理开销,因为校准仅在训练阶段进行。
局限
- **实验任务局限**:论文实验集中在数学推理基准(如 GSM8K、MATH 等),未在代码生成、科学问答、多步决策等其他推理密集型任务上验证校准方法的泛化性。On-policy distillation 在数学之外的领域同样重要,缺乏跨任务验证使得 Cal-OPD 是否具有任务无关性存疑。此外,**正负特权干预** 的构造依赖额外数据准备与标注,实际部署时可能增加数据收集与预处理成本,论文未讨论该开销是否在可接受范围内。
- **超参数敏感性**:Cal-OPD 通过保留约 52-65% 的原始 teacher-student discrepancy 作为优化信号,该比例由超参数 λ 和干预上下文设计共同决定。论文中仅展示了单一 λ 设置下的结果(或有限消融),未系统分析 λ 在不同教师/学生规模、不同任务下的最优取值稳定性。实际应用中若 λ 选择不当,可能导致校准过度(丢弃过多有用信号)或校准不足(保留过多教师自偏差),需要额外调参成本。
- **理论保证缺失**:方法本质上是一种启发式校准策略,通过正负特权干预划定教师自偏差区域,但该区域的估计精度缺乏理论保证,且未证明该区域与真实教师自偏差之间的误差对最终优化目标的影响。与知识蒸馏领域一些具有概率解释或损失上界的工作相比,Cal-OPD 的可解释性和可靠性更多依赖经验验证,在面对分布外数据或极端教师偏差时可能失效。