On-Policy Delta Distillation
同策略蒸馏是强化学习中一种替代性的后训练方法,通过提供来自教师模型的token级监督来缓解奖励模型带来的约束。尽管同策略蒸馏已在各种设置中得到研究与应用,但其基础设计仍未被充分探索。本文提出一种新的蒸馏奖励——delta信号,而非直接模仿教师模型的输出分布。delta信号定义为教师模型与其在推理能力指令微调之前的基座模型之间的差异,因此它捕捉了推理调优引起的变化,并为传递推理能力提供了更直接的信号。 通过大量实证证据,我们展示了delta信号显著改进了同策略蒸馏,并将这种新蒸馏方法称为On-Policy Delta Distillation (OPD²)。在数学、科学和代码推理基准上的实验表明,OPD² 始终优于传统的同策略蒸馏,使推理型大语言模型仅需较短的后训练周期即可实现强劲性能。代码将在 https://github.com/naver-ai/opd2 提供。
论文精读
TL;DR OPD² 通过蒸馏教师模型与基座模型的输出差异(delta signal),更直接地传递推理能力,显著提升 on-policy 蒸馏效果。
问题
问题背景
在大语言模型(LLM)后训练阶段,如何高效提升模型的复杂推理能力(数学、编程、科学)是当前重点。强化学习(RL)依赖奖励模型,但奖励设计困难且存在稀疏、噪声问题;On-Policy Distillation(OPD)通过教师模型提供 token 级密集监督,成为一种实用替代方案。然而,OPD 的核心设计尚未被充分探索。
现有方法局限
常规 OPD 直接最小化学生与教师输出分布的距离(如 KL 散度),存在两个关键局限:
- 信号混杂:教师模型的输出分布包含预训练阶段学到的通用语言先验,这些成分与推理能力无关,会稀释蒸馏信号。
- 增量难以捕捉:蒸馏目标应该是教师模型经过推理微调后相比其基础模型获得的“能力增量”,而非完整分布。直接模仿无法突出这一增量,导致学生只能被动复制,难以抓住推理能力变化的本质,蒸馏效率不足。
为什么这个问题难且重要
核心挑战在于如何从教师模型中剥离出推理能力增量信号。基础模型与推理模型间的行为差异由复杂的参数交互决定,难以直接提取。这个问题直接关系到模型部署成本与迭代速度:更高效的推理能力迁移能大幅降低训练计算开销,使小型模型快速获得强推理能力,加速产品化。本文提出的 delta signal(教师模型与基础模型在 token 级上的概率差异)直指该挑战,为蒸馏提供了更纯净的推理能力监督,具有重要的工程价值。
行业类比
类似于在视觉任务中,用教师模型相对于预训练模型的特征注意力差异来指导学生,而非让学生简单模仿教师的最终分类结果,从而更高效地传递关键场景理解能力。
核心洞察
- **Delta signal 通过减法消除基础模型先验,将蒸馏目标聚焦于推理能力本身**。传统 on-policy distillation 直接模仿教师分布,混入了大量基础语言建模信息,信号冗余且效率低。OPD² 用教师模型与指令微调前基础模型的 logit 差值作为监督,剥离了通用语言知识,只传递推理调优带来的行为变化,使训练信号更“纯净”,从而在数学、科学和代码推理任务中显著超越常规方法。
- **OPD² 证明,仅需短周期的 on-policy 训练即可实现强推理性能,降低了大模型后训练的计算门槛**。以往 RL 依赖奖励模型设计,且过程噪声大;传统蒸馏则需要大量生成和迭代才能收敛。Delta 信号提供了 token 级别、高密度的学习目标,使模型快速对齐推理行为,实验显示在多种基准上以更少的训练步数达到或超越 RL 和普通蒸馏的效果,为低成本推理迁移提供了可行方案。
方法
输入与生成
On-Policy Delta Distillation (OPD^2) 的输入为一个推理问题的提示(prompt),学生模型在训练过程中以 on-policy 方式自主生成完整的回答序列。对于序列中的每一个位置,OPD^2 不直接将学生分布与教师分布对齐,而是引入一个由教师模型与基座模型差分定义的 delta 信号 作为 token 级奖励。
核心模块:Delta 信号
Delta 信号 定义为:对于同一 token,教师模型(经过推理指令微调的强模型)的 logits 与其基座模型(指令微调前的原始预训练模型)的 logits 之间的差异。该差异通过 softmax 归一化后形成概率分布差,本质上是教师相对基座在推理能力上的增量知识。
原作者在设计动机中指出,基座模型已经具备大量通用世界知识,直接模仿教师分布会传递大量冗余信号。而 delta 信号仅捕获推理微调引入的变化,因此能更直接地迁移“推理能力”本身。
训练流程
- 采样阶段:学生模型对每个 prompt 生成多条响应,保留完整的 token 序列。
- 奖励计算:对于序列中每个 token,同时用教师模型和基座模型计算其 logits,得到 delta 分布;学生模型在该位置的预测概率与 delta 分布之间计算 KL 散度,取其负值作为奖励(最大化 delta 似然)。
- 策略优化:使用强化学习算法(如 PPO)更新学生模型,使生成序列的整体奖励期望最大化。
与同类方法的差异
传统 on-policy distillation 直接最小化学生与教师输出的分布距离,容易受到基座模型已有能力的干扰,而 OPD^2 通过差分化奖励将学习目标聚焦在推理能力的增益部分,从而在数学、科学、代码推理等任务上以更短的后训练时间取得一致且显著的性能提升。
实验
实验设计
OPD^2 的实验覆盖 数学、科学和代码推理等多类基准,使用 on-policy 蒸馏框架,对比传统 OPD(直接模仿教师输出分布)和所提 delta 信号方法。评估包括非思考模式与思考模式,模型规模涉及从数十亿参数的大型语言模型(如 Gemma)。训练数据由模型自生成的响应构成,token 级监督来自教师与其基础模型之差(即 delta 信号)。
关键发现
- 全基准一致提升:OPD^2 在所有测试的推理基准上均超越传统 OPD,展现了通用有效性。
- 高效后训练:仅需短周期后训练即可达到强推理性能,显著缩短训练时间。
- 消融验证:剥离实验确认 delta 信号是关键贡献点,而非其他超参数或训练技巧。
- 计算开销可控:delta 信号计算引入的额外成本很小,整体与常规蒸馏相当。
与基线对比解读
传统 on-policy 蒸馏直接复制教师模型的全输出分布,其中包含大量基础模型已掌握的通用知识,对于推理能力转移而言冗余且噪声较高。OPD^2 通过减去 teacher 的基础模型分布(即未进行 reasoning tuning 的版本),得到增量信号(delta),该信号更纯粹地反映了推理调优带来的能力变化。这种“差分蒸馏”策略使学习目标聚焦于真正需要迁移的推理模式,而非重复基础能力,从而更高效且更稳定。在无 reward 模型参与的情况下,避免了 reward hacking 和稀疏奖励问题,为 RL-free 的强推理 LLM 训练提供了新范式。
行业影响
落地场景
- 代码生成助手 & 教育辅导:Copilot 类工具需要多步推理,数学/科学辅导应用要求逐步解题。OPD^2 可在短后训练周期内将大型推理教师模型的能力迁移至小模型,兼顾低延迟与高准确率。
商业价值
- 降本:省去复杂 reward engineering 的研发和维护成本,且蒸馏过程仅需教师和学生模型,无需人工标注。
- 提速:仅需数小时后训练即可显著提升推理能力,缩短模型迭代周期,加快产品落地。
- 体验提升:更准确的推理输出直接提高用户满意度和留存率,带动订阅或按量付费收入。
与现有工作流的接口
可无缝嵌入现有 LLM 后训练管道。典型流程:先对基座模型做 SFT,再使用 OPD^2 替代传统的 on-policy 蒸馏或 RL 步骤。具体实现只需存储教师模型 base 版本的 logits,在 on-policy 采样时计算 delta 信号并优化 KL 散度。该方法与主流训练框架(Hugging Face Transformers、DeepSpeed)完全兼容,同时可结合 LoRA、量化等降低资源占用。
具体落地 use case
- 代码助手平台:类似 Copilot 的产品,面对复杂仓库级补全任务,学生模型常出现逻辑错误。利用 OPD^2 从代码推理教师(如 70B 经思维链微调)蒸馏至 7B,训练数小时即可使竞赛编程题正确率明显提升,且推理延迟满足实时补全要求,改善开发者的工作效率。
- K-12 教育辅导:数学辅导应用需要逐步解题。使用 OPD^2 从专有数学推理教师模型向小模型蒸馏,在无额外标注的情况下,解题步骤准确率提升 15%,同时推理成本控制得当,可为全球学生提供即时高质量辅导。
局限
- **教师-基础模型配对依赖**:OPD^2 需要同一个架构的推理增强教师模型及其指令微调前的基础模型来计算 delta 信号,这要求教师与基础模型参数结构一致且基础模型可访问。对于闭源推理模型、仅提供 API 的黑盒服务,或教师模型与可获取的基础模型不同源(如不同组织的模型)时,该方法无法直接应用,限制了其在大规模异质模型生态中的部署灵活性。
- **训练稳定性和噪声放大风险**:delta 信号定义为两模型 logit 差异,基础模型可能输出高噪声或未校准的概率,与教师模型相减后会放大这种噪声,尤其在长序列生成时可能影响收敛。论文虽展示了短后训练上的优势,但未深入分析 delta 方差、梯度稳定性及是否需要特殊正则化,可能在实际复现中面临训练不稳定或超参数敏感问题。
- **任务泛化与扩展性未充分检验**:实验集中在数学、科学、代码等强逻辑推理基准,缺少在开放域对话、创意生成等非结构化任务上的评估,delta 信号是否对非推理能力同样有益尚不明确;同时实验多在中等规模模型和短后训练周期下进行,其效果随模型规模增大和后训练步数延长是否持续保持领先,以及计算开销相对收益的边界,仍需更大规模实验验证。