论文

On-Policy Distillation 教会新技能,却不带来新知识

On-Policy Distillation 教会新技能,却不带来新知识

On-policy distillation(OPD)可增强语言模型的推理能力,但学生模型究竟是否习得新的事实知识,或获得用于多步推理的组合技能,仍是未知数。 我们构建了一个受控的合成框架来分离这两种能力:该框架可测量学生的初始能力,并独立控制教师额外提供的事实、组合技能,或两者兼有。 在来自三个模型家族的四个模型上: - reverse-KL OPD 能可靠地将组合技能迁移到未见过的推理结构,但事实知识的迁移极其有限; - 解耦蒸馏配方后,这种不对称的来源得以揭示:把 reverse KL 换成 forward KL 可恢复事实迁移,而学生 rollout 专门提升多步推理的执行表现。 在近期事实问答与竞赛数学任务上的实验显示,reverse-KL OPD 下存在类似的不对称:推理能力显著提升,但参数化知识记忆并未扩展。 综上,这些结果表明 on-policy distillation 并不扩展模型的参数化知识,而是教会它组织并组合自身已有的知识。

论文精读

TL;DR 本文用合成框架解耦知识与技能,发现 On-policy distillation (OPD) 主要传授组合推理技能而非新的事实知识,反向 KL 目标下学生仅学会组织已有知识进行多步推理,前向 KL 才能传递新事实。

问题

问题背景

大语言模型推理能力提升中,on-policy distillation (OPD) 被广泛用于将大模型推理能力压缩到小模型,业界关注其能否真正增强小模型的推理表现。

现有方法局限

传统知识蒸馏通常使用 off-policy 固定数据集或教师强制,无法让学生探索自身分布;OPD 则让学生从自己采样 rollout 中学习,更符合推理时的实际分布。但现有评估仅看最终任务准确率,混淆了两种能力来源:事实知识(parametric knowledge)与组合技能(compositional skill)。缺乏解耦框架导致无法判断提升来自记忆新事实还是学会组合已有知识。此外,常用的 reverse KL 目标倾向于模式搜索(mode-seeking),学生聚焦教师高概率区域,可能丢失教师分布中低概率但关键的事实信息;而 forward KL 虽能覆盖全分布,却可能引入噪声。现有工作没有系统分离这些变量。

为什么这个问题难/重要

语言模型的推理是知识存储与技能执行的耦合过程,很难通过自然任务解耦。若 OPD 只转移组合技能而不注入事实知识,那么蒸馏模型在面对新知识密集场景(如最新事件 QA、专业领域问答)时仍会力不从心,需要额外检索或更新。该问题的答案直接指导蒸馏目标的选择:reverse KL 适合技能迁移但牺牲事实覆盖,forward KL 保留事实但可能降低执行效率。工业界在部署小型推理模型时,明确这一不对称性可避免盲目蒸馏带来的知识缺口。

行业类比

如同一个员工通过观察资深同事的问题解决流程学会了组织已有资料、多步推理,但不会因此凭空记住同事脑中所有新数据——对应客服 agent 蒸馏推理流程,却仍需要外部知识库支持最新产品信息。

核心洞察

  • On-policy distillation 在 **reverse KL** 目标下主要转移 **组合技能** 而非 **事实知识**。这一发现挑战了将蒸馏视为知识注入手段的预期。与以往只关注整体准确率的工作不同,论文用合成框架分离两种能力,证明 **reverse KL** 的模式寻求特性会抑制学生分布中低概率的新事实,而 **forward KL** 可恢复事实转移。因此,工程实践中若目标是扩充模型知识,必须重新审视蒸馏目标,而非默认使用 **reverse KL** 的 on-policy 流程。
  • 分离 **事实知识** 与 **组合技能** 的可控合成框架是诊断蒸馏机制的关键方法学创新。该框架独立控制教师新增的事实、组合技能或两者,并测量学生初始能力,从而量化转移的净效应。与端到端评估相比,它实现了“教师有什么”与“学生学到什么”的因果归因,避免将技能提升误判为知识获取。这种框架可复用于不同蒸馏目标、模型家族或任务类型,为后续研究提供清晰的诊断工具。
  • **学生 rollout** 与蒸馏目标的作用可解耦:**rollout** 提升多步推理执行,目标函数决定事实迁移与否。论文消融实验表明,**reverse KL** 抑制事实转移,但 **学生 rollout** 独立增强组合技能;换成 **forward KL** 后事实转移恢复。这说明 OPD 中采样分布与优化目标分别影响不同能力维度。对实际工程有直接指导意义:若目标是扩展知识,应选择 **forward KL** 或调整采样;若目标是提升推理技能,**学生 rollout** 本身就足够。

方法

输入:合成任务与学生 / 教师配置

本方法采用 合成任务框架,将能力显式分离为两类:事实知识(用随机查找表表示,每个查询映射到固定输出)与组合技能(多步推理结构,如顺序链、分支树)。学生模型初始化时仅具备部分知识或技能,教师模型则在学生基础上注入额外的事实、组合技能或两者兼有。训练数据由任务生成器提供查询。

关键模块:On-Policy 蒸馏循环

  1. 学生自采样(rollouts):给定输入查询,当前学生模型生成完整推理轨迹(中间步骤 + 最终答案),构成 on-policy 样本。
  2. 教师概率监督:教师模型对学生生成的轨迹给出每个决策点的概率分布,作为目标。学生不直接模仿教师生成的答案,而是对齐教师在“学生自己的路径”上的判断。
  3. 损失函数:默认使用 reverse KL 散度,即让学生分布覆盖教师分布中高概率区域,但避免低概率区域发散。蒸馏目标可替换为 forward KL 或其它散度以做消融。
  4. 迭代更新:用梯度下降更新学生参数,下一轮自采样基于更新后的策略,形成闭环。

输出与评估

训练完成后,在未见过的推理结构和未见过的事实查询上分别测试组合技能迁移与事实知识获取。评估指标包括步骤级正确率和端到端准确率。通过对比学生初始能力与训练后能力,判断蒸馏是否填补了知识缺口或技能缺口。

跟同类方法的差异点

传统知识蒸馏通常在教师固定采样分布上用 KL 散度监督,而本方法使用 on-policy student rollouts 并解耦散度类型,发现 reverse KL 下学生只获得推理编排能力而几乎不吸收新事实,这为蒸馏的“教技能不教知识”提供了可控实验证据。

实验

实验设计

论文构建了一个合成框架,将事实知识建模为随机查找表,将组合技能建模为跨推理结构(如顺序链、分支树)的泛化能力。通过控制学生初始能力,并独立改变教师新增的事实、组合技能或两者,在四个模型(三个家族)上评估 on-policy distillation (OPD) 的效果。核心对比包含:

  • 学生基线:未蒸馏的学生模型
  • 教师构建:教师额外具备事实知识、组合技能或两者
  • 蒸馏目标:默认使用 reverse KL,并进一步解耦为 forward KL 与学生 rollout 的贡献
  • 评估:在未见过的推理结构上测试组合技能迁移,在新增事实上测试知识记忆

关键发现

  • 组合技能迁移显著:reverse-KL OPD 可靠地将多步推理的组合技能迁移到未见的推理结构上,学生能够组织已有知识完成复杂推理。
  • 事实知识迁移微弱:学生几乎无法通过蒸馏获得教师新增的事实知识,表明 OPD 不扩展参数化知识库。
  • 分歧目标决定知识迁移:替换为 forward KL 可恢复事实迁移,说明 forward KL 更倾向于让学生模仿教师的输出分布,从而记忆事实;而 reverse KL 更关注学生自身生成,偏向于技能学习。
  • 学生 rollouts 强化组合执行:学生自身采样在训练中的作用主要是提升多步推理的执行效率,而非注入知识。

与基线对比的解读

与标准离线蒸馏(通常使用教师强制或 forward KL)相比,on-policy distillation 由于学生从自身策略采样,天然避免了暴露偏差,但也因此限制了事实知识的直接拷贝。这一发现解释了为何 OPD 在数学推理等任务上取得显著提升,而在知识密集型任务上增益有限。对工程实践而言,选择蒸馏目标应匹配目标:若需扩展知识,选择 forward KL 或离线蒸馏;若需提升推理技能,reverse KL + on-policy rollouts 更有效。该结论在真实世界的 factual QA 和竞赛数学基准上得到验证,支持了合成框架的洞察。

行业影响

论文揭示 on-policy distillation (OPD) 在 reverse KL 目标下仅迁移 组合推理能力,而非事实知识。这一发现直接指导 LLM 蒸馏策略选择。

落地场景

  • 多步推理型助手:数学辅导、代码调试、逻辑谜题等产品可采用 reverse-KL OPD 提升小模型推理组织能力,无需扩充参数化知识。
  • 知识密集型问答:企业知识库、金融合规分析等场景,若目标是注入新事实(如更新法规、产品信息),应改用 forward KL 或混合目标,避免仅依赖 OPD 导致知识不更新。
  • 轻量化边缘部署:在资源受限设备上,用 OPD 增强推理而不增加知识存储负担。

商业价值

  • 降低训练成本:避免无效的知识迁移训练,节省算力与数据标注成本。
  • 提升用户体验:推理准确率提高带来更可靠的多步解答,减少人工校验。
  • 规避方向性错误:明确 divergence 目标与能力映射,防止团队在错误目标上投入。

与现有工作流接口

  • 在 Hugging Face TRL 或 DeepSpeed 蒸馏管线中,将 loss_type 配置为 reverse_kl 或 forward_kl 对应不同目标。
  • 学生 rollout 数据收集与训练循环可集成到现有 RLHF 或 DPO 后训练流程。
  • 监控指标建议分离:推理任务用 step accuracy / structure generalization;知识任务用 fact recall,以验证蒸馏效果。

典型用例:教育科技公司的数学解题助手,使用 OPD 蒸馏 7B 模型到 1B,在竞赛数学上提升推理步骤正确率;电商客服系统需定期更新产品知识,改为 forward-KL 蒸馏确保事实同步,同时保留推理能力。

局限

  • **合成框架与真实场景的差距**:论文的合成任务采用**随机查找表**表示事实知识,并通过**可组合的推理结构**模拟多步推理。这种抽象虽能精确控制变量,但与真实语言模型中**语义丰富、上下文相关**的知识表示存在本质差异。真实世界的事实推理涉及模糊匹配、同义改写和背景知识整合,而合成查找表是确定性映射。因此,从合成实验得出的“reverse-KL OPD 不传知识”结论,其普适性可能受限;论文虽在**事实 QA** 和**竞赛数学**上做了验证,但仅覆盖两类任务,且真实任务中知识边界难以完全界定。
  • **蒸馏配置覆盖不足**:论文主要比较了**reverse KL** 与 **forward KL** 两种散度,并揭示了它们在事实转移上的差异。但现代蒸馏实践中常用**混合散度**(如 KL 加权、α-divergence)或**温度调节**,这些未在实验中系统探索。此外,学生与教师的模型家族仅来自三个家族、四种规模,且学生初始化为**预训练检查点**,未考虑从零开始或不同预训练程度的场景。对“新知识”的界定也依赖于**随机分配的键值对**,未涉及真实世界中结构化、可泛化的知识类型。这些因素可能影响结论的完整性和可迁移性。
  • **缺乏可操作的解决方案**:与已有的**知识蒸馏**研究相比,本文定位为**诊断性分析**,指出了 **on-policy distillation** 在知识传递上的不对称性,但并未提出新的训练目标或正则化方法来同时提升知识传递和组合技能。例如,对于需要同时注入新事实和推理能力的场景,论文只建议替换为 forward KL 或调整 rollout 策略,但没有设计混合策略或自适应算法。因此,从工程落地角度看,它提供了方向性指导,但尚未形成端到端的优化方案,这限制了其直接应用价值。
论文Yixuan Tang2026-10-07原文

相关内容