基于负策略 Rollout 的 On-Policy Distillation
On-Policy Distillation (OPD) 作为一种后训练方法已被广泛研究:学生模型在自身的 rollout 上从更强的教师模型获得 token 级监督。近期工作通过改进蒸馏奖励形式与教师配置提升了 OPD,但蒸馏目标仍以模仿教师为核心。然而,当更强的教师与学生的分布重叠有限时,这种正向指导可能提供不足的学习信号。 本文提出 Negative-Policy OPD (NP-OPD),用来自性能更弱、能力更低的负策略 (negative policy) 的 rollout 补充教师监督,为学生提供负向参考。NP-OPD 不修改蒸馏奖励形式,而是在 rollout 阶段引入负策略,持续提供负策略相对教师更偏好的 token,使其在整个训练过程中始终暴露于教师监督之下。这既通过负策略 rollout 给出显式负向信号,又保留了 OPD 中的正向教师监督。 大量实验表明,NP-OPD 在模型规模、生成模式、推理领域以及不同 OPD 变体上均能改进 OPD。分析进一步显示,NP-OPD 能有效抑制负策略相对教师更偏好的 token,并使学生远离负策略。这些结果支持了通过负策略 rollout 引入负向信号的设计,并为理解 rollout 策略在 OPD 中的作用提供了新见解。代码将发布于 https://github.com/naver-ai/np-opd。
论文精读
TL;DR 提出 NP-OPD,在 on-policy distillation 中引入低能力负策略的 rollout 作为负参考,持续暴露负策略偏好的 token 给教师监督,显式抑制这些 token,提升蒸馏效果,跨模型规模与推理任务有效。
问题
问题背景
LLM 后训练阶段,蒸馏被广泛用于将大教师模型能力迁移至更小的学生模型,其中 On-Policy Distillation (OPD) 通过学生在自身上下文中的 rollout 获得教师 token 级监督,保持训练与推理分布一致。
现有方法局限
当前 OPD 变体主要改进 蒸馏奖励公式 或 教师配置,但目标仍是单纯模仿教师输出。当教师与学生能力差距大、分布重叠有限时,教师只在学生已经能生成的高概率 token 上给予正监督,对教师与学生分歧明显的 token 缺乏充分区分信号。学生无法感知哪些 token 是教师明确不偏好的,容易陷入低质量的局部策略,且仅靠正监督难以将学生推离这些次优区域。
为什么难/重要
引入负信号用于蒸馏并非新思路,但如何在不破坏 on-policy 训练稳定性的前提下构建与当前学生策略相关的负样本是关键挑战。直接修改奖励函数会增加工程复杂度和超参敏感性;而 NP-OPD 通过 rollout 阶段引入负策略,保留了 OPD 正监督目标不变,同时不断暴露负策略偏好的 token 给教师监督,使负信号自然融入训练。业界对高效后训练和模型对齐高度关注,蒸馏是降低推理成本的核心路径,提升 OPD 的样本效率与鲁棒性具有直接工程价值。
行业类比
类似 RLHF 中需要偏好对(chosen/rejected)来学习奖励模型,NP-OPD 为蒸馏引入“负参考策略”,好比让学徒不仅模仿大师的示范,还持续观察错误示范以主动规避坏习惯。
核心洞察
- NP-OPD 提出在 on-policy 蒸馏的 rollout 阶段引入一个低能力负策略,用其生成的轨迹作为负面参照,从而在保留教师正面监督的同时提供显式的负向学习信号。该方法与现有工作形成差异:以往研究多通过修改蒸馏奖励公式或调整教师配置来改进 OPD,而 NP-OPD 从数据生成层面入手,直接改变了学生所见的 token 分布,这为解决教师-学生分布重叠有限时的学习信号不足问题提供了一种正交且直接的途径。
- 该工作的工程启示在于:通过 rollout 策略的干预,而非损失函数的重设计,可以更高效地引入对比信号,且这种改动与任何 OPD 变体兼容,例如 ExOPD 和 OPD2 等。实验证实 NP-OPD 能一致提升性能,并有效抑制负策略偏好的 token,推动学生策略远离负策略。这揭示了在 OPD 中,rollout policy 不仅是教师监督的载体,更是一个可主动塑造负样本、增强学习信号区分度的关键维度,为后续的蒸馏策略设计提供了新的操作空间。
方法
输入与角色定义
- 学生模型:待优化的目标策略,通常为中等规模 LLM。
- 教师模型:更强的 LLM,提供 token 级监督信号。
- 负面策略模型:性能较差、能力较低的参考策略(如更小规模模型或早停 checkpoint)。
- 训练提示集与各策略生成的 rollout 序列。
关键模块:负面策略 rollout 引入
- 负面策略采样:在每次训练迭代中,除学生自身 rollout 外,额外运行负面策略模型生成序列;这些序列中,负面策略偏好的 token 往往与教师分布不一致。
- 教师监督暴露:不修改 OPD 的蒸馏奖励公式(如 token 级 KL 散度或似然目标),而是将负面策略 rollout 中的 token 作为额外输入,让教师对这些 token 给出低概率评分,形成显式负监督信号。
- 联合优化目标:学生模型同时接收来自自身 rollout 的正向监督(模仿教师)和来自负面 rollout 的负向监督(抑制负面策略偏好),更新参数。
输出与效果
- 训练后的学生模型在推理任务上性能提升,并远离负面策略的分布。
- 实验表明该方法在多种模型规模、生成模式、推理域和 OPD 变体上均有效。
跟同类方法的差异点
与 ExOPD 等通过修改蒸馏奖励公式引入负信号的方法不同,NP-OPD 保持奖励公式不变,仅在 rollout 阶段引入负面策略,从而更直接地将负面 token 暴露于教师监督之下。
实验
实验设计
NP-OPD 在多个维度验证有效性:覆盖不同模型规模、生成模式(贪心解码/采样)、推理领域和 OPD 变体(如 ExOPD、OPD²)。方法在 rollout 阶段引入一个能力较弱、表现较差的负策略,将其生成的 token 序列与教师监督结合,不修改原始蒸馏奖励形式。与标准 OPD 基线对比,评估性能变化。
关键发现
实验表明 NP-OPD 在所有设置下均提升 OPD 效果,证明负策略 rollout 提供的显式负信号能有效补充教师正信号不足(当学生与教师分布重叠有限时)。深入分析显示,NP-OPD 成功抑制了负策略偏好于教师的 token,并推动学生远离负策略,从而改善蒸馏效果。
基线对比解读
与现有 OPD 改进工作不同,NP-OPD 不改变蒸馏奖励公式或教师配置,而是从 rollout 策略入手引入负参照。这为 OPD 中 rollout 策略的作用提供了新见解:负样本的持续暴露辅助学生区分正确与错误模式。相比仅靠正向模仿,正负结合的信号更具判别力,尤其在教师与学生分布差异较大时。
行业影响
落地场景
NP-OPD 主要适用于需要将大模型能力蒸馏到小模型以降低推理成本的场景,例如电商客服机器人、代码助手、金融领域的自动报告生成或企业级 RAG 问答系统。在这些产品中,小模型需要接近大模型的输出质量,但现有 on-policy distillation 在教师与学生分布重叠有限时信号不足。引入一个低能力负策略(例如更小的模型、早期 checkpoint 或规则系统)不间断生成“坏”rollouts,可让学生模型明确避免错误模式,对推理任务、多轮对话、长文本生成等分布差异大的场景尤其有效。
商业价值
核心价值在于在不增加推理成本的前提下提升小模型性能。企业可以用便宜的小模型服务更多请求,同时保持接近大模型的准确率,直接降低 GPU/API 成本。此外,NP-OPD 不修改奖励函数,只改变 rollout 来源,实现简单,训练成本增加有限(只需额外采样负策略序列),却能显著减少学生模型在困难 case 上的错误,提升用户满意度与留存。对于需要高频迭代的产品,该方法可将新数据快速转化为模型升级,缩短上市时间。
与现有产品/工作流的接口
NP-OPD 可作为现有 post-training 蒸馏流程的插件:
- 现有 OPD/RLOO/DPO 等训练脚本中,只需在采样阶段额外调用一个负策略模型(可复用旧版本、更小模型或 reward 较低的策略)生成 rollout。
- 保持原有 loss 和超参不变,将负策略 rollouts 与学生自身 rollouts 混合送入教师模型计算 token 级监督。
- 适合已使用 vLLM/SGLang 等推理引擎的框架,负策略可部署在同一 GPU 集群,用较低并发占用资源。
- 监控指标可关注学生与负策略分布的 KL 散度下降、教师 logprob 提升,验证负信号是否被吸收。
具体用例:
- 电商平台客服助手:教师为超大模型,学生为 7B 模型,负策略为 1.5B 模型,训练后学生在处理退货、物流等复杂对话时错误率降低,减少人工介入。
- 企业代码补全工具:教师为旗舰代码模型,学生为轻量模型,负策略为无监督预训练模型,避免学生生成风格类似负策略的无效补全。
局限
- **额外计算与策略选择**:NP-OPD 在训练过程中需要同时维护并调用一个额外的低能力负策略模型,每次 rollout 需从学生、教师、负策略三方采样,推理成本显著增加。论文未系统讨论负策略的获取方式(如用较小的预训练模型、提前停止训练的模型等)及其规模选择对最终效果的敏感性,实际部署时需额外调参和资源规划。
- **适用边界有待扩展**:实验覆盖了多个模型规模、生成模式、推理域和 OPD 变体,但全部在 on-policy distillation 框架内验证,未与更广泛的 post-training 方法(如 PPO、DPO、KTO 等)结合或对比。负信号通过 token 级监督传递,可能无法完全解决学生与教师分布不重叠导致的根本性问题,在非推理型任务(如指令跟随、开放式对话)上的效果尚不明确。