On-Policy 还是 Off-Policy 学习?对蒸馏动态的一项系统性研究
On-policy 学习被认为能减少灾难性遗忘、产生更稀疏的参数更新并提升泛化,但已有对监督微调与强化学习的比较同时改变了诸多因素,使 rollout policy 的贡献难以单独分离。 我们在受控的强到弱蒸馏设定下独立变化 rollout policy、token 级 KL 方向 与 学习率,覆盖 Llama3、Qwen2.5 家族及科学、医学、算术推理任务。结果显示出一幅更细致的蒸馏动态图景:rollout policy 未必是核心因素,反倒是 token 级 KL 方向更明显地塑造任务性能与输出覆盖度,而学习率主导遗忘与更新稀疏性。 KL 梯度 分析与沿连续 student-teacher rollout-policy 谱系的实验解释了这一模式:forward KL 对 rollout policy 相当鲁棒,性能稳定且优异;reverse KL 则敏感得多,更偏好 student 生成的 rollout。同时,on-policy 数据在两种 KL 方向下都能提升对更难 Countdown 算术变体的泛化,但该优势在后续 RLVR 之后并不能可靠保持。 这些结论在移除梯度裁剪、改用采样 KL 估计器、以及训练更长推理链任务时依然稳健。总体而言,我们的结果挑战了 on-policy rollout 天然更可取的观点,表明其价值关键取决于目标函数、评测设置与优化超参数。
论文精读
TL;DR 在强到弱蒸馏中系统控制变量,发现 rollout policy 影响有限,token 级 KL 方向决定性能与覆盖,学习率主导遗忘与稀疏度;forward KL 对 on/off-policy 鲁棒,reverse KL 更依赖 on-policy 数据。
问题
领域现状:当前 AI 训练社区在强到弱蒸馏和推理模型微调中,频繁争论 on-policy 与 off-policy 数据策略,核心关注点是 rollout policy 对泛化、遗忘与参数更新的影响。
现有方法局限:以往对比常将 SFT 与 RL 并置,同时改变目标函数、数据分布、优化器超参等多个变量;例如一些工作声称 on-policy 能减少灾难性遗忘或产生更稀疏更新,却无法排除 token-level KL 方向、学习率等混淆因素。缺少在控制其他变量下、仅改变 rollout policy 的系统研究。
为何困难且重要:技术难点在于需要解耦 rollout policy 与 KL 散度方向、学习率之间的交互效应:forward KL 对 rollout policy 可能更鲁棒,而 reverse KL 更依赖学生生成样本;学习率则主导遗忘与稀疏性。业界关注度高,因为 on-policy 数据采集需持续与环境交互,成本远高于离线数据重放,若 off-policy 在特定目标下效果等价,可显著降低训练开销。
行业类比:类似自动驾驶中仿真数据与实车数据的配比决策——错误的 rollout 策略会引入分布偏移,导致闭环性能骤降。
核心洞察
- Token-level KL 方向而非 rollout policy 才是蒸馏性能与输出覆盖的主导因素。本研究在 Llama3 与 Qwen2.5 上独立改变 rollout policy、KL 方向与 learning rate,发现 **forward KL** 对 rollout policy 几乎不敏感,性能稳定;**reverse KL** 则敏感且偏好 student-generated rollouts。这直接反驳了“on-policy 天然更优”的默认假设,说明工程上可优先选 forward KL + off-policy 数据,大幅降低采样成本,且无需复杂在线采样管线。
- On-policy 数据仅带来任务相关的泛化优势,且难以在后续 RLVR 中保持。研究在 **Countdown** 的更难变体上观察到 on-policy 数据能提升泛化,但在两种 KL 方向下经过 **RLVR** 后优势不再稳定。这一差异揭示 on-policy 的价值依赖于评测设置与优化目标,与以往基于灾难性遗忘的广泛结论不同。对工程师的启示:在引入 on-policy 采样前,需先确认目标是否为分布外泛化,并评估下游 RL 是否可能消解该增益。
方法
输入
- 学生模型与教师模型:均来自 Llama3 和 Qwen2.5 系列,学生规模小于教师(强到弱蒸馏)。
- 训练数据集:覆盖科学、医学、算术三个推理领域,包括数学推理 Countdown、科学 QA、医学 QA 等,并划分 in-distribution 和 out-of-distribution 变体。
- 控制变量:rollout policy(on-policy 学生生成 / off-policy 教师生成)、token-level KL 方向(forward KL / reverse KL)、学习率。
关键模块与流程
- 蒸馏目标:使用 token-level KL 散度作为蒸馏损失,分为 forward KL(教师分布为参考)与 reverse KL(学生分布为参考)两种方向。rollout policy 决定训练时用于生成响应序列的来源。
- 对比实验设计:通过网格搜索独立变化三个变量,在相同模型和数据集上训练多个 checkpoint,同时固定其他超参数,排除混淆因素。
- 梯度分析:推导 token-level KL 损失的梯度表达式,分析 forward KL 与 reverse KL 对 rollout policy 的敏感程度差异。构造rollout-policy spectrum,在纯教师生成到纯学生生成之间连续插值采样 rollout 分布,验证理论预测。
- 鲁棒性检验:移除梯度剪裁、使用采样 KL 估计器、在需要更长推理链的数学任务(Numina-MATH)上重复实验。
输出与评估
- 输出为蒸馏后的学生模型,在 in-distribution 与 out-of-distribution 任务上的准确率、遗忘程度、参数更新稀疏度以及响应覆盖率。
- 额外进行 RLVR 后训练,检验蒸馏阶段 rollout policy 的优势是否在后续 RLVR 中保留。
与同类工作的差异:以往研究将 on-policy 与 off-policy 学习混入 SFT 与 RL 等多种因素同时变化,本研究在单一蒸馏框架内隔离 rollout policy、KL 方向和优化超参数,系统揭示各因素独立贡献。
实验
实验设计
本研究在 strong-to-weak distillation 框架下,通过独立变化 rollout policy(on-policy vs off-policy)、token-level KL direction(forward KL vs reverse KL)以及 learning rate,系统考察蒸馏动力学。模型选用 Llama3 与 Qwen2.5 系列,任务覆盖科学推理、医学推理、算术(Countdown)及更长推理链的数学推理(Numina-MATH)。实验还包括移除梯度裁剪、使用 sampled KL 估计器、构建 student–teacher rollout-policy 连续谱,以及后续 RLVR 阶段评估。
关键发现
- rollout policy 并非核心变量:在 forward KL 下,性能对 rollout policy 变化高度稳健;reverse KL 则敏感,且偏好 student-generated rollouts。
- KL 方向主导输出覆盖:forward KL 保持较宽的输出分布,reverse KL 易导致模式坍缩。
- 学习率决定遗忘与更新稀疏性:高学习率加剧遗忘但提升稀疏性,该现象与 rollout policy 无强关联。
- on-policy 优势有限:仅在 Countdown 任务的更难变体上改善泛化,且该优势在后续 RLVR 后不持久;对其它任务无显著增益。
- 稳健性验证:上述结论在无梯度裁剪、采样 KL、更长推理链任务下依然成立。
与基线对比
传统观点认为 on-policy 学习能减少灾难性遗忘、产生稀疏更新并提升泛化,但大多来自同时改变多个因素的 SFT/RL 对比。本研究通过严格分离变量,揭示 on-policy 的优势高度依赖于 KL 方向、任务类型及优化超参数,挑战了 on-policy 固有优越性的论断,为强化学习与蒸馏实践提供了更细致的选型依据。
行业影响
落地场景
本次研究揭示了蒸馏中 on-policy 数据的真实价值边界,对需要压缩大模型至边缘或低成本服务的场景尤为关键。例如 电商搜索/推荐系统 中,将百亿参数教师模型蒸馏为可部署的轻量模型时,采用 forward KL 配合 off-policy 教师滚动数据即可获得稳定性能,无需维护昂贵的在线采样管道。同样在 内容平台智能问答 或 教育辅导模型 中,减少对实时生成数据的依赖可显著简化数据链路。对于需要强泛化到更难推理任务(如数学竞赛题)的产品,可阶段性引入 on-policy 数据增强,但不必作为常态配置。
商业价值
主要体现为降本与稳健性提升。forward KL 对 rollout policy 的不敏感性意味着企业不必频繁更新训练数据分布,可复用离线教师标注或历史日志,降低数据采集与带宽成本。同时,学习率作为控制灾难性遗忘和参数更新稀疏性的关键旋钮,为模型持续迭代(如每周增量更新)提供了更明确的调优方向,减少因遗忘导致的线上事故和回滚成本。在医疗或金融等合规要求高的领域,减少 rollout 采样可以有效降低隐私数据暴露面,加速审计流程。
与现有产品/工作流的接口
该结论可直接集成到现有的 LLM 微调流水线。当前许多团队默认采用 on-policy RL 或蒸馏框架,本文建议首先评估 KL 方向:若目标是模型压缩和快速部署,优先采用 forward KL + off-policy 设置,可直接对接已有的离线数据集和 Hugging Face TRL/transformers 训练栈。若必须使用 reverse KL(如 RLHF 风格),则应配置学生自生成 rollout 的在线采样环境。实际工程中可将 rollout policy 作为超参,通过小规模消融确定最优配置,无需重构数据管道。此外,梯度裁剪、采样 KL 等细节对结论的鲁棒性已得到验证,便于无障碍迁移。
局限
- 研究局限于 **strong-to-weak distillation** 范式与 **Llama3**、**Qwen2.5** 两个模型家族,任务仅覆盖科学、医学、算术三类推理,未涉及开放域对话、代码生成等更复杂场景。尽管作者通过移除梯度裁剪、使用采样 KL 估计和更长推理链等消融验证了鲁棒性,但结论仍可能不适用于更大规模模型(如 70B 以上)、不同架构(如 MoE)或与其他强化学习目标(如 PPO、DPO)结合的情况。实际工程中,团队若直接将这些发现推广到生产级 RLHF 管线,需谨慎验证。
- 论文发现 on-policy 数据在 **Countdown** 算术任务的困难变体上能提升泛化,但该优势在后续 **RLVR** 阶段后不一定持续,说明结论高度依赖评估时机与下游微调阶段。此外,分析主要聚焦 token-level KL 方向,对 sequence-level KL 及其在长程推理中的表现讨论有限(虽在附录提及),可能遗漏了影响蒸馏动态的其他关键因素,如奖励塑形、熵正则等。这提示从业者在设计蒸馏流程时,不能仅凭单一阶段的实验结论做决策。
- 理论部分为 forward KL 推导了 distribution-free 的 rollout-stability bound,但 **reverse KL** 缺乏类似的无分布界,只能在控制 likelihood ratios 的条件下得到较弱保证,这限制了理论结果的实用性。同时,实验对学习率做了对比,但未系统探索温度、batch size、优化器动量等超参数的交互影响,而这些在实际训练中往往与 rollout policy 产生耦合。与一些同时期工作相比,本文未提出新的算法或改进方案,更像一份实证分析报告。