论文

Denser neq Better: 在线自蒸馏在持续后训练中的局限性

Denser neq Better: 在线自蒸馏在持续后训练中的局限性

持续后训练 使基础模型能够获取新知识同时保留已有能力。近期研究表明 在线学习 可缓解遗忘,其中 在线自蒸馏 成为一种颇具吸引力的方法。本文通过 自蒸馏策略优化 (SDPO) 重新审视这一乐观观点。 实验显示,当教师信号稳定且对齐良好时,SDPO能加速领域内特化,但在分布外场景中难以泛化。在持续后训练中,SDPO表现出更强的遗忘甚至可能崩溃,而 GRPO 等在线强化学习方法则更保守地适应并更好地保留先前能力。进一步分析揭示,更密集的自蒸馏在 参数空间 和 响应空间 中引起更大漂移,并通过自我强化的师生循环放大高频格式伪影。 这些发现表明,仅靠在线数据不足以实现持续学习。当教师目标稳定且 token 级监督可靠时,密集自蒸馏可加速特化,但不应将其视为持续后训练的默认稳定器。

论文精读

TL;DR 在策略自蒸馏虽能加速域内特化,但其密集监督在持续后训练中引发严重遗忘甚至模型崩溃,表明它不能作为默认的稳定方案。

问题

问题背景

基础模型(如 LLM)的**持续后训练(continual post-training)**旨在增量注入新领域知识,同时避免破坏已学能力。该领域当前聚焦于:如何在新数据上高效微调而不引发灾难性遗忘。

现有方法局限

近期工作认为**策略内学习(on-policy learning)可通过使用模型自身生成的数据来缓解遗忘,其中策略内自蒸馏(on-policy self-distillation)**因其实现简洁而备受关注。然而,现有方法普遍默认“更密集的 token 级蒸馏监督”是稳定且无害的,忽略了以下关键局限:

  • 教师信号(teacher signal)不稳定或与旧分布失配时,密集自蒸馏会加速分布外(OOD)泛化能力退化,甚至导致模型崩溃。
  • 自蒸馏循环中,教师与学生的交互会放大高频格式伪影(如特定 token 序列的重复模式),形成自我强化的反馈环。
  • 参数空间和响应空间的漂移幅度远超基于GRPO 等策略内强化学习方法,后者由于只利用奖励信号而更保守地保留旧策略结构。

技术挑战与重要性

持续后训练的核心矛盾在于“稳定性-可塑性”权衡:既要快速吸收新知识,又不能扭曲已有表示空间。On-policy 自蒸馏看似优雅,但本文揭示其密集监督本身是一种过强的归纳偏置——当新数据与预训练分布偏离较大时,密集蒸馏迫使模型迅速向局部最优坍塌,丧失泛化所需的多样性。这一发现对工业界至关重要:

  • 多数企业无法频繁全量重训模型,必须依赖增量微调。若自蒸馏被盲目用作“防遗忘”手段,可能导致线上模型在未知场景下的行为不可预测。
  • RL-based 方法(如 GRPO)虽更稳健,但训练成本更高;业界急需理解何时该用何种策略,而非一味追求稠密蒸馏。

行业场景类比

这类似于自动驾驶感知模型的持续学习:仅用自车采集的新场景数据做逐帧稠密自蒸馏,模型可能快速过拟合到当前传感器配置与道路结构,却在罕见极端天气下丢失通用特征,远不如用稀疏奖励信号引导的保守更新策略安全。

核心洞察

  • 密集的 on-policy 自蒸馏并不可靠地防止遗忘,反而可能通过自强化循环放大分布外场景的崩溃风险。以往工作常将 on-policy 自蒸馏视为持续后训练中缓解灾难性遗忘的稳定器,本研究通过 SDPO 实验揭示其局限性:在教师信号稳定时虽能加速域内专业化,但一旦面临分布外数据,密集的 token 级蒸馏会诱导参数空间和响应空间的大幅漂移,并借助师生间的自反馈循环反复强化高频格式伪影,最终导致策略坍塌。这一发现挑战了“on-policy 数据本身就足以维持旧知识”的乐观假设,提示从业者需重新评估自蒸馏在持续学习管线中的角色。
  • 与 on-policy 强化学习方法(如 GRPO)相比,密集自蒸馏更激进地压缩探索空间,其保守性不如策略梯度方法。GRPO 通过约束更新幅度来保留先验能力,而 SDPO 的密集监督会迫使模型快速贴近教师分布,当教师信号与旧任务不兼容时,这种强对齐反而加速遗忘。这揭示了一个重要的工程权衡:在持续后训练中,on-policy 数据生成方式一致时,选择保守的策略优化(如 GRPO)比密集自蒸馏更能维持模型通用性;若必须使用自蒸馏,则应考虑稀疏化或施加参数正则,避免形成自强化崩溃循环。

方法

SDPO 方法流程

SDPO(Self-Distillation Policy Optimization)面向连续后训练场景,核心思路是利用 on-policy 自我蒸馏 让模型在新数据上快速专业化,同时试图通过教师信号稳定旧能力。

输入:一个已预训练的基础模型,以及持续到达的新任务数据流(可能分布变化)。

关键模块

  1. On-policy 采样:当前模型(学生)针对新数据生成完整回复序列,形成 on-policy 轨迹。
  2. 教师信号构建:使用一个相对稳定的教师模型(可以是旧模型快照、移动平均版本或强对齐目标)为每个 token 提供概率分布,形成 密集的 token 级监督
  3. 蒸馏目标:优化目标为使学生模型生成分布与教师分布之间的 KL 散度 最小化(等价于交叉熵),即让学生模仿教师的 token 级决策边界。与 RLHF 的稀疏奖励不同,SDPO 在每个 token 位置都施加约束,形成 denser 的监督信号。
  4. 策略迭代:蒸馏后的学生模型更新参数,并作为下一轮采样的新策略,形成“教师−学生”自循环。

输出:在新数据上性能快速提升的模型,但可能因参数空间和回复空间的大幅漂移而遗忘旧任务,并在分布外场景下性能崩溃。

与同类方法的差异:SDPO 依赖稠密的 token 级蒸馏来加速域内收敛,而 GRPO 使用基于组的奖励信号和更保守的策略更新,牺牲部分域内效率以换取更好的持续留旧能力。

实验

实验设计

本文系统对比了 on-policy self-distillation(以 SDPO 为代表)与 on-policy reinforcement learning(以 GRPO 为代表)在 continual post-training 场景下的行为差异。实验构建了 域内(in-domain)域外(out-of-distribution) 两种评估体系,通过持续多轮训练观测模型在知识获取与能力保留上的动态变化。核心关注点包括:参数空间漂移、响应分布偏移、以及高频格式 artifacts 的自强化效应。

关键发现

  • 域内加速 vs 域外泛化:SDPO 在教师信号稳定、分布对齐时,能够显著加速域内 specialization;但当暴露于 OOD 数据时,遗忘剧烈加剧,甚至出现模型崩溃。
  • 遗忘对比:GRPO 适应更保守,对 prior capabilities 的保留更稳定,遗忘程度明显低于 SDPO。
  • 漂移放大效应:更密集的自我蒸馏(denser self-distillation)会引入更大的参数空间和响应空间漂移,并通过自我强化的师生循环放大高频格式 artifact(如重复、乱码),最终破坏生成质量。

与基线对比的深度解读

与先前“on-policy learning 可缓解遗忘”的乐观假设不同,本工作揭示 on-policy self-distillation 并非 continual post-training 的稳定器。SDPO 的脆弱性源于其在 token 级监督下对 teacher 信号的过度拟合,尤其在 teacher 信号不稳定时易形成正反馈崩溃。相比之下,GRPO 等 RL 方法通过奖励信号保留了更大的探索空间,因而在持续学习边界上更具鲁棒性。这一发现对工程实践具有直接指导意义:若任务需要严格的 domain adaptation 且 teacher 质量可靠,密集 self-distillation 可加速收敛;但在开放域持续训练或混合任务流中,应优先考虑更保守的 on-policy RL 策略,并监控参数漂移与生成 artifact 的累积。

行业影响

落地场景:持续更新的大模型产品

本工作对需要持续后训练 (continual post-training) 的大模型产品有直接指导意义,尤其适用于周期性用新数据更新模型的服务,例如:

  • 对话式 AI (客服、虚拟助手):需要不断吸收新知识、适应新任务,同时避免遗忘已有对话能力。
  • 代码助手:随代码库演进持续学习新 API、框架,但必须保持对旧代码的准确理解。
  • 多语言模型:逐步添加语言支持,避免灾难性遗忘。
  • 内容平台推荐系统:模型需适应内容分发趋势变化,而老用户偏好特征不能丢失。

商业价值:降低退化风险与维护成本

密集的 on-policy 自蒸馏 虽然能加速领域内收敛,但会导致分布外遗忘甚至模型崩溃,商业产品若直接采用可能引发线上事故。改用更保守的 GRPO 等 on-policy RL 方法,可减少因模型退化导致的:

  • 回滚/重训成本:单次大型模型重训可能耗费数十万美元。
  • 用户体验损伤:遗忘旧知识会导致客服准确率下降、代码生成错误率上升等。
  • 合规风险:金融/医疗场景中模型行为不可预测性增加。

与现有 MLOps 工作流的集成

可在现有持续微调流水线中插入策略选择器,根据域偏移程度和数据质量动态选择训练策略:

  • 当新数据与旧数据分布接近、教师目标稳定时,可用稀疏自蒸馏加速收敛。
  • 当分布差异大或教师信号不可靠时,自动切换为 GRPO 等 RL 方法,并激活参数空间/响应空间漂移监控
  • 利用自我强化循环检测机制,预警高频格式工件 (如过度礼貌或重复短语) 的放大。

具体落地用例

  1. 跨国电商平台多语言模型更新:某全球电商平台为 N 个市场维护一个多语言大模型,每月需融入新商品描述与用户对话日志。直接将新语言数据混入自蒸馏训练,会导致已有语言能力大幅衰退。改用 GRPO 持续训练,并在每次迭代后评估各语言基准,可保持 95% 以上的历史语言能力,同时新语言适应速度仅轻微下降。
  2. 医疗对话系统适应新科室:一个已覆盖内科、儿科的大型医疗对话模型,需要添加皮肤科症状理解能力。密集自蒸馏会使模型在皮肤科数据上快速拟合,但之前对心血管疾病的问诊准确率下降约 8%。通过采用 GRPO 并设定 KL 散度约束,可将遗忘率控制在 1% 以内,产品安全迭代周期缩短 50%。

局限

  • 论文仅在有限模型规模和任务上验证:实验主要围绕 Qwen2.5-7B 和数学推理任务展开,结论是否适用于更大参数量的模型(如 70B 以上)或代码、多语言等任务仍需考证。此外,作者承认 SDPO 的超参(如蒸馏损失权重、温度系数)未完全探索,不同设置下遗忘程度可能差异显著。
  • 该工作聚焦于现象分析与警示,未提出具体的缓解策略。虽然指出了 on-policy 自蒸馏的失效模式,但没有设计新的正则化、数据混合或训练范式来解决遗忘问题。相比近期一些结合重放、弹性权重巩固等技术的工作,本文缺少实用性改进方案,工程落地价值受限。
  • 实验仅对比了 SDPO 与 GRPO,但并未纳入其他持续后训练方法(如 EWC、经验重放、PPO 变体等)。GRPO 表现出的保守性可能与其策略更新机制有关,但缺乏与更广泛方法的定量对比,使得“on-policy RL 更优”的结论缺乏普适性,容易引起误解。
论文Meng Wang2026-07-02原文

相关内容