论文

DOPD: 双重在策略蒸馏

DOPD: 双重在策略蒸馏

On-policy distillation (OPD) 通过使用密集的 token 级信号监督学生采样的轨迹,实现了优越的能力迁移。为了提供高质量的监督源并进一步提升蒸馏的性能边界,一个直观的方向是将特权信息注入教师或学生模型。然而,这种额外输入引入了一个潜在的失败模式,我们称之为特权幻觉 (privilege illusion):一种混淆了学生应弥补的可迁移能力差距与只能模仿而无法复现的信息不对称差距的模式。Token 级监督固有的非均匀性进一步放大了这一问题,其中只有一小部分 token 携带关键的能力承载信号。 为此,我们提出 DOPD,一种优势感知的双重蒸馏范式,基于教师和学生策略之间的优势差距和相对概率,动态路由 token 级监督。每个 token 从教师或学生自身接收不同强度、目标和策略的监督,从而传递可信能力的同时接收辅助信号,以缓解特权幻觉。 在大型语言模型 (LLM) 和视觉语言模型 (VLM) 设置上的大量实验表明,DOPD 持续优于 Vanilla OPD 及其他对应方法。稳定性、鲁棒性、持续学习和分布外任务的进一步结果验证了其优越性。

论文精读

TL;DR DOPD 通过动态路由 token 级监督解决 on-policy 蒸馏中的特权幻觉,将特权信息转化为可信能力迁移,显著提升 LLM 和 VLM 的蒸馏性能。

问题

当前知识蒸馏领域正聚焦于 on-policy distillation (OPD) ,通过学生自生成轨迹提供稠密 token 级监督,以最大化能力迁移。然而,为提升监督质量而引入的特权信息 (privileged information) 会诱发 特权幻觉 (privilege illusion) :传统 OPD 无法区分可迁移能力差距信息不对称差距——前者是学生应缩小的目标,后者仅能被模仿而无法复现(因推理时缺失特权输入)。token 级监督的非均匀性加剧了这一困境:仅极少数 token 携带关键能力信号,其余噪声 token 可能放大幻觉,导致蒸馏不稳定甚至负迁移。

该问题在 大型语言模型 (LLM)视觉-语言模型 (VLM) 的蒸馏中尤为关键,因为特权信息(如参考文本、高分辨率图像)在部署时不可得,学生模型容易表现出表面忠实而实质能力未提升。技术上,如何感知 token 级重要性并动态分配监督、将学习目标限定在真正可转移的维度,是挑战所在。业界对更高效的蒸馏范式需求迫切,因为这直接影响大模型在资源受限环境下的能力保留与泛化。

这类似于自动驾驶中,利用多传感器融合训练纯视觉模型,若不加区分地将融合特征作为监督目标,纯视觉模型将陷入模仿不可得信息的陷阱,导致实际部署中感知退化。

核心洞察

  • 首次系统定义 On-policy Distillation 中的 Privilege Illusion 失败模式:当教师或学生引入私有信息(privileged information)时,传统蒸馏会将可转移的能力差距与无法复制的信息不对称差距混为一谈,导致学生从源头上学习错误信号。该概念澄清了为何单纯注入特权信息无法线性提升蒸馏上限,反而可能破坏 token 级监督的信噪比,为后续自适应路由策略奠定了问题基础。
  • 提出优势感知双轨蒸馏(Advantage-aware Dual Distillation),动态为每个 token 选择监督来源:根据 teacher 与 student 在该 token 上的优势差距和相对概率,决定从特权教师或特权学生自身获取监督。这与现有工作固定使用教师或统一加权的方式根本不同,实现了 token 级别的细粒度知识迁移策略,让稀缺的、承载关键能力的 token 获得高置信度教师信号,而其他 token 从学生自身获取辅助正则化,从而缓解特权幻觉并提升整体稳定性和泛化性。

方法

输入

  • 学生模型在推理时自回归生成 token 序列,构成 on-policy 轨迹
  • 教师模型(通常更强或更大)
  • 特权信息(如额外上下文、视觉特征等)同时注入教师和学生,构建 特权教师特权学生

关键模块:优势感知双蒸馏

  1. 优势差距度量:对每个 token,计算特权教师与特权学生在该位置策略的 优势差 (advantage gap)相对概率,分别量化可迁移的能力落差和无法消除的信息不对称。
  2. 动态路由策略:根据优势差和概率比,为每个 token 动态分配监督来源——可来自教师或学生自身,并赋予不同的 监督强度、目标函数与策略。例如,优势差大且学生概率低时路由至教师进行强监督;优势差小时可能使用学生自引导的辅助信号,避免特权幻觉。
  3. 双目标优化:最终损失函数融合两路 token 级监督,自适应平衡能力迁移和信息对齐,抑制 特权幻觉 (privilege illusion)

输出

  • 训练完成的学生模型,在 LLM 和 VLM 设置下显著优于标准 OPD 及其他基线
  • 同时提升训练稳定性、鲁棒性、持续学习能力和分布外泛化

与同类方法差异

传统 OPD 对所有 token 统一使用教师信号,而 DOPD 通过 token 级自适应路由,依据优势差距区分能力可迁移性与信息不对称,从而缓解特权信息引发的幻觉。

实验

实验设计

论文在 LLMVLM 两大模态上验证 DOPD 的有效性,与 Vanilla OPD 及其他基线方法对比。评估维度覆盖蒸馏性能、鲁棒性、可扩展性、持续学习及分布外泛化。核心设计是让特权教师特权学生共享同一输入空间,但通过优势感知动态路由为每个 token 分配不同的监督来源与目标,从而解耦能力差距信息不对称差距

关键发现

  1. 性能提升:DOPD 在所有主实验上一致优于 Vanilla OPD 以及其他对比方法,证明双路蒸馏能有效提升容量迁移上限
  2. 训练稳定性:动态路由机制使得 token 级监督更加平滑,训练曲线波动减小,收敛更快。
  3. 鲁棒性与泛化:在持续学习和分布外数据上,DOPD 仍保持优势,说明并未过拟合特权信息,而是真正学到了可迁移的能力。
  4. Token 分析:仅少量关键 token 承载能力信号,DOPD 能自适应地增大这些 token 的监督权重,抑制非关键 token 带来的噪声。

与基线对比的深度解读

Vanilla OPD 直接将特权信息注入教师或学生,会引发特权幻觉——模型将不可复现的额外信息误认为可迁移能力,导致监督信号扭曲。DOPD 通过优势感知双路蒸馏,让每个 token 根据优势差距相对概率选择来自特权教师或特权学生的监督,既保证了监督的可信度,又提供了辅助信号,从而在容量迁移时避免幻觉。这种动态路由本质上是一种** token 级方差缩减**策略,对实际工程中如何高效利用特权资源具有直接启示。

行业影响

落地场景

DOPD 可赋能模型压缩与部署管线,尤其适用于需要实时响应或离线运行的场景。在智能客服对话、端侧AI助手、内容安全审核、工业缺陷检测等产品中,通过将大模型的知识高效迁移至小模型,实现接近大模型的能力同时保持低延迟与低成本。对于多模态任务,如视觉问答(VQA)、自动驾驶的场景理解,DOPD 能帮助车载芯片或移动设备上的轻量模型获得更可靠的推理能力。

商业价值

  • 降低推理成本:小模型算力需求远低于大模型,可减少云端 GPU 租用或 API 调用费用,边际成本显著下降。
  • 提升用户体验:端侧推理消除网络延迟,响应更快,且隐私数据无需上传,增强信任。
  • 开辟新的业务模式:基于 DOPD 蒸馏出的高性价比模型,可推出低价私有化部署方案,覆盖对安全与延迟敏感的企业市场。

与现有产品/工作流的接口

DOPD 作为一个蒸馏框架,可无缝嵌入现有模型训练流水线。在teacher-student范式基础上,仅需保存学生采样轨迹并引入动态路由模块,无需改动教师模型或推理架构。训练阶段可结合**强化学习微调(RLHF/DPO)**流程,在生成式 AI 产品中直接替换标准 on-policy 蒸馏环节。部署时,输出标准模型权重,与主流推理引擎(如 vLLM、ONNX Runtime)完全兼容。

具体落地 Use Case

  1. 电商平台智能客服:将大型语言模型的能力蒸馏到轻量聊天机器人,实现 7×24 小时高并发、低成本的精准问答,同时保持多轮对话的上下文理解与商品推荐质量。
  2. 自动驾驶感知系统:用于将多模态大模型(理解复杂交通场景)的知识迁移至车载芯片上的小模型,在低功耗硬件上实现实时环境理解与决策辅助,提升安全冗余。

局限

  • **对特权信息质量敏感**:论文未深入探讨不同类型的特权信息(如额外视觉输入、长上下文、工具使用)对 DOPD 的影响差异,实际应用中若特权输入噪声较大或与任务弱相关,优势感知路由可能失效,导致蒸馏退化。
  • **计算与实现复杂度增加**:DOPD 需要在每个 token 位置同时计算教师和学生策略的优势和概率,并动态决定监督来源与强度。相比普通 OPD,这一步引入了额外的前向传播和路由逻辑,可能拖慢训练速度,尤其在超大规模模型上部署时,工程成本不容忽视。
  • **仅限于 on-policy 设置**:该方法的前提是学生采样轨迹的 on-policy 性质,无法直接迁移到离策略蒸馏或数据集蒸馏范式。这一限制缩小了它的适用范围,因为许多工业场景出于效率或安全考虑倾向于使用离线数据集。
论文Xinlei Yu2026-06-29原文

相关内容