Latent-MOPD: 潜在多教师在线策略蒸馏
在线策略蒸馏(OPD)让学生在自身生成的回复上进行训练。现有的 LLM 多教师 OPD 仅通过教师的输出分布传递专家能力。我们提出 Latent-MOPD,据我们所知这是首个面向 LLM 的表征级多教师 OPD 方法:它同时利用专家的预测结果与计算这些预测所用的隐状态来整合已有专家,且无需额外训练教师。 方法上有三个关键设计: - 依据教师-学生关系选择后层作为监督目标; - 用共享投影弥合教师与学生之间不等的隐层宽度; - 按领域对更新进行分组。 每位教师的监督会从隐状态逐步转向 token 预测,两条通道始终使用同一个路由到的专家。 实验方面,在同家族主设置下,Latent-MOPD 在数学、代码、逻辑共九个基准上全面优于 token-only、representation-only 与 uniform-averaging 基线;参数量与各教师相同时,学生在多数基准上超过该基准的最佳教师。在规模更大、独立开发的跨家族教师下,Latent-MOPD 在所有基准上胜过两个单通道基线。同家族全层 representation-only 对照在领域纯净更新时保持稳定,但当一次更新内交错多个教师领域时会崩溃。 结果表明,单个学生能够通过输出分布与内部表征两条途径同时整合多位专家的能力。
论文精读
TL;DR Latent-MOPD 是首个 LLM 表示级多教师在线策略蒸馏方法,同时从多个专家的输出分布和隐藏状态学习,无需额外训练教师,在数学、代码、逻辑九个基准上超过单通道基线,并超越单个最佳教师。
问题
问题背景
当前多教师蒸馏关注让单个学生同时吸收多个 LLM 专家能力,尤其在 on-policy 设置下,学生使用自生成响应训练,减少分布偏移。业界希望用一个紧凑模型替代多个领域专家。
现有方法局限
- 现有多教师 on-policy 蒸馏(OPD)仅利用教师输出分布
logits作为监督,忽略教师隐藏状态中含有的中间推理知识,学生只能学到“最终答案”,难以继承推理过程。 - 表示级蒸馏虽能传递隐藏状态,但多教师下存在层选择、隐藏维度不统一、教师域交错导致更新冲突等问题;已有单教师表示蒸馏无法直接扩展到多教师。
- 论文摘要指出:同家族全层表示控制仅在域纯更新稳定,教师域交错时崩溃,说明现有表示对齐对批组织敏感,不具鲁棒性。
为什么难/重要
多教师表示对齐需要在不额外训练教师的前提下,协调多个专家内部表征与最终预测,且要处理架构差异和路由一致性。论文提出 Latent-MOPD 用共享投影桥接宽度、按域分组更新、跨淡从隐藏到 token,解决了监督冲突。结果显示同参数学生超越多数基准最佳教师,说明有效的多教师表示蒸馏能实现能力整合而非简单平均,对模型压缩和专家合并有实际价值。
行业类比
类似在端侧 AI 助手中,用一个轻量模型融合数学、代码、逻辑多个专家,既能保持各域准确率又能降低部署成本。
核心洞察
- Latent-MOPD 首次将多教师在线策略蒸馏从输出分布层面扩展到隐藏状态层面,通过共享投影、选择性晚期层对齐和按域分组的更新来协调多个专家的表示监督。与 token-only 多教师蒸馏相比,它保留了教师内部计算过程的信息;与单一教师表示蒸馏相比,它能整合多个领域专家而不发生表示冲突。每个教师使用相同的路由专家提供隐藏状态和 token 预测,并通过 crossfade 调度逐步从表示监督切换到预测监督,避免后期干扰。这解释了其为何能在同参数规模下超越多数基准的最佳单教师。
- 域纯更新与从表示到预测的 crossfade 调度是稳定多教师表示蒸馏的关键。论文的 representation-only 控制在教师域交错更新时崩溃,但域纯更新时保持稳定,说明隐藏状态监督对优化方向更敏感。Latent-MOPD 将更新按教师域分组,确保每个 step 只接受单一专家的表示目标,并且每个教师的监督权重从隐藏状态平滑过渡到 token 预测,避免训练后期表示目标与下游任务冲突。这一设计不同于 uniform-averaging 或固定权重表示融合,解决了多教师表示蒸馏中常见的表示冲突和训练不稳定问题。
方法
方法概述
Latent-MOPD 的目标是在在线蒸馏场景下,让单个学生模型同时吸收多个专家教师的能力。与只使用教师输出分布的 MOPD 不同,本方法额外引入教师的隐藏状态作为表示级监督信号。
输入与初始化
- 学生模型从参数合并的初始化开始,避免随机初始化带来的不稳定。
- 训练数据为在线生成的学生响应,按领域(数学、代码、逻辑等)分组。
- 每个教师提供两个通道的监督:token 预测分布和选定层的隐藏状态。
关键模块
- 领域路由 token 通道(MOPD 风格):每个样本根据领域路由到对应的专家教师,学生在该领域模仿教师的输出分布。
- 选择性晚层对齐:只对学生和教师之间关系较优的晚层进行表示对齐,减少不必要的约束,节省计算。
- 共享投影桥接宽度差异:教师的隐藏维度往往与学生不同,通过一个共享的线性投影将双方映射到统一维度后再计算表示损失。
- 按领域分组更新:每个更新步骤只使用同一领域的样本,避免教师领域交错带来的表示冲突,提升训练稳定性。
- 每个教师独立的 crossfade 调度:每个教师的监督信号从初期的表示隐藏状态逐步过渡到后期的 token 预测,且过渡节奏由教师本地时钟控制,两个通道始终由同一个路由专家提供。
输出
训练完成后,学生模型能够整合多个专家的预测分布和内部表示能力。在相同参数量下,学生超过每个基准上的最佳教师;在跨家族教师设置下也优于单通道基线。
与同类方法的差异点:这是首个在 LLM 多教师在线蒸馏中同时利用表示级和输出级监督的方法,并通过路由、投影、分组更新和逐教师 crossfade 机制协调多个专家,而非简单平均或仅使用输出分布。
实验
实验设计
论文围绕 Latent-MOPD 构建多教师 on-policy 蒸馏框架,学生以自身采样生成的响应为输入进行训练。主要设置采用 同族教师,即教师与学生参数规模相同,分别精通数学、代码、逻辑三个领域;扩展设置则使用 跨族教师,规模更大且独立开发。基线包括 token-only 蒸馏、representation-only 蒸馏以及均匀平均的多教师蒸馏。评估覆盖数学、代码、逻辑共九个基准。消融实验考察层选择、域纯更新 vs 域交错更新、参数合并初始化等因素。
关键发现
- 同族设置:Latent-MOPD 在所有九个基准上超过 token-only、representation-only 和 uniform-averaging 基线。
- 学生参数量与单个教师相同,但在多数基准上超过每个基准的最佳教师。
- 跨族设置:在更大、独立开发的教师面板下,Latent-MOPD 同样在所有基准上超越两个单通道基线。
- 表示监督从隐藏状态逐步过渡到 token 预测,两个通道使用同一路由专家,避免监督冲突。
- 同族全层 representation-only 控制在域纯更新下稳定,但教师域交错更新时崩溃,说明域分组更新的必要性。
与基线对比解读
Token-only 只利用输出分布,丢失中间表示信息;representation-only 在多个教师间难以对齐隐藏空间。Latent-MOPD 通过共享投影桥接不同隐藏宽度、按教师关系选择后期层目标、按域分组更新,有效协调多位专家的表示差异。学生超越每个基准的最佳教师,表明该方法并非简单平均,而是实现了能力整合。跨族扩展进一步证明其不依赖同源架构,对实际工程中复用不同来源的专家模型具有参考价值。
行业影响
落地场景
Latent-MOPD 可直接用于构建统一的 多能力 LLM。例如在 企业级智能助手 中,常需同时处理代码生成、数学计算、逻辑推理等任务。传统做法是部署多个专家模型并通过路由分发,但会增加延迟与运维复杂度。该方法允许用一个 student 模型蒸馏多个 teacher 的隐藏状态与输出分布,从而替代专家集合。
另一个场景是 代码托管平台 的 AI 代码补全/评审:不同编程语言或任务(如算法题、重构、测试生成)可由不同 specialist teacher 覆盖,蒸馏后得到单一轻量模型,降低推理成本,同时保持各领域能力。
商业价值
- 降本:减少必须在线服务的模型实例数,节省 GPU 内存和推理卡数;一个 student 可替代 3 个同参数量 teacher,直接降低 TCO。
- 体验提升:消除请求路由带来的额外延迟,统一模型响应更稳定;在多个 benchmark 上超过单个最佳 teacher,意味着用户不会因任务类型切换而损失质量。
- 迭代加速:新专家能力可通过 MOPD 高效注入现有模型,无需从头预训练,缩短产品功能上线周期。
与现有产品/工作流的接口
该方法可嵌入已有的 on-policy distillation 训练栈。需要额外实现的组件包括:
- 从多个 teacher 提取指定 late-layer 隐藏状态并存储(论文附录提供了 projector 构造方式);
- 构建 shared projection 对齐 hidden width;
- 按 domain 分组更新,并使用 per-teacher clock 控制 crossfade 从 hidden states 过渡到 token predictions。
推理阶段无需任何额外改动,student 是标准 Transformer,可直接替换现有模型权重。参数合并初始化 可与现有 merge 工具(如 TIES-Merging、DARE)结合,作为训练起点,进一步加速收敛。
局限
- 计算与存储开销较高。Latent-MOPD 需要同时加载多个 specialist teachers,并对每个教师执行前向传播以获取 late-layer hidden states,训练期间还需缓存这些表示、维护共享投影网络以及按域分组的更新,显存与算力显著高于单教师 on-policy distillation 或 token-only 多教师蒸馏。虽然论文提到无需额外训练教师,但推理阶段的教师并发与 rollout 成本仍是部署门槛,尤其当教师规模大于学生时,GPU 资源需求可能限制其推广到更大规模模型。
- 评估领域较窄,泛化性证据不足。主要实验集中在数学、代码和逻辑推理三类强结构化任务,九个 benchmarks 虽全面但未覆盖开放域问答、指令跟随、安全与事实性等通用能力。论文提及 general-benchmark performance stays close to the base,但仅作为辅助结果,未报告跨领域蒸馏后的潜在冲突或表示覆盖损失;在跨任务应用时,不同领域 teacher 的 hidden state 对齐目标可能不一致,学生能否保持通用能力仍需验证。
- 超参数设计复杂且对教师组合敏感。方法引入选择性 late-layer 对齐、跨宽度投影、域分组更新、per-teacher crossfade schedule、teacher-local clock 等多项组件,配置空间大,且消融显示层选择随教师面板变化,暗示最佳配置需根据具体 teacher set 重新搜索。相比之下,uniform-averaging 或 model merging 等基线更易于实现与调参,Latent-MOPD 的工程复杂度可能影响其易用性和复现性。