论文

MOPD-Router: 重新思考多教师在线策略蒸馏中的教师路由

MOPD-Router: 重新思考多教师在线策略蒸馏中的教师路由

多教师在线策略蒸馏 (MOPD) 能将多个专门化能力整合进单一学生模型,但现有做法通常将每条 prompt 在整段 rollout 中硬路由到领域匹配的教师。这种对 prompt 级领域标签的依赖限制了无标签混合数据的使用,也浪费了其他教师的互补信号。 我们提出 MOPD-Router,一个在每个 token 上对全教师池进行监督路由的框架,无需领域标签,也无需训练单独的路由模型。其插件式接口支持不同的度量来选择并加权各教师的 OPD 信号。在该接口下,我们提出 ExpertAlign:它依据某教师在当前 token 对学生所做的修正是否体现该教师在 post-training 中获得的专长来为其打分,并与两个参考度量对比 —— 基于教师置信度的 Entropy 和基于师生差异的 Novelty。 在强到弱与同规模蒸馏场景下的无标签及有标签混合数据实验中,ExpertAlign 在四种设定下均取得最佳整体表现:无标签数据上比 Mean 聚合提升 5.88 (+12.3%) 分;有标签数据上在不使用领域标签的情况下超过标准 MOPD 3.95 (+7.8%) 分。 结果表明,token 级路由 能利用跨域互补监督,减少对 prompt 级领域分配的依赖。代码见:https://github.com/TURLEing/MOPD-Router。

论文精读

TL;DR MOPD-Router 在 token 级别动态路由多教师监督信号,无需域标签即可融合互补专长;其 ExpertAlign 指标在无标签和域标签场景下均显著超越现有 MOPD 方法,最高提升 12.3%。

问题

问题背景

多教师在线策略蒸馏(MOPD)的目标是把多个专用教师的能力集成到单个学生模型中,但现有做法通常按 prompt 级别进行硬路由:把一个 prompt 完整地分配给某个领域匹配的教师,整个 rollout 都只用该教师的监督信号。

现有方法局限

这种 prompt-level hard routing 有三个明显技术限制:

  • 依赖领域标签:训练混合必须带有 prompt 级 domain label,否则无法决定路由目标,直接限制了对大量未标注混合数据的使用。
  • 丢失跨域互补信号:其他领域教师的输出即使在当前 token 上能提供有价值的知识,也会被完全忽略,导致学生无法吸收跨教师的可迁移能力。
  • 路由粒度太粗:整个 rollout 固定一个教师,无法适应生成过程中不同 token 对知识来源的动态需求,尤其当学生已经比某些教师更强时,按领域匹配可能不是最优的监督依据。

为什么这个问题难/重要

核心难点在于 token 级路由必须做到 无额外路由模型、无领域标签 的前提下,实时判断哪个教师的 OPD 信号对当前 token 最有价值。论文提出的 ExpertAlign 思路是:看教师的修正方向是否体现了该教师在 post-training 中获得的专长,而不是简单地看教师置信度或师生差异。这需要在每个 token 上高效计算教师专长表示,同时避免引入训练不稳定或计算开销过大。业界对多教师蒸馏的关注集中在如何从异构教师池中自动选择高质量监督,尤其在 strong-to-weak 和 same-size 场景下,标签缺失时的路由策略直接决定了集成效果的上限。

行业类比

类似多智能体协作中动态选择最合适的专家来提供反馈,而不是让一个固定智能体从头到尾负责整个任务,这样能提升最终策略的综合质量。

核心洞察

  • Token-level routing 是 MOPD 范式的关键转变:不再依赖 prompt 级别的领域标签将整个 rollout 硬路由给单一教师,而是在每个 token 上动态选择教师监督,从而利用跨领域互补信号,使无标注数据也能用于训练。与现有硬路由方法相比,这解除了对标注的限制,并允许学生从多个专家教师同时受益。
  • ExpertAlign 指标的核心是衡量教师对学生的纠正是否表达了该教师在 post-training 中获得的专业化能力,而非仅仅看教师置信度(Entropy)或师生差异(Novelty)。实验发现教师置信度作为路由信号不可靠,存在熵偏置和校准问题;而 ExpertAlign 通过 token 级的专业化评分,能更精准地选择提供有效监督的教师,从而实现更强性能。

方法

MOPD-Router 将多教师在线策略蒸馏从 prompt 级硬路由改为 token 级动态路由,无需领域标签,也无需额外路由模型。

输入 → 关键模块 → 输出

  1. 输入:未标注或领域标注的训练提示,学生策略模型 roll-out 产生的 token 序列,以及一组经过后训练的专业教师模型。
  2. 关键模块:Token-Level Metric Routing
    • 对每个 token 位置,根据选定的度量计算每个教师的分数。
    • 插件式接口支持三种度量:
      • Entropy:教师输出分布的置信度(低熵表示更确定)。
      • Novelty:教师预测与学生预测的差异,差异越大,权重越高。
      • ExpertAlign:核心贡献。它评估教师对当前 token 的修正是否体现了该教师在其专业领域后训练中所获得的专门化能力。
    • 路由分数用于选择或加权教师信号,聚合为 token 级的蒸馏损失。
  3. 输出:学生模型参数更新,从全教师池中吸收跨领域互补监督,减少对 prompt 级领域划分的依赖。

实验表明,在无标注和领域标注数据混合下,ExpertAlign 均优于 Entropy、Novelty 和传统 Mean 聚合,且无需使用可用的领域标签。

与同类方法的差异:传统 MOPD 通常按 prompt 级领域标签将整个 rollout 路由到单一教师,而 MOPD-Router 在每个 token 上动态选择并加权多个教师信号,可挖掘教师池中的跨领域互补信息。

实验

实验设计

作者在 未标注 与 领域标注 的训练混合物上评估,覆盖 强到弱 与 同尺寸 蒸馏场景,比较 ExpertAlign 与两个参考指标 Entropy、Novelty,以及 Mean 聚合和标准 MOPD 硬路由。由于摘要未披露具体数据集名称,此处不列数据集。

关键发现

  • ExpertAlign 在全部四种设置中取得最强整体性能。
  • 在未标注数据上,相对 Mean 聚合提升 +5.88 分(+12.3%)。
  • 在领域标注数据上,相对标准 MOPD 提升 +3.95 分(+7.8%),且未使用可用领域标签。

基线对比解读

标准 MOPD 依赖 prompt 级领域标签做硬路由,每个 rollout 只用一个匹配教师,忽略了其他教师的互补信号;Mean 聚合则不加区分地平均所有教师信号,缺乏对专长的利用。ExpertAlign 在 token 级按“教师的纠正是否体现该教师 post-training 专长”打分并加权,既能利用跨域互补监督,又避免平均带来的噪声。结果说明:教师置信度(Entropy)不可靠,学生-教师差异(Novelty)次优;即使领域标签可用,token 级专长路由也明显优于传统硬路由。

行业影响

落地场景

  • 多专家模型蒸馏: 企业常维护多个垂直领域 LLM(如代码、数学、客服),MOPD-Router 可在无标签混合数据上将其融合为单一学生,降低部署与运维成本。
  • 具体用例 1: 电商平台智能客服与商品推荐。多个教师分别擅长售后话术、商品知识、风控合规,通过 token 级路由蒸馏到统一模型,无需手动为每个用户 query 打领域标签。
  • 具体用例 2: 内容平台多模态理解(文本审核、图像审核、多语言)。教师池包含各模态/语言专家,ExpertAlign 自动选择每个 token 最相关的教师信号。

商业价值

  • 降本: 避免维护多个专家模型,减少推理 GPU 占用和调优团队投入;无需人工标注领域标签,节省数据标注成本。
  • 增收/体验提升: 学生模型可融合跨领域互补监督,在未见混合场景下提升任务成功率,直接改善用户留存与转化。论文显示同尺寸蒸馏下相对标准 MOPD 可提升 7.8% 总体分数。

与现有产品/工作流的接口

  • 插件式接口: 指标(Entropy/Novelty/ExpertAlign)作为插件,可替换或自定义,容易集成到现有蒸馏 pipeline。
  • 无需单独训练 router: 直接基于教师-学生 logits 或 hidden states 计算 token 级权重,可封装为 forward 中的一个模块,插入 HuggingFace Transformers 训练循环。
  • 兼容现有 post-training 流程: 可替换标准 OPD 中的硬路由步骤,保留教师池和 KL 散度目标,与 RLHF/DPO 等后续对齐阶段无缝衔接。

局限

  • 实验验证主要覆盖文本生成任务中的多教师蒸馏,未拓展到视觉、多模态等场景,且模型规模相对有限。从论文设置看,未验证更大规模参数(如 70B 级别)下的表现,ExpertAlign 对教师专业化的几何度量可能在小规模模型上有效,但在大型模型中 token 表示空间或教师差异模式可能发生变化,泛化性待验证。此外,未与学习式路由方法(如 Mixture-of-Experts 或可训练路由器)进行对比,难以判断 token 级静态度量是否在复杂任务中仍占优。
  • ExpertAlign 计算依赖学生模型 top-k 支持集大小 K,且论文仅在 K=1 和 K=32 两个取值上进行消融,未展示 K 对最终性能的敏感性全貌。在实际部署中,不同任务或训练阶段可能需要不同 K 值,若需人工调节则会增加工程负担。同时,ExpertAlign 要求教师模型在 post-training 阶段具有可区分的专业化特征,若教师之间能力高度重叠或未经过明确的后训练专业化,该指标可能退化为近似随机选择,削弱路由收益。
  • MOPD-Router 虽然消除了域标签依赖,但仍需在训练过程中同时加载并前向传播所有教师模型,并为每个 token 计算路由指标,训练计算成本高于单教师蒸馏或基于域标签的硬路由。当教师数量较多或教师模型规模较大时,显存和通信开销可能成为瓶颈。论文虽分析了训练成本,但未与更高效的离线路由或预测路由方法(如训练一个小型路由网络)进行成本-性能权衡对比,在实际工程中可能需要根据资源约束重新设计路由策略。
论文Tianze Xu2026-09-25原文

相关内容