论文

组合每位教师所学:通过 Teacher-Relative Shifts 实现的多教师 On-Policy Distillation

组合每位教师所学:通过 Teacher-Relative Shifts 实现的多教师 On-Policy Distillation

多教师 on-policy 蒸馏(MOPD) 有两种设置:common-domain composition 中,多位教师对同一 prompt 域的学生 rollout 打分,信号汇成单一目标;routed-domain distillation 中,不同域的 prompt 被分配给对应专家。两者通常都只迁移教师的端点策略,把 post-training 带来的改变与继承自教师 base 的偏好混在一起。 我们提出 Δ-MOPD,迁移每位教师的 teacher-minus-base logit shift,并将其重新锚定在学生冻结的初始化上,在保持教师选择不变的前提下与端点监督对比。我们首先揭示阻碍端点迁移的机制:继承的 base pull 可能超过 post-training shift;去除它可降低 teacher-term norm ratio 与 target-student KL。 结果表明,当教师信号在某一状态被组合时,shift target 尤其有用: - 三位教师组合时,Δ-MOPD 比端点组合高 4.11 Math 与 1.95 个五基准点;两位教师时与端点准确率持平。 - 分阶段路由下,两种阶段顺序均取得更高平均性能,并把观察到的顺序差距从 10.50 降到 6.42 点。 - 交错路由下(每次更新只涉及一位教师),两种目标表现相当。 分阶段结果提供了支持性证据,说明该收益可能延伸到跨训练阶段累积的信号。目标构造因此是 MOPD 中一个独立的设计轴,与教师选择互补。

论文精读

TL;DR Δ-MOPD 在多教师在线蒸馏中传递教师相对基座的 logit 偏移而非端点策略,消除基座偏好干扰,在组合与路由场景下提升性能并节省算力。

问题

问题背景

多教师在线策略蒸馏(MOPD)近年用于组合多个专家教师或按领域路由提示,使单个学生策略同时吸收多个教师的 rollout 信号,是后训练阶段扩展能力的重要路径。

现有方法局限

常见做法是迁移教师 endpoint policy,即教师最终 logits 分布。但 endpoint logits 混合了两部分:post-training 学到的任务相关变化 与 从基座模型继承的偏好。在 common-domain composition 中,多个教师对同一 rollout 打分,endpoint 目标会夹杂各自基座特有的 logit 偏置,干扰教师间相对强度;在 routed-domain 中,endpoint 监督又把每个 specialist 的基座偏置带入对应阶段。实验显示移除基座后,teacher-term norm ratio 从 5.2:1 降至 1.44:1,target–student KL 从 0.152 降至 0.031,说明基座拉扯已超过后训练位移,扭曲了组合几何。

为什么这个问题难/重要

学生有自己的 frozen initialization,直接迁移 endpoint 需要把教师学到的位移从基座先验中解耦。多教师场景下多个基座偏置相互叠加或冲突,会掩盖真正的专家差异,拖慢跨源知识获取,并放大 phased routing 中的顺序 gap(论文观察到从 10.50 降至 6.42)。对于需要组合多个后训练模型的企业级助手或推理系统,这是一个独立于教师选择的设计轴,影响训练效率和最终策略质量。

行业类比

类似在多专家系统中做策略融合时,直接复制每个专家模型的最终输出权重,会带上各自预训练基座的“口味”,导致融合后的助手偏向基座共性而非专家技能。

核心洞察

  • Δ-MOPD 的核心贡献是解耦教师策略中的后训练变化与基座偏好,迁移教师相对基座的 logit shift 而非端点策略。与端点蒸馏相比,该 shift 信号消除了各教师端点中继承的基座拉力,避免在多教师信号组合时出现基座偏好叠加,从而降低 teacher-term norm ratio(从 5.2:1 到 1.44:1)与 target–student KL(从 0.152 到 0.031)。这一机制解释了为何端点迁移在多教师设置下容易偏离目标分布,而 shift 目标能以更少的计算资源达到同等或更高性能。
  • 目标构建方式是 MOPD 中独立于教师选择的设计轴,迁移什么与选哪些教师同等重要。以往多教师蒸馏普遍默认迁移端点策略,研究重心集中在教师选择与路由上。Δ-MOPD 表明,端点信号中的继承基座偏好会扭曲组合几何,尤其在三教师状态级组合时,shift 目标可带来 4.11 Math 和 1.95 五基准点提升;在 phased routing 下还将相位顺序差异从 10.50 降至 6.42 分。这为工程实践提供新的优化维度:固定教师集合后,仅切换目标即可获得性能与训练稳定性的双重收益。

方法

输入:学生模型(冻结初始化)、多个教师模型及其各自 base 模型、提示域(共同域或路由域)。

关键模块:

  1. 教师-相对偏移构造:对每位教师计算 teacher-minus-base logit shift,即教师 logits 减去其 base logits 的差值,代表 post-training 学到的增量。
  2. 学生重锚定:将该偏移叠加到学生冻结初始化的 logits 上,生成每位教师的目标分布,避免直接使用教师 endpoint 引入 base 偏好。
  3. 信号组合与路由:共同域组合中,多个教师对同一学生 rollout 打分,其偏移信号组合成单一目标;路由域中,提示按域分配给对应专家,支持分阶段或交错更新。
  4. 在线策略蒸馏与诊断:学生根据目标分布更新,度量教师项范数比和 target–student KL 监控训练。实验显示去除 base 继承拉动后,教师项范数比从 5.2:1 降至 1.44:1,KL 从 0.152 降至 0.031,且达到同样 Math 分数所需 H100 小时减少 35%。

输出:训练后的学生策略模型,在共同域组合和路由域蒸馏中均取得性能提升。

差异点:与转移教师最终策略的 endpoint 监督不同,Δ-MOPD 将转移对象改为教师相对于其 base 的偏移,剥离了 base 先验,更适合多教师信号组合与跨阶段累积。

实验

实验设计

论文在两种 MOPD 设置下对比 Δ-MOPD 与 endpoint transfer:common-domain composition(多教师共同评分同一 prompt domain 的 rollout)和 routed-domain distillation(prompt 路由至对应 specialist,含 phased 与 interleaved 两种更新顺序)。教师选择固定,目标构建方式作为唯一变量。诊断指标包括 teacher-term norm ratio、target–student KL 等。

关键发现

  • 几何机制:endpoint 继承的基础模型偏好(base pull)可能超过 post-training shift;减去 base 后 teacher-term norm ratio 从 5.2:1 降至 1.44:1,target–student KL 从 0.152 降至 0.031。
  • 组合性能:3 教师 common-domain 下 Δ-MOPD 在 Math 上高 +4.11,五 benchmark 平均高 +1.95;2 教师时与 endpoint 持平。
  • 路由设置:phased routing 下 Δ-MOPD 在两个 phase order 均更高,order gap 从 10.50 缩小到 6.42;interleaved routing 下两者相当。

与基线对比解读

endpoint 将教师 base 偏好与 post-training shift 混在一起,对多教师聚合是隐性噪声源。Δ 目标把每个教师的增量重新锚定到学生冻结初始化,减少跨教师 base 不一致带来的干扰。工程启示:当需要融合多个异源教师信号时,传递 teacher-minus-base 的 logit shift 比传递完整 logits 更稳定,尤其适合多阶段、多领域路由蒸馏;但若每次更新只涉及单一教师(interleaved),两种目标差异不大,说明收益主要来自在同一状态聚合多个教师信号的场景。

行业影响

落地场景

Δ-MOPD 为多教师在线策略蒸馏(MOPD)提供了新的目标构造方式,核心价值在于去除教师基座策略中的继承偏置,仅传递教师后训练阶段学到的能力偏移。这一机制可直接应用于需要融合多个领域专家模型的场景,例如:

  • 电商智能客服:商品咨询、售后、营销推荐等多个领域的专家模型可通过 routed-domain distillation 融合,每个用户查询路由到对应专家,同时用 Δ-MOPD 构造统一优化目标,减少跨领域负迁移。
  • 内容平台多任务排序:安全审核、质量评分、个性化推荐等多任务教师模型可通过 common-domain composition 同时监督同一学生 rollout,Δ-MOPD 能避免不同教师基座偏好互相拉扯,提升融合后的综合指标。

商业价值

  • 降本:论文显示 Δ-MOPD 在达到同等 Math 分数时节省 35% H100 小时,直接降低训练算力成本。
  • 提效:多教师融合时,shift 目标减少了目标-学生 KL 与教师项范数比,能更快收敛且避免早期训练被基座偏好主导,缩短迭代周期。
  • 体验提升:通过更干净地组合各专家所学,最终学生模型在多个基准上平均性能更高,可转化为产品指标提升(如客服准确率、内容推荐满意度)。

与现有产品/工作流的接口

Δ-MOPD 是目标构造层的改进,与教师选择、路由策略等正交,可无缝嵌入现有在线策略蒸馏管线:

  1. 在 RLHF / RLAIF 框架(如 PPO、GRPO)中,将每个教师的端点 logits 替换为 teacher_logits - base_logits + student_init_logits 作为监督目标。
  2. 与已有教师合并策略(如算术平均、加权和)兼容,只需改变每个教师贡献的信号形式。
  3. 在 phased / interleaved routing 场景中,可直接替换目标计算部分,无需修改训练调度器。
  4. 对已部署的多教师融合系统,可通过 A/B 测试对比端点目标与 Δ-MOPD 的线上性能差异,逐步迁移。

局限

  • - **跨基座对齐依赖投影质量**。Δ-MOPD 假设教师的 logit 偏移可以在学生冻结初始化上重新锚定,但当教师与学生来自不同基座模型时,logit 空间未对齐。论文提到跨 tokenizer 情况需要 overlap projection,但未详细评估投影误差对最终性能的影响。实验可能主要在同源基座或特定投影方案下进行,实际中若教师基座与学生初始化差异较大,偏移的语义可能被破坏,导致蒸馏效果下降。该方法对多基座异构教师集合的鲁棒性有待验证。
  • - **增益与应用场景强耦合**。在 common-domain composition 和 phased routing 下,Δ-MOPD 显著优于端点监督;但在 interleaved routing 中,每个 update 只涉及单一教师,两种目标的性能相当。这表明 Δ-MOPD 的优势依赖于多教师信号在同一状态或跨阶段累积时能够有效融合,当训练调度不满足该条件时,其额外价值有限。实际系统中路由策略多样,需要更细致的场景判断,不能盲目替换端点目标。
  • - **未与教师选择策略联合优化**。论文将教师选择固定,仅研究目标构建轴。但目标构建与教师选择可能存在交互:不同教师集合对偏移信号的组合方式不同,最优教师组合可能随目标类型变化。Δ-MOPD 作为独立设计轴被提出,但缺少与常见教师加权、门控等选择策略结合的实验,也未给出在不同教师规模下的敏感性分析,因此其实际部署时的增益潜力可能被高估或低估。
论文Hejian Sang2026-10-07原文

相关内容