Pass the Baton: Trajectory-Relayed On-Policy Distillation(轨迹中继的在线策略蒸馏)
On-policy distillation (OPD) 将逐 token 监督扎根于学生自身的轨迹,但存在 前缀失败 问题:一旦学生导向错误推理方向,后续生成便持续偏离,产生不可靠监督并浪费计算。 我们发现失败前缀上的师生延续不对称:教师倾向于重定向,而学生仍沿原始方向前进。我们将其转化为 Relay-OPD 中的无标签交接触发机制。训练时,Relay-OPD 在检测到的触发点让教师短暂接管生成 教师段,随后学生恢复并基于该轨迹优化。有限的接力预算将干预集中在关键早期位置,同时减少对学生策略的偏离。 以 Qwen3-4B-Instruct-2507 为教师、Qwen3-0.6B/1.7B-Non-Thinking 为学生,在 八个数学推理基准 上,Relay-OPD 在所有基准上取得最佳或次佳结果: - 1.7B 模型平均超越标准 OPD +5.73%,超越最强基线 FastOPD +1.49% - 0.6B 模型取得一致提升 - 训练轨迹长度减少超过 50%
论文精读
TL;DR Relay-OPD 检测学生错误前缀并让教师短暂接管生成「接力轨迹」,解决 on-policy 蒸馏的前缀失败问题,在八项数学推理基准上平均提升 5.73%,训练轨迹长度减半。
问题
问题背景
大语言模型蒸馏中,如何将强模型的推理能力高效迁移至轻量学生模型是工业部署的核心需求。On-Policy Distillation (OPD) 因能在学生自身生成轨迹上施加逐 token 监督,显著优于离线蒸馏而成为研究热点。
现有方法局限
标准 OPD 面临严重的 prefix failure:一旦学生在推理早期生成错误方向,后续所有 token 均基于该偏差前缀展开,导致教师提供的监督信号不可靠,并浪费大量计算。现有改进如 FastOPD 通过提前截断降低计算开销,但并未直接解决错误前缀引发的监督质量恶化。关键发现是教师–学生在失败前缀上的延续行为不对称:教师倾向重定向推理路径,而学生却沿原错误方向继续生成。先前方法均未利用这一差异作为无监督干预信号。
为什么这个问题难/重要
解决 prefix failure 的技术挑战在于:
- 无标签触发检测:如何在不依赖外部标注的条件下自动识别需要干预的错误前缀位置;
- 干预与自主的平衡:教师短暂纠正后如何将控制权交还学生,使训练仍保持 on-policy 特性,避免策略偏移过大。
该问题受业界高度关注,因为提升小模型推理能力直接关系到实际部署的延迟、成本与可靠性。OPD 作为当前最有效的蒸馏范式之一,其 prefix failure 问题已成为制约其性能上限的关键瓶颈。
行业类比
如同 检索增强生成 (RAG) 在模型出现幻觉时动态插入外部知识以修正输出,Relay-OPD 让学生推理偏离时由教师短暂“接管”生成一段纠正轨迹,再将控制权交还学生继续,实现可纠正、低干预的蒸馏。
核心洞察
- **前缀失败是 on-policy distillation 的隐蔽瓶颈**:学生模型一旦在推理链早期产生偏差,后续基于错误前缀的生成会使教师提供的 token 级监督变得不可靠,且浪费计算。Relay-OPD 将此问题定性为“教师-学生延续不对称性”——教师倾向于重定向,学生则沿原有方向继续——并将这种不对称转化为无标签的交接触发信号。相比 FastOPD 的固定截断策略,这种自适应干预能精准定位需要教师介入的关键前缀,避免对正常前缀的过度干预,显著提升信号利用率。
- **有限接力预算+早期集中干预实现高效知识迁移**:Relay-OPD 采取教师短暂接管的方式构造“接力轨迹”,并将干预预算控制在极小比例,强制将教师介入集中在推理链的关键早期位置。这种设计在保持学生策略分布的同时,将训练轨迹长度缩减超过 50%,在 8 个数学推理基准上对 0.6B 和 1.7B 学生模型均取得一致提升(平均超过最强基线 FastOPD +1.49%)。与传统的序列级蒸馏或重写方法不同,该策略在计算开销、学生策略偏离度和蒸馏效果之间取得了更优平衡,对资源受限场景的工程落地有直接参考价值。
方法
核心挑战: On-Policy Distillation 中的前缀失败
On-policy distillation (OPD) 让学生模型在自己的推理轨迹上进行 token 级监督, 但一旦学生早期生成出错, 后续所有 token 都建立在这个错误前缀上, 造成前缀失败。此时教师提供的续写监督已不可靠, 且浪费计算。
Relay-OPD 方法: 接力轨迹蒸馏
Relay-OPD 将训练轨迹构造为 “学生前缀 → 教师接管段 → 学生续写段” 的接力形式, 通过教师短暂介入来纠正推理方向。
1. 无标注的交接触发点检测
- 作者发现: 在错误前缀上, 教师倾向于重定向 (生成修正内容), 而学生继续保持错误方向, 这种教师-学生续写不对称性可作为触发信号。
- 实践中, 使用教师和学生对该前缀生成的 top-1 token 是否一致来判断。当出现分歧且满足 budget 约束时, 触发教师接管。
2. 接力轨迹构建
- 在触发点, 教师模型接管生成一小段
teacher leg, 这段内容通常包含正确的推理转折。 - 教师段结束后, 学生模型从教师段末尾继续生成, 形成完整轨迹。
- 为了控制与原始学生策略的偏差, 引入接力预算 (relay budget): 限制每条轨迹中教师接管的总长度和位置, 迫使干预集中于关键早期错误。
3. 训练目标
- 最终用于优化的轨迹包含学生 token 和教师 token, 但仅对学生 token 部分计算蒸馏损失 (如 KL 散度或交叉熵), 教师部分仅提供上下文。
- 整个过程无需额外的人工改写或修正标签, 完全由模型自动触发。
与其他方法的区别
与 FastOPD 等通过截断错误前缀来减少浪费的方法不同, Relay-OPD 不丢弃学生生成, 而是用教师正确续写给学生提供一个“恢复路径”, 在保持学生策略主体性的同时, 提升了错误前缀上的监督质量。
实验
实验设计
论文在八个数学推理基准上评估 Relay-OPD,使用 Qwen3-4B-Instruct-2507 作为教师模型,对 Qwen3-0.6B 和 Qwen3-1.7B 的非思考(Non-Thinking)版本学生模型进行在线策略蒸馏。基线包括标准 OPD、FastOPD 等,重点关注前缀失败场景下的性能与训练效率。
关键发现
- Relay-OPD 在所有基准上均取得前两名:1.7B 学生模型平均超过标准 OPD +5.73%,超过最强基线 FastOPD +1.49%;0.6B 模型同样获得一致提升。
- 训练轨迹长度缩短超过 50%,大幅降低计算开销。
- 接力机制在检测到学生偏离时,教师短暂介入生成“教师腿”,再交还学生,将干预预算集中在关键早期位置,避免对整个序列的冗余纠正。
与基线对比的深度解读
Relay-OPD 区别于 FastOPD 的截断策略,通过标签无关的交接触发(利用师生在失败前缀上的延续不对称性),实现更精准的干预。这不仅保留了学生策略的主体性,还减少了无效生成,兼顾了训练效率和最终性能。对工程实践而言,该思路可推广至其他需要在线纠正的生成任务,例如代码生成或复杂指令跟随,低成本的教师介入机制有望在资源受限场景下实现高效知识迁移。
行业影响
落地场景
Relay-OPD 适用于需要将大型推理模型能力压缩至小规模、可端侧部署的产品。典型场景包括移动端数学辅导应用、交互式代码助手、金融风险评估中的多步逻辑推导,以及任何要求低延迟、高可靠性的实时推理服务。
商业价值
- 推理成本大幅降低:小模型计算量显著减少,可云端低成本部署或完全离线运行,节省 GPU 资源与能耗。
- 训练效率跃升:训练轨迹长度减少超过 50%,缩短模型迭代周期,加速 A/B 测试与上线。
- 用户体验优化:有效避免“前缀错误”导致的无效续写,推理过程更可靠,直接提升用户信任与留存。
与现有工作流集成
Relay-OPD 基于标准 On-Policy Distillation (OPD),仅需增加一个无标签的交接触发模块。该模块利用教师与学生模型在失败前缀上的续写差异自动检测干预点,可无缝嵌入现有 Transformers 训练栈(如 HuggingFace),无需额外人工标注或复杂奖励模型,对接成本极低。
具体应用案例
- 教育科技:在拍照搜题或对话式答疑产品中,教师模型(如 Qwen3-4B)生成理想推理路径,学生模型(如 0.6B)经 Relay-OPD 蒸馏后能更准确复现关键推导,避免错误前提下的整段无效生成,提升解答正确率与实时性。
- 金融科技:在智能投顾的合规审查或多因子分析中,小模型离线执行复杂推理链,保障用户数据隐私与低延迟交互,同时蒸馏过程保证推理质量接近教师模型。
局限
- Relay-OPD 的交接触发依赖预定义的 handoff trigger word list(如“Wait,”、“Actually,”等),这些词基于教师偏好设定,可能不适用于所有教师模型或任务类型。若教师模型的纠正行为不以这些显式标记开头,触发点检测会失效,导致 relay 轨迹构建错误。此外,预算分配(relay budget)和触发阈值需针对任务调整,超参数敏感性较高,实际部署时可能增加调参负担。
- 实验仅覆盖数学推理场景(八个基准),使用 Qwen3 系列模型。代码生成、多轮对话等常见蒸馏任务未验证,方法的泛化性存疑。另外,推理阶段不进行 relay,训练与推理的分布偏移可能影响最终性能,且论文未消融推理时是否可引入类似 teacher 引导机制以进一步对齐。
- 与 FastOPD 相比,Relay-OPD 在训练时增加了 teacher 的前向计算和部分生成步骤,虽然缩短了总轨迹长度,但计算资源消耗未必降低。在 teacher 规模较大时,频繁的交接会引入显著延迟,可能抵消长度缩减带来的收益。同时,方法仍属于 on-policy 范畴,需在线生成样本,相比 off-policy 蒸馏(如 ReSTEM)在数据利用效率上存在天然劣势。