论文

每枚硬币都有两面:大型语言模型在 On-Policy Distillation 中泛化的双重性

每枚硬币都有两面:大型语言模型在 On-Policy Distillation 中泛化的双重性

On-policy distillation (OPD) 通过监督学生自身策略采样的轨迹来迁移教师能力,但其泛化行为尚未被充分理解,因为多数研究仅在单一领域和接近训练数据的基准上评估 OPD。我们提出一项受控研究,每次仅改变一个泛化因素,涵盖从域内分布偏移到跨域迁移以及多教师设置。 实验发现,OPD 迁移的是教师的推理行为而非其对特定问题的答案:训练难度几乎无关紧要,甚至教师从未解决的问题也有助于迁移。迁移效果强烈依赖于教师与学生之间的来源关系:同源对使学生在跨语言、推理深度乃至其他领域上都接近教师,而异源对则主要拟合训练分布。这种广泛影响是一把双刃剑:由于将提示路由到领域专家无法限制每个教师的影响,组合多个教师会导致其能力之间出现随混合比例而变化的跷跷板效应。 这些结果厘清了 OPD 何时能泛化,并为诊断多教师 OPD 提供了有益视角。

论文精读

TL;DR 本文系统研究了 on-policy distillation 的泛化机制,发现其迁移的是推理行为而非具体答案,且同源 teacher-student 泛化远强于跨源,多 teacher 组合还会导致能力此消彼长。

问题

问题背景:大语言模型后训练中, on-policy distillation (OPD) 通过监督学生自身策略采样轨迹来迁移教师能力,因在线采样特性受到关注,但其泛化行为缺乏系统理解。

现有方法局限:多数 OPD 研究只在单一领域(如数学)和训练数据附近的基准上评估,未控制变量考察分布偏移、跨域迁移及多教师 OPD (MOPD) 场景。这带来两个具体局限:一是无法区分学生学到的是教师对特定题目的答案还是可迁移的推理行为;二是难以预判同源/跨源教师-学生对对泛化边界的影响,导致 OPD 在大规模部署时缺乏诊断依据。

为什么难以重要:OPD 泛化不是单一因素决定,受教师-学生来源关系、训练问题难度、教师组合比例等多因素耦合影响。论文通过控制变量实验发现:同源对迁移更全面,跨源对仅拟合训练分布;多教师组合产生能力跷跷板效应,教师影响无法通过路由隔离。这直接关系到业界将 OPD 用于多任务、多专家模型合并时的稳定性与可预测性。

行业类比:类似多目标推荐系统中多个教师模型共同蒸馏一个学生,教师能力互相干扰,某个指标提升伴随其他指标下降,需要跷跷板模型进行诊断和调优。

核心洞察

  • OPD 迁移的核心是教师的推理行为而非答案本身,训练问题难度与教师是否解出均非关键因素。这一发现与常规基于正确性筛选蒸馏数据的做法形成对照:多数工作假设教师正确解答是高价值监督信号,但本文显示即使教师无法解出的问题,其轨迹仍能提供有效行为监督,表明在 OPD 中数据选择应从“答案正确性”转向“行为多样性或过程覆盖”。
  • 教师与学生模型谱系同源(same-origin)是 OPD 泛化性的关键决定因素,同源对可实现跨语言、跨推理长度乃至跨域迁移。以往研究多比较教师绝对能力或模型规模,较少将模型初始化/谱系关系作为变量;本文通过受控实验揭示 cross-origin 对主要拟合训练分布,而 same-origin 对能对齐整体策略,这对实际选型教师模型有直接工程指导:优先从同一基础模型家族中选取教师,而非仅看榜单性能。
  • 多教师 OPD 中,将 prompt 路由到不同域专家并不能隔离各教师的影响,混合比例会引发能力间的跷跷板效应(seesaw)。与简单假设各专家独立贡献的加权损失视角不同,本文观察到训练过程中教师之间存在隐性拉扯,最终能力组合取决于混合比例而非单纯路由。这提示在构建多教师蒸馏系统时,需对教师间相互作用进行诊断,并谨慎设计混合策略,否则可能顾此失彼。

方法

输入与训练框架

研究对象是 On-Policy Distillation (OPD) 与 Multi-Teacher OPD (MOPD)。输入为学生策略自采样轨迹(student-sampled trajectories),通过监督这些轨迹去逼近教师分布,实现能力迁移。训练数据覆盖数学、代码、科学推理和指令遵循等域,并区分 同源(same-origin) 与 跨源(cross-origin) 师生配对。

关键模块:单因素受控实验设计

论文方法核心并非提出新架构,而是通过受控实验逐一改变泛化因子:

  • 训练问题难度:按教师 pass-rate 划分,观察学生 pass-rate 变化,发现难度对迁移影响微弱。
  • 分布偏移:从 in-domain 分布偏移到跨语言、长推理 horizon 的评测,检验策略整体对齐程度。
  • 跨域转移:数学 ↔ 其他域双向迁移,量化 OPD 域外泛化能力。
  • 模型来源对齐:对比同源 vs 跨源师生对,发现同源对能跨语言、跨 horizon、跨域将学生拉近教师,跨源对则主要拟合训练分布。
  • 多教师混合:改变教师混合比例,监测各教师能力在学生上的表现,揭示能力之间的“跷跷板效应”。

输出与诊断结论

输出为泛化行为的系统性诊断:

  1. OPD 迁移的是推理行为而非具体答案,教师未解决的题目也可作为有效训练信号。
  2. 同源关系是泛化的强预测因子,同源 OPD 对齐的是学生策略整体。
  3. MOPD 中教师影响无法通过 prompt 路由隔离,混合比例导致能力此消彼长,可用“跷跷板”心智模型分析。

与同类方法的差异

不同于仅评测单一域或接近训练分布的 OPD 研究,本方法通过控制变量将泛化因素解耦,尤其突出模型来源关系与多教师干扰对泛化的决定性作用。

实验

实验设计

  • 控制变量范式:每次改变一个泛化因子,覆盖域内分布偏移、跨域转移、多教师设置。
  • 训练数据:数学推理、代码推理、科学推理、指令跟随。
  • 模型关系:教师-学生对分为同源(same-origin)与跨源(cross-origin)。
  • 评估基准:英文/中文数学推理、长程数学推理、代码推理、科学与指令遵循。

关键发现

  • 推理行为迁移:OPD 迁移教师的推理模式而非特定答案;训练题目难度影响极小,甚至教师未解出的题目也有用。
  • 同源优势:同源教师-学生对在跨语言、推理长度、甚至跨域场景下均接近教师;跨源对大多仅拟合训练分布。
  • 多教师跷跷板:将提示路由到领域专家无法限制每个教师的影响,组合多个教师导致能力此消彼长。

与基线对比解读

  • 以往研究多在单域、近训练分布基准上评估 OPD,本研究扩展至跨域和多教师场景,揭示泛化边界。
  • 同源 OPD 的强泛化表明模型谱系对齐是关键变量,为教师选择提供新原则。
  • 多教师 OPD 的跷跷板效应说明简单组合专家教师可能适得其反,需诊断教师间干扰。

行业影响

落地场景

  • 企业多领域助手蒸馏:将强推理教师通过 OPD 蒸馏到轻量学生,可同时覆盖数学、代码、指令跟随等任务,无需按领域单独训练。
  • 垂直行业模型微调:金融风控、医疗问答等需要多步推理的场景,可利用同源教师实现跨语言、跨推理深度的知识迁移。
  • 多教师蒸馏系统:聚合不同领域专家时,需监控能力跷跷板效应,避免整体能力下降。

商业价值

  • 降本:训练问题难度不影响迁移,可直接使用教师未解决的问题作为蒸馏数据,大幅降低数据筛选与人工标注成本。
  • 风险控制:识别跨源教师组合可能造成能力互斥,避免多教师蒸馏中某个维度能力意外下降。
  • 体验提升:同源蒸馏带来广泛泛化,使轻量模型在未见任务上表现接近重模型,提升产品鲁棒性。

与现有产品/工作流接口

  • 蒸馏策略选择:在训练平台(如 Hugging Face transformers、DeepSpeed)中集成 origin 分析模块,判断教师-学生是否同源,以预期泛化范围。
  • 训练监控:增加多教师蒸馏时的能力指标看板,动态调整教师权重或启用分阶段蒸馏,缓解 seesaw。
  • 数据管道简化:删减对训练数据难度的过滤步骤,将重点转移到教师-学生 origin 对齐。

具体 Use Cases

  1. 电商多语言客服推理:使用同源强推理教师蒸馏到轻量模型,跨语言处理退换货政策推理、价格计算,无需每种语言单独训练。
  2. 企业知识库 + 代码助手融合:多教师蒸馏时若发现数学能力上升但代码能力下降,可依据 seesaw 诊断机制调整教师配比或分阶段蒸馏。

局限

  • **模型与数据覆盖度有限**:该研究主要基于特定系列的开源模型(如 Qwen 或 LLaMA 族)及相应规模进行实验,未系统验证不同架构(如仅解码器 vs. 编码器-解码器)或更大参数量(如 70B 以上)下的结论是否一致。训练数据集中在数学、代码、科学推理等强逻辑域,对指令跟随、对话、知识问答等更广泛任务类型的泛化规律尚未探索,限制了结论向一般 LLM 蒸馏场景的外推。
  • **多教师 OPD 的 seesaw 效应未给出缓解方案**:论文发现多教师 OPD 中不同教师能力存在此消彼长的竞争关系,并提供了诊断思路,但未提出具体方法(如动态权重、路由策略或正则化)来主动平衡或缓解该效应。对于实际工程中需要融合多专家模型的场景,该研究止步于现象描述,缺少可操作的干预手段。
  • **对 OPD 泛化机制的机理解释仍为黑盒**:虽然发现了 same-origin 与 cross-origin 对泛化的显著影响,但未从模型内部表征、优化动力学或数据分布等角度给出深层机理分析。例如为何 same-origin 能跨域泛化而 cross-origin 不能,背后的原因尚不明确,这限制了从经验规律上升到理论指导的可能。
论文Zhaoyi Li2026-08-17原文

相关内容