更好的监督近在咫尺:Neighborhood On-Policy Self-Distillation
On-policy self-distillation(OPSD) 利用能看见参考解的特权教师(privileged teacher)监督学生采样的前缀,以训练数学推理模型。标准 OPSD 在每个状态只使用一组固定参数,但邻近的参数设置可能提供额外监督。我们发现,在相同参考上下文下,局部参数扰动会给出互补且与参考解对齐的修正。 不同专家在不同参考位置提供这些修正,其整体覆盖的位置多于未扰动的特权教师。为此我们提出 Neighborhood OPSD(N-OPSD),把这些修正转化为学生访问状态上的监督。离线阶段,贪心选择通过奖励「超出专家池当前最优」的过滤参考 token 增益,构建紧凑的冻结专家池。峰值最高的专家未必提供最佳训练目标,因此在线路由将锚点方向与其支持度分开:MaxPeak 选出锚点 token,分位数选择则在 top token 与之一致的专家之间挑选。学生通过继承自 OPSD 的 clipped forward-KL 目标,从所选专家的完整下一 token 分布中学习。 我们在 AIME 2024、AIME 2025 与 HMMT February 2025 上评估。每种方法三次独立运行,Neighborhood OPSD 在 Qwen3-1.7B、4B、8B 上把三基准 Average@12 相对 OPSD 分别提升 2.75、1.67、1.94 分。学生前缀续写的结果支持把专家池用到参考轨迹之外;匹配的消融实验支持以过滤参考 token 增益作为选择准则。考虑专家池内部重叠并按状态路由还能进一步提升学生准确率。推理时仅使用蒸馏后的学生模型。
论文精读
TL;DR N-OPSD 通过邻近参数扰动收集更多参考对齐修正,贪心构建专家池并在线路由蒸馏,使 Qwen3 在 AIME/HMMT 数学推理上提升 1.7–2.75 个点,且推理仅用学生模型。
问题
问题背景
当前数学推理模型(如 Qwen3 系列)通过 on-policy 自蒸馏(OPSD)等方法提升推理能力,核心是利用特权教师提供逐 token 监督。
现有方法局限
标准 OPSD 在每个学生采样状态使用固定的特权教师参数设置,参考解上下文固定。但研究发现,局部参数扰动可揭示互补的参考对齐校正,不同专家在不同参考位置提供更优校正,覆盖率高于单一未扰动教师。固定单一教师的监督信号有限:在某些状态,它可能不是最佳参考,且无法覆盖所有需要校正的位置。
为什么这个问题难/重要
技术挑战在于如何从参数邻近区域挖掘额外监督,并高效集成多个专家而不增加推理成本。Neighborhood OPSD 需要离线贪心选择构建紧凑冻结专家池,在线路由需分离 anchor 方向 与支持水平(MaxPeak 选 anchor token,分位数选择专家),并让学生从专家完整 next-token 分布学习(clipped forward-KL)。该问题重要因为推理模型的数据效率与竞赛级准确率是当前 AI 工程关注重点,N-OPSD 在 AIME 2024/2025、HMMT Feb 2025 上平均提升 2 个点以上,且推理时仅使用蒸馏学生。
行业类比
类似于 模型集成 在推理阶段路由到多个子模型,但这里将集成知识蒸馏到单一学生,部署时零额外开销。
核心洞察
- 参数空间邻域扰动揭示互补监督信号:局部参数扰动产生多个“专家”,它们在不同参考位置提供与参考解对齐的修正,从而覆盖单一教师难以触及的状态。与标准 OPSD 使用单一固定参数设置相比,这种方法利用邻域内多个参数化教师的多样性,扩大了参考对齐覆盖范围。这种从参数邻域而非数据邻域挖掘监督的思路,为提升数学推理模型训练提供了新的监督来源。
- 在线路由分离锚点方向与分布支撑,动态选择专家进行知识蒸馏:MaxPeak 选择 anchor token,quantile 选择在 top token 匹配的专家中筛选,学生从选定专家的完整下一个 token 分布学习,而非仅模仿最高概率 token。传统方法往往直接使用最高性能专家或静态集成,而 N-OPSD 观察到最高峰值专家不一定提供最佳训练目标,通过状态条件路由选择与当前状态最匹配的专家,并利用其完整分布,结合 clipped forward-KL,实现更精细的知识传递,提升了性能和鲁棒性。
方法
Neighborhood OPSD (N-OPSD) 在 on-policy self-distillation (OPSD) 框架上扩展。
输入:学生模型采样得到的推理前缀与参考解;特权教师模型能看到参考解并监督学生前缀的下一 token 分布。
关键模块:
- 局部参数扰动与专家池构建:对特权教师参数施加局部扰动,得到多个专家模型。在相同参考上下文下,不同专家在不同参考位置提供互补的、与参考对齐的修正。离线阶段,采用贪心选择构建紧凑的冻结专家池:在每个位置计算各专家的
filtered reference-token gains(相对池内当前最优的参考 token 概率增益),选择增益最大的专家加入池。 - 在线路由:分离 anchor direction 与 support level。
MaxPeak选择 anchor token(概率最高的参考 token),quantile selection在 top token 匹配的专家中按分位数选取具体专家,避免最高峰专家不一定提供最佳训练目标的问题。 - 训练目标:学生从被路由选中的专家学习其完整下一 token 分布,使用继承自 OPSD 的
clipped forward-KL目标。
输出:蒸馏后的学生模型仅用于推理。
跟同类方法的差异点:标准 OPSD 在每个状态使用单一固定参数设置,而 N-OPSD 通过邻域扰动构建多专家池并按状态在线路由,将更广泛的参考对齐修正转化为监督信号。
实验
实验设计
在 AIME 2024、AIME 2025、HMMT February 2025 三个数学推理基准上评估 Neighborhood OPSD,学生模型基于 Qwen3 系列 1.7B/4B/8B,每个方法独立跑 3 次。离线阶段用贪心选择构建冻结专家池,奖励标准为 filtered reference-token gains;在线阶段用 MaxPeak 选 anchor token,再用分位数选择在 top token 匹配的专家中挑出监督专家。学生从该专家的完整 next-token 分布学习,损失沿用 clipped forward-KL。
关键发现
- 三个尺寸上 Average@12 分别提升 2.75、1.67、1.94 点,均优于 OPSD 基线。
- 学生前缀延续实验表明,专家池的有效性超出用于选择的参考轨迹。
- 消融匹配证实
filtered reference-token gains作为选择准则有效;进一步考虑池内专家重叠和按状态路由可继续提升精度。
与基线对比解读
标准 OPSD 在每个状态只使用一个固定参数设置,而 N-OPSD 引入局部参数扰动的专家池,覆盖更多参考位置。分离 anchor direction 与 support level 是关键设计:最高峰专家未必提供最佳目标,因此路由时先定 token 再选专家。该思路对蒸馏/RL pipeline 有直接借鉴意义——不必追求单一最优 teacher,可从扰动模型构建专家池并动态路由监督信号。推理仅用学生,部署成本不变,但训练侧构建专家池的额外开销与收益比仍需在具体场景中评估。
行业影响
落地场景
N-OPSD 适用于需要复杂数学/逻辑推理的 AI 产品,例如在线教育平台的自动解题与批改、金融领域的量化分析与研报生成、代码助手中的算法推理、企业级知识问答中的多步推导。通过邻域专家池与在线路由,可在不增加推理开销的情况下提升小模型(Qwen3-1.7B/4B/8B)的数学竞赛级表现,适合端侧或低成本部署的推理引擎。
商业价值
- 降本:自蒸馏减少对人工标注或大型教师模型的依赖,冻结专家池离线构建,训练效率高。
- 增收/竞争力:Average@12 提升 1.67-2.75 点,在数学基准上超过 OPSD,产品可宣称更强的推理能力,支撑订阅或 API 溢价。
- 体验提升:在数学辅导、金融分析等场景,更准确的推理答案直接提升用户信任与留存。
与现有工作流接口
N-OPSD 作为训练阶段插件,可直接嵌入现有 LLM 微调 pipeline。其输入为学生模型采样前缀与参考解,输出为蒸馏损失,与标准 OPSD 或 SFT 目标兼容。推理时只部署学生模型,无需额外路由模块,可无缝接入 vLLM、TensorRT-LLM 等推理框架。实际落地时,可将 N-OPSD 用于特定领域数学/逻辑数据的继续预训练或指令微调,专家池构建过程可离线批量完成,路由逻辑只需在训练时计算,不影响线上延迟。
具体落地 use case
- 在线教育解题服务:使用 N-OPSD 训练一个小型数学推理模型,嵌入拍照搜题或 AI 助教,实时给出 AIME 难度题目的分步解析,提高正确率,减少人工审核成本。
- 金融量化分析:在财报分析或风险评估中,需要多步数值推理,N-OPSD 训练的小模型可部署在低延迟推理环境,快速输出推导过程与结论,辅助分析师决策。
局限
- - 方法建立在 OPSD 框架上,依赖 privileged teacher 和参考解,限制了其在无参考答案任务中的应用。构建专家池需要多次参数扰动与评估,虽然池规模紧凑,但相比单一教师仍增加了离线计算与存储开销。
- - 实验仅在数学推理基准(AIME 2024/2025、HMMT February 2025)和 Qwen3 系列(1.7B 至 8B)上验证,缺少更大规模模型及代码、通用对话等领域的泛化证据。在线路由的 MaxPeak 与分位数选择可能对超参数敏感,论文未提供充分的鲁棒性分析。
- - 与 broader knowledge distillation 和 multi-teacher 方法对比有限,难以明确 N-OPSD 的相对优势边界。训练阶段引入专家池管理与路由逻辑,增加了实现复杂度,而推理阶段学生模型虽不受影响,但整体训练流程更为复杂。