自适应教师暴露用于大语言模型推理中的自蒸馏
On-policy自蒸馏已成为LLM推理的有效范式,其核心是教师基于参考推理监督学生自身的采样轨迹。然而,现有方法默认教师始终看到完整参考推理,这导致了教师端暴露不匹配:当教师观察到远超学生当前能力的推理时,生成的目标标记过于困难,学生难以吸收。固定暴露实验表明:1) 完整暴露并非始终最优;2) 师生差异随暴露程度单调增长。 为此,本文提出自适应教师暴露自蒸馏(ATESD),将教师暴露视为可学习的训练时控制变量。ATESD使用轻量级Beta策略控制器,基于紧凑训练状态统计量预测令牌遮盖比例,并将采样的暴露策略应用于学生更新的小窗口。为训练该控制器,设计了折扣学习进展奖励,根据暴露策略对学生未来改进的影响(而非即时损失变化)评估其效果,从而解决on-policy蒸馏中的延迟信用分配问题。 在 AIME 24、AIME 25 和 HMMT 25 数据集上,基于 Qwen3-{1.7B, 4B, 8B} 的实验表明,ATESD始终优于竞争性的自蒸馏和RL基线,相比OPSD,Average@12分别提升+0.95、+2.05和+2.33点,确立了自适应教师暴露作为推理自蒸馏的有效新维度。
论文精读
TL;DR ATESD 识别到固定教师曝光加剧师生不匹配,提出可学习曝光控制器动态调节,并用 discounted learning-progress reward 解决延迟信用分配,在推理任务上一致优于固定曝光方法。
问题
问题背景
在线策略自蒸馏 (On-policy Self-Distillation) 已成为提升 LLM 推理能力的核心方案:特权教师模型在生成学生 rollout 时同时条件化参考解答,以此提供更稠密的监督信号。近年工作如 STaR、ReFT、OPSD 让该范式的性能边界持续提升,但几乎所有方法都默认教师可查看完整参考推理链,这个设计选择几乎没有被质疑过。
现有方法局限
这种“教师全曝光”带来一个隐蔽的教师侧曝光不匹配 (Teacher-side Exposure Mismatch):当教师看到的正确推理远超学生当前能力可达的范围时,为每个 token 生成的监督目标会变得过强,难以被学生有效吸收。论文通过固定曝光量扫描实验发现两个关键事实:
- 完全曝光 (
exposure=1.0) 并非稳定最优 – 在多个数学推理基准上,部分曝光往往能获得更好的最终性能。 - 学生与教师的分布差异随曝光量单调增长 – 教师接触越多参考 token,其输出的 token 目标越偏离学生可执行的分布,导致学习信号恶化。
这表明,将 teacher exposure 视为固定超参的做法忽略了学生能力在训练过程中的动态变化,静态地给予教师“全知”视野会制造不可忽略的对齐障碍。
为什么这个问题难且重要
引入自适应曝光面临两个核心技术挑战:
- 延迟信用分配 (Delayed Credit Assignment) – 曝光决策的效果要经过多步 rollout 和 student 更新后才体现,传统基于即时损失的优化信号无法有效反馈。
- 控制策略的稳定性 – 曝光率是一个连续变量,直接学可能崩溃到极端值,需要构造有约束的、能感知训练状态的轻量控制器。
业界对推理能力自蒸馏的关注度极高,因为它能复用大量无标签数据、降低对昂贵人工标注的依赖。若能自动化地调节教师提供的“特权信息量”,就可以在不牺牲训练效率的前提下稳健提升学生推理水平,这对大模型后训练 (post-training) 流程具有直接的工程价值。
行业类比
类似在知识蒸馏中动态调整教师 logits 的软化温度 – 固定温度易导致学生只模仿教师分布而忽略自身探索,只有根据学生当前置信度自适应调节才能平衡“模仿”与“独立思考”。“自适应教师曝光”将这一思路迁移到推理 token 级别,让特权监督的强度随时匹配学生能力边界。
核心洞察
- **教师端暴露不匹配 (teacher-side exposure mismatch)** 是自蒸馏中未被探讨的关键瓶颈 在 on-policy 自蒸馏(如 **OPSD**)中,教师模型通常可以看到完整的推理链作为特权信息,但作者通过固定暴露扫视实验发现:全暴露并不总是最优选择,且随着教师看到的推理步骤增多,学生-教师分布不匹配程度单调上升。这与以往仅关注学生端数据分布或解码策略的方法(如调整采样温度、使用拒绝采样)形成鲜明对比——这个视角首次将**教师端信息暴露程度**本身作为控制变量,揭示了教师“过度指导”可能带来的负面效果。该发现为推理能力训练提供了新的自由度,启发从业者重新审视特权信息的传递方式而非一味给予全部信息。
- **自适应暴露调控 (adaptive exposure control)** 通过可学习的 Beta 策略控制器实现动态课程 ATESD 将教师暴露比例建模为一个连续值,并使用轻量级 **Beta-policy 控制器** 根据训练状态(如近期损失、梯度范数)实时调整揭示比率。这与固定的课程学习或手动调参有本质不同:它不是预设的启发式规则,而是通过**折扣学习进度奖励 (discounted learning-progress reward)** 让控制器自我优化,直接最大化学生未来的性能提升,从而解决 on-policy 训练中决策效果滞后的问题。实际工程意义在于:该控制模块参数量极小(仅几十个参数),无需额外模型,可方便嵌入现有自蒸馏管道,根据学生能力自动平衡模仿强度与探索空间。
方法
ATE-SD 在标准 on-policy 自蒸馏框架上引入可学习的教师暴露控制。其工作流为:
输入与状态
在线训练中,系统持续获取学生模型在推理问题上的 rollout 轨迹、对应的参考答案,以及训练状态统计量(如当前步数、学生损失值、近期奖励信号等紧凑特征)。
关键模块
暴露调制教师
教师模型不再接收完整参考答案,而是接收一个截断版本——仅可见参考答案前β·L个 token(L为总长度,β ∈ [0,1]为暴露比例)。教师基于这些信息对学生轨迹进行 token 级监督,给出目标分布。β 越小,教师可见的推理线索越少,监督信号越弱(更贴近学生能力),反之亦然。Beta 暴露控制器
一个轻量级策略网络(例如小型 MLP),输入为训练状态统计量,输出 Beta 分布的参数(α, β),并从中采样一个暴露比例。该比例在一个 保持窗口(比如 20 步)内固定,用于若干次学生更新。窗口结束后,根据该段学生进步情况计算奖励,再采样新的 β。闭环训练控制与延迟奖励
控制器的优化目标不是即时损失下降,而是折扣学习进度奖励:窗口结束时计算学生未来几步的 loss 下降量作为奖励,并施加折扣。这一设计显式解决了 on-policy 自蒸馏中暴露决策与最终推理性能间的延迟信用分配问题——当前较高暴露可能短期内提升教师信号准确性,但长期可能造成 mismatch;反之较低暴露可能让学生更易吸收,但进步慢。控制器通过策略梯度逐步学会在合适时机调整暴露。
输出
训练全程动态变化的 β 策略。控制器学会在初期给予更小暴露(信息片段),待学生能力提升后逐步增加暴露,最终平稳收敛。
与同类方法的差异:传统自蒸馏(如 OPSD)将教师暴露固定为超参(通常为 1.0),ATE-SD 首次将暴露量建模为训练时可学习的控制变量,并用基于未来改进的奖励而非即时损失来优化,从而在多个基准上显著超越固定暴露方案。
实验
实验设计
我们在三个数学推理基准(AIME 24、AIME 25、HMMT 25)上评测 ATESD,模型为 Qwen3-{1.7B, 4B, 8B},采用 Average@12 作为主指标。基线包括标准 on-policy self-distillation (OPSD) 及若干强化学习方法。ATESD 引入Beta 策略控制器,根据训练状态统计量动态输出教师对参考解的暴露比例,每段 hold window 内固定一次采样,通过折扣学习进度奖励优化曝光决策。
关键发现
- 性能一致提升:ATESD 在所有模型规模上超越 OPSD,提升幅度随模型增大而增加(1.7B: +0.95, 4B: +2.05, 8B: +2.33 Average@12 点)。
- 曝光策略自适应:消融实验显示,学习到的曝光曲线呈现前期高后期低,与课程学习理念吻合,有效缓解了师生能力失配。
- 延迟信用必要:移除折扣奖励后控制器无法学到有效策略,证明延迟信用分配对曝光学习至关重要。
- 学习曝光优于固定:ATESD 的采样曝光在所有维度上均优于固定比例曝光及无控制全曝光。
对比解读
与先前 on-policy self-distillation 将教师曝光视为固定超参数相比,ATESD 首次将其定位为可学习控制变量。这种做法使教师监督信号自适应匹配学生当前能力,避免因过早暴露完整推理链导致的过强目标与训练不稳定,也为推理自蒸馏框架增加了一个新优化轴。对于注重训练效率与最终性能的业务部署,该方法提供了一种低成本、可插拔的增强方案,区别于单纯扩大数据或模型规模的路子,而是通过训练动力学调控提升蒸馏信号质量。
行业影响
落地场景
ATESD 直接服务于 LLM 推理能力的训练后增强,因此其核心落地场景覆盖所有依赖强推理的产品。典型 use case 包括:
- 在线教育:数学题自动求解与分步讲解引擎。ATESD 可提升模型在 AIME、HMMT 等竞赛级数据集上的正确率,使辅导系统能给出更可靠的多步骤推理过程,减少错误引导。
- 金融分析:财报解读、合同条款自动审查。这类任务需要严格的长链逻辑推导,ATESD 通过动态调整教师暴露度,让模型逐步吸收复杂推理模式,降低因推理错误导致的业务风险。
- 企业服务:智能工单系统、技术文档问答。模型需从碎片化信息中还原因果链,ATESD 可使模型在训练阶段自适应地学习正确推理路径,显著提升一次解决率。
商业价值
- 降本:ATESD 无需额外标注数据,仅改变训练过程中的教师曝光策略。相比人工编写更优推理示例或反复 prompt engineering,它能自动挖掘学生模型的最佳学习区间,减少实验试错成本。
- 增效:实验表明,在 Qwen3-{1.7B,4B,8B} 上 ATESD 比 OPSD 的 Average@12 分别提升 +0.95、+2.05、+2.33 点,且轻量的 Beta-policy 控制器几乎不增加训练开销。这意味着相同模型容量可产出更强的推理性能,或同等性能下可用更小模型部署,节省推理服务器成本。
- 体验升级:对用户而言,推理正确率的提升直接转化为对产品信任度的提升,尤其是在高利害场景(如医疗咨询、法律分析)中,错误率的微小下降都能带来巨大用户体验增益。
与现有工作流的接口
ATESD 定位为 训练阶段的即插即用组件,可无缝嵌入现有 on-policy 自蒸馏流程:
- 学生 rollout 收集:沿用现有采样策略(如 vLLM 批量生成),无需改动推理管线。
- 教师曝光控制:引入一个轻量 Beta 策略网络,以训练状态统计量(如近期正确率、损失趋势)为输入,输出下一批次的 reveal ratio。该网络可与主学生模型联合优化,或单独用 discounted learning-progress reward 训练。
- 损失计算:只需将原有的固定全曝光 teacher logits 替换为由曝光比例加权后的 partial teacher targets,其余训练代码(如 KL 散度损失、优化器配置)保持不变。
作者指出:“full exposure is not reliably the best choice, and student–teacher mismatch grows monotonically as the teacher sees more privileged reasoning.” 因此,仅需在配置中引入一个小型控制器并调整延迟奖励折扣因子,即可将现有自蒸馏管道升级为 ATESD。
对于已采用 KIMI‑style RL、STaR 或 OPSD 的团队,迁移成本极低:保留原有环境交互和 rollout 存储格式,仅修改 teacher 侧的输入拼接逻辑并挂载控制器。这种非侵入式设计使得 ATESD 可快速验证并部署到在线推理增强的持续训练循环中。
局限
- **依赖完整参考解**,适用范围受限。ATESD 假设每个训练样本都配有完整的 **参考推理**(reference reasoning)过程,这在数学竞赛题等结构化任务中较易获得,但许多实际场景(如开放式对话、创意写作)中并无预定义推理链。若无参考解,教师无法进行暴露调制,方法失效。该局限缩小了 ATESD 的通用性,未来或需探索无参考或弱参考条件下的自适应机制。
- **控制器训练引入额外复杂度**。引入可学习的 **Beta 策略控制器** 虽实现了动态暴露调整,却增加了训练管线复杂度。on-policy 采样与 **学习进度奖励** 的计算需维护 hold window 内多步统计量,且控制器的优化需单独的反向传播和奖励折扣设计。这种二阶段优化(学生与控制器交替更新)可能导致收敛变慢,尤其在资源受限或大规模预训练场景下,部署效率可能受限。
- **实验领域单一**,泛化性待验证。当前验证仅限于 **AIME 24 / 25** 和 **HMMT 25** 三个数学推理数据集,模型也仅使用 **Qwen3** 系列(1.7B–8B)。在其他推理类型(如代码生成、科学问答、多跳规划)或不同模型族、更大规模模型上的表现尚不明确。此外,数据集的分布偏移(如竞赛数学题的特殊分布)对控制器策略的影响也未分析,可能高估方法的普适有效性。