特权信息为 On-Policy Self-Distillation 带来了什么?
On-policy self-distillation (OPSD) 让语言模型从一个能看到答案或解题过程的自身冻结副本中学习。给教师模型这些额外信息,看似能为学生提供更多可学内容,但除了蒸馏本身之外,它究竟贡献了多少? 为分离这一贡献,作者构建了 AMPLE-Math:一个可复用的题目集,包含 5,319 道数学题与六种共享同一答案的推理视角,并将每种视角与匹配的无参考蒸馏进行对比。 在启用思考的教师监督直接回答 rollout 时,无参考蒸馏 已能解释 Qwen3-1.7B 在思考式评测下的大部分提升,无论在本领域还是外部基准上。参考信息带来的额外收益在 Qwen 中较为有限,其中精修解答收益最强;而在 SmolLM3-3B 第 50 步,完整轨迹带来 2 个百分点的提升。 这些收益取决于学生是否在接受训练。在同一 checkpoint 下,把短直接回答 rollout 换成长的思考式 rollout,在问题、参考与评测保持不变时,两个模型族的增益都会转为损失。Qwen 中的教师画像与匹配损失干预进一步表明,改变 token 级监督也可能让学生的行为基本不变。 这些发现提示 OPSD 能通过直接回答与思考式推理共享的参数,改善模型对已有推理能力的调用。特权参考的价值在于它对这种跨模式迁移的增益,而非它揭示了多少解答。
论文精读
TL;DR 构建 AMPLE-Math 基准,系统分析 on-policy self-distillation 中特权参考信息的实际贡献:无参考蒸馏已带来大部分提升,额外增益有限且依赖学生训练状态,说明 OPSD 的价值主要在于跨模式迁移。
问题
问题背景
当前 语言模型自我改进 的研究热点之一是基于 on-policy self-distillation (OPSD) 的范式:学生模型从自身冻结副本生成的轨迹中学习,而教师副本可额外访问答案或解题过程(特权信息)。业界关注它在无外部人工数据下能否稳定提升推理能力。
现有方法局限
以往 OPSD 工作通常只对比“教师有特权参考 vs 无特权参考”的蒸馏效果,但缺乏受控变量设计,未隔离 无参考蒸馏本身 的贡献。即使教师看不到任何答案,学生从自身分布中采样并蒸馏也可能因分布匹配、温度缩放等机制产生非平凡增益。此外,不同特权视图(如简短答案、完整解题轨迹)的长度和内容结构差异巨大,导致增益来源混杂;已有数据集规模小、问题多样性不足,难以进行细粒度归因。
为什么这个问题难/重要
难点在于必须固定问题、答案和评估协议,仅改变监督信号类型,同时追踪学生训练动态,区分跨模式迁移(直接响应与思考模式共享参数)与特权信息带来的额外收益。论文构建 AMPLE-Math(5,319 个数学问题,六种共享答案的推理视图)进行匹配对照实验,发现无参考蒸馏已提供大部分提升,特权参考的附加价值微弱,且效果依赖学生是否被训练以及 rollout 类型(短直接响应 vs 长思考响应)。这意味着单纯向教师揭示答案并非关键,优化轨迹和采样分布可能起更大作用。对工程团队而言,这直接影响是否值得投入资源构造高质量参考解析。
行业类比
类似 代码生成模型 的自我改进:让模型在训练时看到参考实现(特权信息)与仅让它从自己生成的代码中反思重塑,哪种方式更能提升后续生成质量?本研究表明后者可能已覆盖大部分收益。
核心洞察
- 特权参考信息在 OPSD 中的实际增量价值远小于无参考蒸馏本身,该论文通过 answer-matched 六视图与 matched reference-free 蒸馏的受控比较首次量化了这一点。现有 OPSD 工作通常默认提供答案或解题过程能显著提升学生,但未分离蒸馏与参考信息的贡献;该论文在 Qwen3-1.7B 上发现无参考蒸馏已贡献大部分提升,参考的额外收益 modest,推翻了‘特权信息越多越好’的直觉,提示工程上应优先优化蒸馏过程本身。
- OPSD 的收益主要来自跨模式迁移——学生通过共享参数将 direct-response 模式下的学习迁移到 thinking-enabled 推理,而非直接吸收参考答案内容。证据是,在相同问题、参考和评估下,将短 direct-response rollout 替换为长 thinking-enabled rollout 后收益变为损失;而 token 级监督干预(如 teacher profiles、loss support)往往不改变学生行为。这与强调 token 级对齐的蒸馏方法形成鲜明对比,凸显了推理模式匹配和训练状态的重要性。
- 工程部署 OPSD 时,选择 rollout 类型和参考形式必须与学生训练状态及评估模式匹配,否则可能将增益转为损耗。论文在 SmolLM3-3B 上发现 complete traces 在第50步仅增加2个百分点,而替换 rollout 类型则整体损失,且该效应依赖学生是否被训练。这提醒从业者:自蒸馏收益不是单调的,需进行小规模消融实验确定最优配置,避免盲目使用长推理 rollout 或复杂参考。
方法
输入与数据构造
研究构建 AMPLE-Math 数据集,包含 5,319 个数学问题,每个问题配有 六种答案匹配的推理视图,例如直接答案、逐步解答、精炼解答等。这些视图共享同一最终答案,但推理过程的粒度和风格不同。输入包括问题文本、对应的参考答案视图,以及学生模型生成的 rollouts。
关键模块:特权档案与匹配的无参考蒸馏
方法核心是控制变量实验:对每个特权视图,设置一个 reference-free distillation 基线,即教师(冻结副本)不接触额外解答,仅使用与无特权条件相同的信息。在 on-policy self-distillation 框架下,学生模型在自身生成的前缀上继续生成,教师为这些前缀提供 token 级监督。特权信息通过教师可访问的参考答案注入,而学生只看到前缀。关键模块包括:
- 特权档案:测量不同特权视图相对无参考基线的增益,量化“特权信息”本身带来的额外提升。
- 训练轨迹分析:对比学生在训练早期和晚期对特权参考的敏感度,例如在 SmolLM3-3B 上,完整推理轨迹在 step 50 增加两个百分点,但后续收益变化。
- 损失干预:替换参考内容、改变校正标记权重、限制损失支持等,以分离 token 级监督变化对学生行为的影响。
输出与评估
输出是在 thinking-enabled evaluation 下的数学解题能力提升,包括域内和外部基准。研究同时考察 direct-response 与 thinking-enabled 两种 rollout 类型对迁移的影响:同一检查点下,将短直接响应替换为长思考轨迹会导致增益转为损失,说明跨模式迁移依赖于共享参数。最终结论是 OPSD 主要改善对现有推理能力的访问,特权参考的额外价值在于增强跨模式迁移,而非揭示更多解答内容。
差异点
与通常只比较有无蒸馏的 OPSD 研究不同,本方法通过答案匹配的多视图基准和受控损失干预,将“蒸馏本身”与“特权信息”的贡献解耦,从而精确量化 reference 的边际收益。
实验
实验设计
- 构建 AMPLE-Math 数据集,含 5,319 个数学问题,每个问题提供 6 个共享答案的推理视图。
- 比较不同特权视图与 reference-free distillation 基线;教师为 thinking-enabled,学生生成 direct-response rollouts。
- 模型:Qwen3-1.7B 和 SmolLM3-3B。
关键发现
- 在 Qwen3-1.7B 上,reference-free distillation 贡献了大部分提升;额外参考信息仅带来 modest 增益,其中 polished solution 最强。
- 在 SmolLM3-3B 上,complete traces 在 step 50 带来 +2.0 pp 提升;但将 short direct-response rollouts 换成 long thinking-enabled rollouts 后,同一 checkpoint 下增益转为损失。
与基线对比解读
- 特权信息并未大幅超越 reference-free 蒸馏,说明 OPSD 的核心收益来自跨模式能力迁移,而非教师看到的答案本身。
- 实际工程启示:设计自蒸馏流程时应优先考虑 student rollouts 的模式选择,而非过度依赖教师特权信息;特权视图的价值在不同训练阶段和模型家族间并不稳定。
行业影响
落地场景
论文方法适用于数学教育、代码调试、金融分析等需要逐步推理的产品。例如,在线解题助手可部署微调后的 Qwen3-1.7B 或 SmolLM3-3B,以直接响应模式提供接近长思维链质量的解答;企业内部轻量推理引擎也能在资源受限环境中提升多步推理准确率,无需依赖大型教师模型 API。
商业价值
- 降本:无需昂贵的人工标注或特权数据,只需模型自生成的答案/解答作为监督,训练数据成本极低。
- 体验提升:学生模型在 thinking-enabled 评估下性能显著提高,用户获得更可靠的推理结果,同时保持低延迟响应。
- 增收:增强开源小模型的能力,产品可减少对闭源大模型的依赖,提升毛利空间。
与现有工作流集成
OPSD 可作为现有 SFT / RLHF 流程之后的后训练阶段,直接利用自生成数据,无需额外人工介入。训练完成后,模型以 direct-response 模式部署,即可获得 thinking-enabled 推理的收益,降低推理成本。工具链可基于 Hugging Face TRL 或 PyTorch 实现,并可复用论文开源的 AMPLE-Math 数据集与代码(GitHub)进行快速验证。
具体用例
- 在线教育平台:部署自我蒸馏后的数学模型,对用户提交的题目生成逐步解答,提升解题辅导体验,降低人工答疑成本。
- 金融报告自动生成:小模型通过 OPSD 获得逐步分析能力,在生成财务结论前进行内部多步推理,输出更可靠、可追溯的分析摘要。
局限
- - **模型规模与领域覆盖有限**:研究仅使用 Qwen3-1.7B 和 SmolLM3-3B 两个开源模型,且全部实验在数学推理任务上完成。虽然 AMPLE-Math 设计了多视图,但结论是否可推广到更大模型(如 7B/13B)或其他领域(代码、通用知识)仍然未知。自我蒸馏中的特权信息效应可能随模型容量和预训练数据分布而变化,该工作未提供这些维度的证据。
- - **实验设计与超参数敏感性不足**:论文对比了有参考和无参考蒸馏,但只固定了一种教师配置(thinking-enabled 教师监督 direct-response rollouts),未系统探索不同损失函数权重、温度系数、教师思考长度等关键超参数。此外,摘要提到改变 token 级监督可能使学生行为基本不变,这意味着某些干预可能强度不足,导致结论偏向“参考收益有限”的归因存在不确定性。需要更多消融来确认超参数选择不影响结论方向。
- - **数据集构造与外部效度局限**:AMPLE-Math 的六个推理视图共享相同答案,这种严格匹配虽然利于控制变量,但与实际场景中参考数据混乱、噪声多的特点差距较大。此外,数据集仅包含数学问题,问题难度和类型可能不够多样。论文虽然承认收益取决于学生被训练的状态,但未深入解释为何在特定检查点收益会转为损失,这限制了结论的实践指导意义。