突破 LLM 推理中 on-policy self-distillation 的扩展极限
On-policy self-distillation(OPSD)训练学生模型在自身采样轨迹上匹配特权 teacher 的分布,其监督施加于未验证的 student rollout,同时让 teacher 以特权上下文(通常是参考解)为条件。 通过因子分析分离这两个角色,我们发现 scaffold 正确性 对下游准确率的影响强于 context 正确性。未验证 scaffold 会因 teacher 使用了学生无法获取的信息而造成 imitation gap;该 gap 随模型规模缩小,OPSD 却仍主要监督未验证轨迹。相反,即便 teacher 以学生自身失败的 rollout 为条件,已验证 scaffold 依然有效。 据此提出 OASIS,保留 OPSD 目标,但主要监督经标签验证的 on-policy 轨迹,并以未验证的模型自生成尝试替代书面解答作为 teacher context,因此仅需最终答案标签。 在 Qwen3-1.7B、4B、8B 上针对 AIME 2024、AIME 2025 与 HMMT 2025,OASIS 平均较 base model 提升 3.2--3.8 分,而 OPSD 的增益从 1.7B 的 3.05 分降至 8B 的 0.14 分;8B 上 OASIS 领先 OPSD 3.05 分,说明已验证的 on-policy scaffold 可在模型扩展时保持自蒸馏的有效性。
论文精读
TL;DR OASIS 用最终答案标签筛选已验证的正确 on-policy 轨迹做自蒸馏,无需参考解答,解决 OPSD 随模型规模扩大增益消失的问题,8B 模型上平均提升 3.2–3.8 分。
问题
问题背景
当前 LLM 推理训练中,On-Policy Self-Distillation (OPSD) 被用于提升数学推理等复杂任务,核心是让 student 匹配 teacher 在自身采样轨迹上的特权分布。
现有方法局限
标准 OPSD 监督未经验证的 rollouts,且教师上下文为参考解答。论文分解发现 scaffold correctness 比 context correctness 影响更大:未验证 scaffold 造成 imitation gap,教师可利用学生不可见信息,学生无法模仿。随模型规模从 1.7B 到 8B,OPSD 增益从 3.05 点降至 0.14,scaling 不可持续;且 KL 裁剪可能反转更新方向。
为什么这个问题难/重要
难点在于如何在仅用 final-answer labels 条件下,识别值得监督的 on-policy 轨迹,同时保持数据效率。业界对 reasoning 模型的大规模强化学习/蒸馏关注度高,但监督信号质量随模型能力提升而衰减,直接影响训练 ROI。OASIS 通过标签验证筛选轨迹,并用未验证模型生成尝试作为教师上下文,突破 OPSD 的 scaling 瓶颈,在 8B 上较 OPSD 提升 3.05 点。
行业类比
类似于代码生成中,仅靠执行结果反馈(是否通过测试)筛选高质量合成数据,比依赖人工标注参考代码更能随模型能力提升保持有效监督。
核心洞察
- 标准 OPSD 的失效根因在于监督分配在未验证轨迹上,而 scaffold correctness 比 context correctness 更关键。这一分析通过 factorial 设计分离了 scaffold 与 context,发现即使 teacher 上下文是错误的学生 rollout,verified scaffold 依然有效;而 unverified scaffold 会导致 teacher 利用学生不可见的信息产生 imitation gap。这与以往 OPSD 依赖参考解作为 privileged context、默认监督所有 on-policy rollouts 的做法形成对比,解释了为何 OPSD 收益随模型规模递减。
- OASIS 的核心创新是用 final-answer label 做验证来筛选 on-policy trajectory,取代人工参考解和未验证 rollouts,使 self-distillation 在大模型上可扩展。与之前需要 privileged written solution 的 OPSD 不同,OASIS 仅需答案标签即可构建 teacher context,并且监督主要集中在 verified scaffold 上,从而在 Qwen3 8B 上比 OPSD 提升 3.05 分,说明验证信号本身足以替代昂贵上下文,同时保留 on-policy 对齐。
方法
输入与数据流
OASIS 的输入为问题 prompt、一组模型 on-policy 采样的 rollout(每个 rollout 包含最终答案),以及仅需最终答案的标签(如数学题答案)。无需人工参考解或过程标注。
关键模块与监督设计
标准 OPSD 对所有 rollout 施加蒸馏监督,teacher 以人工参考解为 privileged context 生成目标分布;student 沿自身采样轨迹模仿该分布。OASIS 通过两个改动重构监督信号:
- 验证筛选 scaffold:对每个问题,用标签检查各 rollout 的最终答案正确性。选择正确答案 rollout 中最短的一条作为
scaffold(即学生被要求模仿的目标轨迹)。未验证的 rollout 仅占极小监督权重,避免 teacher 利用学生无法获得的信息造成 imitation gap。 - 替换 teacher context:不再使用参考解,而是从同一问题采样一个不同的、未经验证的模型生成 rollout 作为 teacher 的条件上下文。该 context 与 scaffold 不共享中间步骤,确保 teacher 分布可被 student 从自身经验中逼近。
输出与训练目标
学生模型在选定的 scaffold 轨迹上,以 teacher 基于该 context 产生的分布为目标进行蒸馏。损失函数沿用 OPSD 的前向 KL 形式(具体为逐 token 的 KL 散度并可能带 clip)。最终输出为更新后的 student 权重,用于下一轮 on-policy 采样,形成迭代。
与同类方法的差异
OASIS 保持 OPSD 的蒸馏目标不变,但通过用最终答案标签验证并筛选 scaffold + 用模型自身 rollout 替代人工参考解作为 teacher context,将监督集中在学生可模仿的 verified 轨迹上,从而在模型规模扩大时避免 OPSD 增益衰减。
实验
实验设计
论文在 Qwen3-1.7B、Qwen3-4B、Qwen3-8B 上对比 OPSD 与 OASIS,评估数据集为 AIME 2024、AIME 2025、HMMT 2025。OPSD 采用参考解答作为特权上下文,监督未验证的 on-policy 轨迹;OASIS 保留相同自蒸馏目标,但通过最终答案标签筛选已验证轨迹进行监督,并用未验证的模型生成尝试替代参考解答作为上下文。训练全程仅需最终答案标签。
关键发现
- OASIS 平均相对 base model 提升 3.2–3.8 分,在所有模型尺寸上保持稳定增益。
- OPSD 增益随规模衰减:1.7B 时 +3.05 分,8B 时仅 +0.14 分。
- 在 8B 模型上,OASIS 相对 OPSD 高出 3.05 分,证明已验证 on-policy 轨迹能够维持自蒸馏在大模型上的有效性。
与基线的深度解读
OPSD 失效的核心在于未验证轨迹的 模仿差距(imitation gap):教师可利用学生不可见的信息(参考解答)产生不可模仿的分布,导致监督信号低效。尽管该差距随模型规模缩小,但 OPSD 仍主要监督未验证轨迹,浪费了大量计算。OASIS 通过验证标签筛选出教师可模仿的轨迹(已验证正确或最短验证轨迹),从源头消除特权信息滥用,因此在大模型上保留增益。这一差异表明,推理自蒸馏的瓶颈不在目标函数,而在监督数据的选择——可模仿性 比上下文特权更重要。
行业影响
落地场景
OASIS 适用于需要高推理能力但标注预算有限的团队:教育科技(数学/编程题自动求解与讲解)、金融分析(财报推理、风险评估)、企业知识库问答(复杂逻辑推理)以及代码助手(算法题生成与验证)。其核心优势是仅需最终答案标签,无需逐步骤标注,可低成本在垂直领域定制高推理能力模型。
商业价值
主要降低数据标注成本:传统逐步骤蒸馏需要昂贵的过程监督,OASIS 只用标签即可。同时在模型规模扩大时保持增益(8B 模型仍提升 3.05 点),避免 OPSD 的收益衰减,提高训练 ROI。可快速迭代领域模型,缩短产品上线周期。
与现有工作流集成
OASIS 可无缝嵌入现有 RLHF / 自蒸馏 pipeline:将 OASIS 目标替换原有 OPSD 损失,保留 verifier(规则或模型)判断轨迹正确性,仅对验证通过的 on-policy 样本进行蒸馏;教师上下文改用模型自身 rollout,无需参考解。适合与 PPO / GRPO 等在线策略优化结合,也可作为后训练阶段插件。
具体落地 use case:
- 一家在线教育平台用 OASIS 训练数学解题模型:收集学生提问和最终答案标签,模型通过自生成多种解法并仅对答案正确的轨迹进行自蒸馏,显著提升步骤级解释质量,而无需人工标注推理过程。
- 一家金融科技公司希望模型能从财报中推理关键风险指标:使用 OASIS 在内部数据上微调,只需标注最终指标数值,模型即可学习稳健的推理链,降低对昂贵专家注释的依赖。
局限
- **依赖最终答案标签**:OASIS 虽然将 teacher context 简化为模型生成的不带验证的解题尝试,但仍要求每个问题具有可自动判定的最终答案标签(final-answer labels),用于识别 verified trajectories。对于开放式生成、代码生成或需要人工评估的任务,标签获取成本依然较高,限制了方法在更广泛推理任务上的直接迁移。
- **实验领域与模型族单一**:所有实验基于 Qwen3 系列(1.7B/4B/8B)在数学竞赛基准(AIME 2024/2025, HMMT 2025)上进行。虽然数学推理是 LLM 推理的代表场景,但未覆盖代码、科学问答、多步工具使用等不同推理形态,方法在非数学任务上的有效性和超参数敏感性尚待验证。
- **训练开销与采样效率**:OASIS 需要多次采样 rollouts 以获取 verified trajectories 和用于 teacher context 的 distinct rollout,并且选择“最短 verified trajectory”可能引入额外的前向计算和排序开销。与标准 OPSD 相比,其总训练成本增加,但论文未系统报告在相同计算预算下的效率对比,可能影响实际部署时的成本权衡。