论文

On-Policy Distillation 真的在蒸馏吗?从嘈杂教师到自我改进

On-Policy Distillation 真的在蒸馏吗?从嘈杂教师到自我改进

On-Policy Distillation (OPD) 通过密集的 token 级监督,替代了基于可验证奖励的强化学习(RLVR)中稀疏的结果级优势。然而,教师对学生生成轨迹的评分,本质上属于 off-policy 监督,其可靠性存疑。我们定量分析了 OPD 训练中的教师监督,发现其中存在大量噪声,且噪声比例随教师规模增大而上升。令人意外的是,学生策略对这些噪声并不敏感——无论保留还是移除噪声监督,最终性能几乎一致。 这引发了一个问题:OPD 真的在蒸馏吗?通过剖析性能提升的来源,我们发现学习主要集中在低 log-probability token 上,且使用单一固定负优势即可达到与教师提供优势相当的效果。这表明 OPD 的核心机制是抑制低概率 token,而这一过程无需教师参与。 基于上述发现,我们提出 On-Policy Self-Adaptation (OPSA)——一种无需外部监督的方法,利用熵自适应负优势,对高熵位置施加更强的学习信号,抑制尾部 token,并将概率质量均匀重新分配至头部 token。在 AIME24 上,相比基础模型 Qwen3-1.7B,OPSA 将 Avg@32 提升了 35.41 分(相对增益 263%),且在三个基准上的 Pass@32 均提升一倍以上。OPSA 还以 16.77 分的 Avg@32 优势超越 OPD。跨模型家族与任务的广泛实验进一步验证了其有效性与泛化能力。

论文精读

TL;DR 这篇论文发现 on-policy distillation 的实际提升主要来自抑制低 log-probability tokens,而非教师蒸馏;据此提出无监督的 On-Policy Self-Adaptation,用熵自适应负优势大幅提升推理性能。

问题

在大模型推理任务中,RLVR 依赖 verifiable rewards 提供稀疏 outcome-level 信号,收敛慢且样本效率低。On-policy distillation (OPD) 作为替代,利用 teacher model 对 student 生成的每个 token 给出 log-prob 差异,提供 token-level 密集监督,被广泛用于提升小模型推理能力。

然而,teacher 对 student 生成轨迹的评分本质上是 off-policy:学生采样路径可能偏离 teacher 训练分布,导致 teacher 输出不可靠。论文量化显示 OPD 中 teacher 监督噪声比例很高,且随 teacher 规模增大而加剧。更令人意外的是,学生对这些噪声并不敏感,移除噪声后性能几乎不变。进一步分析表明,OPD 的有效学习信号集中在低 log-probability token 上,而固定 negative advantage 就能达到 teacher-provided advantages 的效果。这说明 OPD 的蒸馏收益可能并非来自 teacher 知识迁移,而是简单压制低概率 token。

在 scaling 背景下,teacher model 通常比 student 大得多,计算成本高昂。如果 teacher 的作用可以被无监督规则替代,那么大量蒸馏算力投入可能并不必要。同时,理解 OPD 的真实作用机制,有助于设计更高效、可扩展的 policy 优化方法,避免依赖外部监督的脆弱性。该问题也关系到 RLHF 类方法中奖励信号可靠性的普遍挑战。

类似代码生成中用大模型评判小模型输出,评判结果可能因 off-policy 而失真,而直接利用输出分布熵进行约束反而更稳健。

核心洞察

  • OPD 的增益来源并非教师蒸馏,而是对学生自身低概率 token 的抑制。该研究定量揭示 OPD 中教师提供的 token-level advantage 充满噪声且随教师规模增加而放大,但学生对这些噪声不敏感,去除后性能不变。进一步发现学习主要集中在低 log-probability tokens,仅用固定负 advantage 即可匹敌教师 advantage 效果。这颠覆了 OPD 依赖教师知识的假设,指出其本质是一种无需教师的分布正则化,为简化训练提供了依据。
  • OPSA 通过熵自适应负 advantage 实现完全无监督的自我改进,大幅超越 OPD 和其他 baseline。OPSA 对高熵位置施加更强负信号以抑制尾部 token,同时平均重分配头部 token 概率,避免多样性坍缩。在 Qwen3-1.7B 上 AIME24 提升 35.41 点(263% 相对增益),且跨模型、跨任务泛化。相比需要教师模型的 OPD,OPSA 省去教师推理开销,仅依赖学生自身熵信号,表现更优,为推理模型自我提升提供了新范式。

方法

方法:On-Policy Self-Adaptation (OPSA)

输入:仅使用学生策略自身生成的轨迹,不依赖教师模型或外部奖励。对每个生成 token 位置,计算学生策略输出分布的熵。

关键模块:

  • 熵自适应负优势:根据每个 token 位置的熵值动态分配负优势信号。高熵位置表示模型不确定、可能分支多,赋予更强的负学习信号;低熵位置(模型已非常确定)则几乎不施加惩罚。
  • 固定负优势约束:所有被选中训练的位置使用相同的负优势值(如 δ=1),省去 critic 或 teacher 提供的逐 token 优势。
  • 概率质量重分配:通过抑制高熵位置的尾部 token(低概率 token),将概率质量均匀转移至头部 token,避免 collapse 并保持多样性。

输出:更新后的策略模型,其生成分布更集中、尾部低概率分支被削弱,同时保留头部 token 的多样性,并诱发反思性长程推理行为。

实际工程启示:OPSA 无需 reward model 或 teacher,训练开销小,可作为 RLVR 的冷启动或单独使用。

与同类方法差异:OPD 依赖教师提供的 token 级监督(实际是噪声优势),RLVR 依赖稀疏的 outcome 奖励;OPSA 仅利用策略自身的熵统计量自适应构造负优势,完全去除外部监督。

实验

实验设计

作者基于 Qwen3-1.7B 基础模型,在 AIME24 及另外两个推理基准上评估。对比基线包括 OPD 和 RLVR 类方法,主要指标为 Avg@32 与 Pass@32。实验重点比较 OPSA 与 OPD 的差异,并分析教师监督的噪声特性。

关键发现

  • 教师监督噪声高:OPD 中教师评分存在大量噪声,且随教师规模增大而增加;但学生策略对噪声不敏感,去除噪声后性能几乎不变。
  • 学习信号来源:训练增益主要集中于低 log-probability tokens;固定负优势即可复现教师优势的效果,说明抑制尾部 token 是核心机制。
  • OPSA 有效性:OPSA 使用熵自适应负优势,在 AIME24 上 Avg@32 提升 +35.41 点(相对增益 263%),Pass@32 在三个基准上均翻倍以上,较 OPD 提升 +16.77 点。

基线对比解读

OPSA 完全不依赖外部教师监督,相比 OPD 更简单且效果更优,这表明 token 级监督的本质是抑制低概率分支而非知识蒸馏。该方法与 RLVR 的稀疏奖励不同,提供密集但自适应的负信号,避免了奖励设计的复杂性。工程上,OPSA 无需教师模型可大幅降低训练成本,且能作为 GRPO 的冷启动(论文附录验证),为推理模型的高效自提升提供了新路径。

行业影响

落地场景

OPSA 适用于需要复杂推理但标注数据稀缺或计算预算受限的场景,如数学解题助手、代码生成与调试工具、金融合规分析、医疗诊断辅助等。它允许中小规模 LLM(如 Qwen3-1.7B)在没有 teacher 模型或 verifiable reward 的条件下,仅凭自身生成轨迹的熵自适应负优势实现推理能力自提升,特别适合部署在边缘设备或成本敏感型业务中。

商业价值

  • 降本:无需调用大规模 teacher 模型进行蒸馏,节省 API 费用与延迟;无需人工标注或设计 reward model,缩短开发周期。
  • 增效:在 AIME24 上 Avg@32 提升 35.41 分 (+263%),Pass@32 翻倍,显著提高复杂任务通过率,直接转化为产品可用性。
  • 体验提升:模型展现更强反思能力(reflective reasoning),输出更可靠,降低错误率,提升用户信任。

与现有工作流接口

OPSA 可无缝嵌入现有 RLVR/蒸馏训练栈:

  1. 将 OPD 中的 teacher score 替换为固定负优势 -1 或熵自适应负优势 -H(π),无需额外模型。
  2. 接入 HuggingFace TRL 或自定义训练循环,仅修改 advantage 计算函数。
  3. 作为 GRPO/PPO 冷启动策略,或与 SFT 数据混合训练,平滑迁移。

具体 use case:某电商平台智能客服需解析复杂促销规则(满减、叠加、时效),小模型错误率高。使用 OPSA 自训练客服专用小模型,无需大模型蒸馏或人工标注,快速提升规则推理准确率,减少人工转接。另一个场景:本地 IDE 代码助手运行 1.7B 模型,OPSA 训练后能更好推导复杂算法逻辑,减少错误代码生成。

局限

  • **机制局限**: OPSA 通过熵自适应负优势抑制低 log-probability 的 token,本质上是一种负向约束,缺乏正向引导信号。对于需要引入新知识、工具调用或长程规划的复杂推理任务,单纯抑制尾部 token 可能不足以扩展模型的能力边界。论文实验主要覆盖数学推理基准(如 AIME24),尚未验证在代码生成、开放域问答等更依赖外部知识的任务中的表现,泛化性有待检验。
  • **基线对比有限**: 论文主要与 on-policy distillation (OPD) 和零外部监督基线比较,没有直接对标基于结果奖励的 RLVR 方法(如 GRPO 等)。虽然 OPSA 在 AIME24 上显著超过 OPD,但与 RLVR 方法的相对优劣尚不明确。此外,实验模型规模较小,如 Qwen3-1.7B,大规模模型(7B、14B、70B 等)上的效果未知,可能影响结论的普适性。
  • **超参数与配置敏感性**: OPSA 引入熵自适应负优势,其中 δ=1 是关键设定,论文展示了该设定的优势,但不同任务和模型可能需要重新调整 δ、训练 token 比例等超参数。此外,OPSA 虽无监督,训练过程仍需要采样多个 rollouts 并计算熵等统计量,带来额外推理开销和实现复杂度,可能影响实际部署效率。
论文Yi Ding2026-08-31原文

相关内容