On-Policy Self-Distillation without Any Supervision
On-Policy (Self-)Distillation (OPD / OPSD) 在大型语言模型 (LLM) 的后训练中展现出强大潜力。然而,现有方法仍严重依赖外部监督,包括真实标签信号、环境反馈或更大模型的指导,因此并非真正的“自我”蒸馏。本研究表明,仅利用模型自身的生成结果,通过内部一致性即可实现 on-policy 自我蒸馏。 我们提出无监督 on-policy 自我蒸馏 (U-OPSD)。U-OPSD 首先采样多条轨迹,并通过自我一致性阈值下的多数投票构建伪解;随后,将模型分布条件于伪解,并在不一致的补全上进行自我蒸馏,使模型能够精确地纠正其“自信但错误”的部分。 在多个基准、基础模型和训练设置下,U-OPSD 持续优于基础模型,并达到或超越使用真实标签 (GT) 的监督方法(如 OPSD 和 GRPO)。在五个数学推理基准(AIME24、AIME25、HMMT25、MATH500、AMC23)上,U-OPSD 在 Qwen3 非思考模式下的 4B 和 8B 模型上分别较基础模型提升 8.5% 和 10.7%,平均超出 OPSD 3.2% 和 2.3%。在思考模式下,U-OPSD 与 OPSD 持平(4B 领先 0.9%,8B 持平),并分别超出 GRPO 0.7% 和 1.1%。代码已开源:https://github.com/williamium3000/u-opsd
论文精读
TL;DR U-OPSD 基于采样投票构造伪标签,通过在线自蒸馏纠正自信错误,无需外部监督,数学推理超越有监督方法。
问题
问题背景
LLM 后训练正从监督微调转向 on-policy 自改进方法,其中 on-policy self-distillation (OPSD) 因能利用模型当前分布进行自我知识固化而备受关注。它无需额外教师模型,通过在模型自身生成的轨迹上蒸馏,理论上可实现持续自我提升。
现有方法局限
然而,现有 OPSD 方法并未实现真正的“自”蒸馏:
- 依赖 ground-truth (GT) 信号:如标准 OPSD 需要正确答案过滤样本,限制了其在开放式或缺乏标注任务上的应用。
- 依赖环境反馈的奖励模型 (如 GRPO):需定义可验证的标量 reward,对于复杂推理任务,设计良好奖励函数极其困难且易被 hack。
- 依赖更大教师模型:传统在线知识蒸馏需外部 teacher 提供软标签,增加了部署复杂度和计算成本,且知识上限受限于教师。
这些外部监督将自蒸馏退化为一种受限的模仿学习,无法应对真实世界中大部分无监督场景,也失去了规模化自我进化的潜力。
核心挑战与技术重要性
无监督自蒸馏的核心难点在于 从模型自身的错误中提取可靠的学习信号。大模型常犯错却高度自信,直接使用自身输出作目标会导致 错误累积 (collapsing)。U-OPSD 的突破在于引入 自一致性投票 (self-consistency) 构造伪解,并仅在模型预测与伪解不一致的区域进行知识蒸馏,相当于 让模型在自信错误处精准自我纠正。这一技术规避了对外部标注的依赖,使 LLM 能仅凭内部一致性实现自我改进,对推动 自监督在线学习、低成本模型维护、隐私敏感场景 等前沿方向具有重要价值。
行业类比
这类似于 自动驾驶系统 通过多传感器预测的一致性投票来校验障碍物识别,并在冲突处触发模型更新,无需人工标注,实现自我进化。
核心洞察
- **内部一致性可作为自监督信号,实现真正的无外部监督自我蒸馏。** U-OPSD 利用模型多次采样结果的多数投票构建伪标签,并通过自洽性阈值筛选高置信度样本。与依赖 ground truth 的 OPSD 或依赖外部奖励的 GRPO 不同,它仅从模型自身的生成分布中提取监督信息,无需任何外部信号,将“self-distillation”推进到完全自监督的新阶段。
- **聚焦“自信的错误”进行定向纠正,提升蒸馏效率和效果。** U-OPSD 只在模型多数投票正确但个别生成错误的样本上进行蒸馏,这相当于锁定模型在优势解附近的系统性偏差。相比于均匀蒸馏所有生成或仅依赖正确标签的方法,这种策略更具针对性,在多个数学推理基准上的表现超越了 OPSD 及 GRPO,甚至不依赖于任何外部正确答案。
方法
方法概述
U-OPSD 是一种完全无监督的 on‑policy 自蒸馏方法,仅使用模型自身的推理样本来实现自我提升,无需任何外部监督信号(ground truth、环境反馈或大模型引导)。
输入与采样
- 给定一个 prompt 数据集,模型对每个 prompt 采样多个 rollout(推理路径),不依赖外部 label。
- 这些 rollout 通过一致性阈值(self‑consistency threshold)进行筛选:当多数投票(majority vote)得出的答案的支持票数超过该阈值时,该答案被认定为“伪真值”(pseudo‑solution)。
关键模块:伪标签构造与选择性蒸馏
- 伪标签构造:利用内部一致性,将多数投票结果作为监督信号。这相当于在不使用外部 ground truth 的情况下,自动标注出模型“自信正确”的样本。
- 条件分布与不一致检测:将模型自身对 prompt 的输出分布以伪真值为条件,识别出与伪真值不一致的生成(即模型给出其他答案的 rollout)。这些不一致生成正是模型“自信但犯错”的地方。
- 蒸馏目标:仅在这些 不一致 completion 上执行知识蒸馏,让模型学习使输出分布更贴近以伪真值为条件的分布。这相当于在模型最需要修正的位置进行针对性优化。
训练流程
- 从策略模型(on‑policy)采样多个 rollout。
- 使用一致性检查构造伪标签,过滤出置信度高的伪真值。
- 对于伪真值对应的 prompt,计算以伪真值为条件的 teacher 分布(通常用模型自身在伪真值下的输出分布,或维护一个教师模型)。
- 在 student 模型(即被训练的策略模型)上,仅对与伪真值不一致的 completion 计算 KL 散度损失(或其他 divergence),使其分布向 teacher 靠拢,同时对一致部分不做惩罚,避免遗忘。
- 更新模型,重复迭代。
与同类方法的差异
与 OPSD(需要 ground truth 进行 on‑policy 蒸馏)和 GRPO(依赖可验证奖励信号)相比,U‑OPSD 完全移除了对外部监督的依赖,仅通过多路推理的内部一致性来构建伪标签,实现了真正意义上的“自”蒸馏,且在数学推理基准上达到或超越监督方法的性能。
实验
实验设计
- 模型与模式:选取 Qwen3 的 4B 与 8B 两种规模,在 非思考模式(直接生成答案)和 思考模式(CoT)下分别评估;同时验证指令微调后的表现。
- 基准测试:五个数学推理基准(AIME24/25、HMMT25、MATH500、AMC23)覆盖竞赛级与学术级推理难度。
- 对比方法:基线为原始模型,有监督方法 包括 OPSD(使用 ground truth 的 on-policy 自我蒸馏)和 GRPO(使用可验证奖励强化学习);本方法 u-OPSD 不使用任何外部标签或教师。
- 评估细节:每个提示采样 16-64 次 rollouts,采用多数投票构建伪标签,并基于内部一致性阈值 ε 筛选可靠样本进行蒸馏。
关键发现
- 无监督自蒸馏可行:仅利用模型自身生成的多条轨迹与内部一致性(多数投票),u-OPSD 成功实现了 on-policy 自我蒸馏,完全摒弃外部监督。
- 性能全面提升:在所有五个基准上,u-OPSD 相较原始模型平均提升 8.5%(4B)与 10.7%(8B);在非思考模式下以显著优势超越 OPSD(4B 平均 +3.2%,8B 平均 +2.3%)。
- 思考模式竞争力:u-OPSD 与使用 ground truth 的 OPSD 表现持平(4B 略高 0.9%,8B 持平);同时超越 GRPO(4B +0.7%,8B +1.1%),证明自我修正信号的有效性。
与传统基线对比的核心洞察
- OPSD 的瓶颈:传统 OPSD 依赖外部标签才能指导策略蒸馏,这限制了其在无标注场景的应用。u-OPSD 通过自洽性阈值与多数投票构造伪解,在无任何外部信号时仍能提供高质量、高密度的学习信号,甚至因无标签偏差而更贴合模型自身的弱点。
- 超越 GRPO 的根源:GRPO 采用稀疏奖励信号,而 u-OPSD 利用逐 token 分布蒸馏提供稠密反馈,更精确地纠正模型“自信但错误”的生成区域。这表明在推理类任务中,内部一致性的稠密信号可能比外部二元奖励更细致。
- 实用价值:该方法为缺少标注、闭源或无法获取大型教师模型的场景提供了开箱即用的自我提升路径,大幅降低了数据依赖与工程成本。
行业影响
落地场景
U‑OPSD 能在所有需要强逻辑推理、却缺乏高质量标注或外部反馈的商业场景中直接自我提升模型性能。典型产品/业务包括:
- 数学/编程类教育辅导工具:无需人工标注答案,仅凭学生问题即可自适应强化模型解答能力。
- 电商智能客服的复杂规则推理:处理退换货、促销组合等需多步逻辑的问题,模型可在线上持续用自身采样投票自我校正。
- 企业数据和代码助手:帮助非技术人员生成 SQL、Python 脚本,通过内部一致性提升生成准确率,降低对 expensive teacher 的依赖。
- 医疗/法律决策辅助:在隐私敏感、外部标注稀缺的场景,模型仅利用自身 rollout 即可调整自信错误回答。
商业价值
- 降本:完全免除训练时对真实答案(GT)、环境奖励或大型教师模型的依赖,省去昂贵的标注与 API 调用成本。
- 体验提升:模型能在用户交互循环中持续自我纠错,尤其在“自信却错误”的案例上收敛,显著提升用户信任度和成功率。
- 增收:加速模型迭代周期,使 SaaS 产品的推理能力持续领先,直接转化为客户订阅与留存。
与现有产品/工作流的接口
U‑OPSD 可直接插入现有 post‑training pipeline 的 RLHF 或 GRPO 之后,作为无监督自我提升阶段:
- 部署模型生成多条 rollout;
- 用多数投票和自一致性阈值构造伪标签;
- 仅在模型分布与伪标签分歧的 completion 上执行蒸馏。 该流程可与在线 serving 系统联动,实现持续在线学习,且不改变模型架构,只需新增一个轻量的自蒸馏 training loop。
具体落地用例
- 数学辅导产品(如 Photomath、Khan Academy 的 AI 助手):用户提交复杂数学题,模型后台自动生成多解并投票,将自信错误纠正后回流至主模型,次日即获得解答准确率提升。
- 金融研报自动分析:模型针对大量财报生成多角度摘要,通过自一致性过滤掉矛盾结论,提升重要数字提取的准确率,降低人工复核成本。
局限
- **伪标签质量对自一致性阈值的敏感度较高**:U-OPSD 使用多数投票生成伪解,其正确性高度依赖模型在多次采样中的内在一致性。当模型在难题上输出分散或多数投票结果错误时,伪标签本身会引入噪声,后续蒸馏可能放大错误。论文虽然设置了自一致性阈值过滤低置信样本,但该阈值需要人工调节,且在不同任务间的迁移性未知。实际工程中,如果基础模型推理能力较弱,伪标签质量可能迅速下降,导致训练失效,因此该方法对基模型能力有一定隐形要求。
- **多次 rollout 带来的推理成本显著增加**:每个 prompt 需要采样多个完整序列,在长链条推理(如数学证明、代码生成)或思考模式下,单次 rollout 的生成成本已不低,多路采样会成倍放大推理开销。虽然论文没有报告具体延时或计算资源对比,但相比单次生成的有监督方法(如 GRPO、OPD),U-OPSD 的数据获取阶段明显更重。这可能在低延迟场景或大规模线上训练中构成瓶颈,限制了该方法在时效性要求高的工业级应用中的可行性。
- **任务泛化性与鲁棒性验证不足**:实验主要聚焦于数学推理基准(AIME24/25、HMMT25、MATH500、AMC23),缺少在代码生成、自然语言推理、安全对齐等更广泛领域的评估。与强基线 GRPO 的对比也仅在有限设置下进行,无法确认在更复杂或开放域任务中是否仍能匹配有监督方法。此外,自蒸馏过程可能掩盖模型自身的不确定性,在某些安全关键应用中,不加外部监督的自我纠正可能导致更隐蔽的错误累积。