论文

Negative Self-Distillation:通过规避缺陷来学习推理

Negative Self-Distillation:通过规避缺陷来学习推理

On-Policy Self-Distillation (OPSD) 已成为大语言模型(LLM)自我提升的常用范式,让模型借助 ground-truth 解答等特权信息充当自身的教师。然而近期研究发现,OPSD 在复杂推理任务上会严重削弱 LLM 的表现:强制学生模型模仿在特权信息条件下人为表现得过分自信的推理轨迹,会抑制模型对不确定性的表达,并惩罚解决难题所需的探索与自我纠错行为。 为此,作者提出 Negative Self-Distillation (NSD),不再模仿特权解答,而是让模型远离有缺陷的推理。NSD 不依赖 ground-truth 答案或外部监督,而是由模型自身生成针对具体问题的 负向条件(例如扮演一个“粗心的推理者”),并把学生分布推离这一自生成的 negative teacher。 直接套用 unlearning 目标并不可行:有缺陷的推理 token 与基础语言 token 相互混杂,不加区分地惩罚两者可能灾难性地损害模型的基础语言能力。作者为此设计了 动态门控机制,自动识别并隔离 reasoning-critical tokens,使梯度更新只作用于行为缺陷,同时保留模型的语言先验。 实验表明,NSD 持续优于 OPSD 以及其他无需标签的自举式强化学习(RL)基线。

论文精读

TL;DR NSD 让 LLM 通过偏离自身生成的缺陷推理(而非模仿标准答案)来提升复杂推理,动态门控保护语言能力,性能超过 OPSD。

问题

On-Policy Self-Distillation (OPSD) 是当前 LLM 自改进的主流范式,但近期研究揭示其在复杂推理任务上会导致性能严重退化。现有局限具体为:OPSD 要求学生模型模仿基于真实答案等特权信息的“自信”推理轨迹,这会产生两个系统性缺陷:

  • 抑制不确定性表达:复杂推理需要模型暴露中间步骤的不确定性,而 OPSD 的蒸馏目标迫使模型输出过度确定的 token 分布。
  • 惩罚探索与自我修正:困难问题的解决依赖试错和回溯,但 OPSD 将偏离专家轨迹的探索性行为视为错误。

更本质的难点在于,如果转向负向优化(远离有缺陷的推理),直接使用 unlearning 式的无似然目标会面临 token 混淆问题:推理缺陷 token 与基础语言 token 在序列中高度耦合,不可区分地惩罚二者会导致模型语言能力灾难性下降。因此,如何在没有外部监督的情况下自动隔离“推理关键 token”是标签自由自提升方向的核心挑战。业界对此高度关注,因为高质量标注数据成本激增且难以覆盖长尾失败模式。

这一点与自动驾驶规划类似:仅模仿专家轨迹难以处理罕见场景,模型必须显式学习“避免哪些危险动作”才能提升鲁棒性。

核心洞察

  • NSD 将自蒸馏从模仿特权正确解反转为主动偏离自生成的 flawed reasoning。它让模型自己扮演 careless reasoner 生成负条件,不依赖 ground-truth 或外部监督。这比 OPSD 更符合复杂推理的探索与自我纠错需求,因为 OPSD 强制学生模仿条件于特权信息的“确信”轨迹,会压制不确定性表达与自我纠正行为,反而损害推理性能。
  • 动态门控机制是 NSD 避免灾难性遗忘的关键。朴素 unlikelihood 会把 flawed reasoning 与基础语言 token 混为一谈,对所有 token 施加惩罚会迅速损害模型的语言先验。NSD 自动识别 reasoning-critical tokens,让梯度只作用于行为缺陷,而基本语言 token 的分布保持不变。这一隔离手段让模型可以在不依赖标注数据的情况下做负向优化,也解释了为何 NSD 在更大模型上表现更好。

方法

方法详解

NSD 将 LLM 自提升从“模仿正解”反转为“远离缺陷”。输入仅为问题(或可选带特权解答用于生成负条件),无需外部监督。

负条件提示生成:利用模型自身构造一个负向行为指令,例如“扮演粗心推理者”,引导模型生成有缺陷的推理轨迹作为负例。

动态门控机制:通过 token 级自适应门控识别推理关键 token,区分行为缺陷与基础语言 token(如连接词、格式标记),避免对语言先验产生灾难性遗忘。

门控 unlikelihood 损失:对负例推理中的关键 token 施加惩罚,推动学生模型分布远离负教师分布;门控确保梯度只流向缺陷 token,而非全部序列。

正则化项:加入 KL 正则(或其他约束)约束学生模型与原始模型之间的距离,防止语言能力退化。

整体流程:输入问题 → 生成负条件与负轨迹 → 门控选择关键 token → 计算门控 unlikelihood 损失 + 正则化 → 更新模型。输出为能自主反思、避免缺陷的推理模型。

与同类方法差异:与 OPSD 模仿特权解答相反,NSD 通过远离自生成负分布实现自我提升;与标准 unlikelihood 相比,动态门控解决了负例中语言 token 与推理 token 混淆的问题,避免灾难性遗忘。

实验

实验设计

原文仅提供实验设置概述,没有列出具体数据集名称或评估指标数值。实验在多个不同规模的大语言模型上进行,对比 OPSD 与其他无标签、自举式强化学习基线。训练分为两个阶段:先生成负条件提示(如让模型扮演一个“粗心的推理者”),然后基于该负条件构建 NSD 训练目标。评估重点包括主结果、反思行为、负条件变体、效率以及训练目标理解。

关键发现

NSD 在所有测试模型规模上取得整体最优性能,且模型越大提升越明显——这被归因于更大模型能生成更高质量的负条件。分析表明 NSD 激发模型反思能力,使其在推理过程中出现更多自校正行为。负条件变体研究验证了仅使用问题(question-only)或问题加解答(solution-aware)生成负条件的可行性。效率方面 NSD 不依赖外部监督或特权信息,在标签有限的场景下具有吸引力。

与基线对比解读

与 OPSD 相比,NSD 通过推开自生成的 flawed distribution 而非模仿特权解答,避免了强制模仿高置信度推理轨迹带来的不确定性抑制和探索惩罚。这一差异在复杂推理任务上尤为关键,因为 OPSD 可能严重退化性能。相较于其他无标签自举 RL 基线,NSD 的动态门控机制能够识别并隔离推理关键 token,只对行为缺陷施加梯度更新,从而在提升推理能力的同时保护模型的基础语言能力,避免灾难性遗忘。> “By forcing the student to imitate an artificially confident reasoning trace conditioned on privileged information, OPSD inadvertently suppresses expressions of uncertainty and penalizes the exploratory, self-corrective behaviors required to solve challenging problems.” NSD 从反面学习避开缺陷,是一种更符合推理本质的自我改进范式。

行业影响

落地场景

NSD 适用于需要复杂推理且难以获得高质量标注的 LLM 产品,例如代码助手、数学解题、金融风险分析、医疗辅助诊断。在电商场景中,智能客服经常需要回答组合优惠、退换货规则等需要多步推理的问题,NSD 可以在无 ground truth 的情况下提升模型推理的可靠性,减少错误回答。

商业价值

  • 降本:完全不需要外部监督信号或人工标注,省去昂贵的数据清洗与标注成本。
  • 体验提升:通过避免模型在自蒸馏中变得过度自信、惩罚探索性行为,NSD 保留不确定性表达和自校正能力,显著提升复杂任务上的成功率,降低因模型幻觉或逻辑漏洞导致的用户流失。
  • 增收:在金融、医疗等高风险领域,更可靠的推理模型可支撑高附加值服务,如自动化投研报告、辅助诊断系统。

跟现有产品/工作流的接口

NSD 可作为现有 RLHF/DPO 管线的替代或前期自提升步骤。训练时只需加载模型自身生成的负例条件(如 careless reasoner),并利用动态门控机制识别推理关键 token,对 unlikelihood 损失进行 gated 惩罚,即可插入现有 PyTorch/HF Trainer 训练循环。部署时无需额外推理开销,模型结构不变。

具体 use case:

  1. 教育辅导产品:学生提交数学证明题,模型在无标准答案的情况下自我生成易错推理并规避,提供更严谨的解题步骤。
  2. 企业级数据分析助手:面对复杂 SQL 生成或指标归因,NSD 可减少逻辑跳跃,同时保护基础语言能力,避免退化。

项目链接 提供了完整实现,便于集成。

局限

  • 局限性一:论文实验主要集中在数学推理任务(如 GSM8K、MATH 等),缺乏对代码生成、逻辑推理、多跳问答等更广泛复杂任务的验证,泛化性存疑。NSD 完全脱离 ground truth,依赖模型自身生成负面条件,若初始模型能力较弱,生成的负面行为可能过于简单或与真实错误模式不符,导致优化方向偏差。与 OPSD 利用特权信息相比,NSD 在需要高精度答案的任务上可能缺乏明确监督信号。
  • 局限性二:动态门控机制是 NSD 的核心创新,但其识别“推理关键 token”的准确性未充分验证。门控可能依赖启发式规则或额外训练的分类器,其泛化性和鲁棒性尚不明确。如果门控错误地屏蔽了重要语言 token 或漏掉推理缺陷 token,可能导致训练不稳定或效果下降。论文对门控机制的分析(如 5.1 节)虽有一定探讨,但未在不同错误类型、不同语言或不同模型架构上系统评估其敏感性。
  • 局限性三:与强有监督或强化学习方法对比不足。文中虽比较了 OPSD 和自举 RL baselines,但可能未与基于过程奖励的 RL(如 PRM)或利用更强教师模型蒸馏的方法充分比较。NSD 作为 label-free 方法,在需要精确推理链条的任务上可能不如有监督信号的方法。此外,训练目标中的 KL 正则化与负向似然惩罚的平衡对超参数敏感,实际工程调参成本较高,且可能影响训练稳定性。
论文Rongcan Pei2026-09-10原文

相关内容