论文

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

在线策略蒸馏(OPD)通过让学生在自生成输出上训练来提升大语言模型推理能力,但标准 OPD 对所有学生生成输出(SGO)一视同仁,忽略了它们的信息价值。我们通过控制过滤实验观察到一致的不对称性:在 OPD 和在线策略自蒸馏(OPSD)中,仅用错误 SGO 训练优于仅用正确 SGO 训练。进一步分析表明,仅在正确 SGO 上训练的模型倾向于生成更短的推理链,且反思行为较弱;而错误 SGO 能更好地保留接近模型能力边界的探索性推理。 为利用这一信号而无需完整答案展开,我们提出 ReNIO,它重加权负轨迹重要性。ReNIO 利用学生与教师概率比识别导致错误推理的关键 token,并将其信息聚合为归一化样本权重,从而在无需观察最终答案正确性的情况下,自然地赋予可能的负轨迹更大权重。由于 ReNIO 仅使用前缀条件 token 概率,它保留了 OPD 相对于完整展开强化学习的前缀训练优势。 在数学推理和代码生成任务上,ReNIO 显著改进了 OPD 和 OPSD,例如在数学推理基准上,对 Qwen3-1.7B 和 R1-Distill-Qwen-7B 分别取得了高达 8.90% 和 10.00% 的相对性能提升。代码仓库:https://github.com/BDML-lab/ReNIO。

论文精读

TL;DR 发现仅用错误样本训练优于仅用正确样本,ReNIO 据此用 student-to-teacher 概率比为推理错误轨迹加权,在不依赖完整 rollout 的情况下提升 LLM 策略蒸馏,数学与代码推理分别最高提升 10.00% 和 8.90%。

问题

问题背景

在提升大语言模型推理能力的方法中,on‑policy distillation (OPD) 通过让学生模型在自身生成轨迹上模仿教师分布,获得显著收益。这类方法避免了纯离线蒸馏的分布偏移,但现有技术默认平等对待所有学生生成输出 (SGOs),忽略了轨迹信息量的差异。

现有方法局限

标准 OPD 把正确与错误 SGOs 混在一起训练,不加区分。然而,受控过滤实验暴露出一个关键不对称性:只训练错误 SGOs 的效果反优于只训练正确 SGOs。进一步分析表明,仅用正确 SGOs 会促使模型产生更短的推理链和更弱的自我反思行为,而错误 SGOs 保留了模型当前能力边界附近的探索性推理。这意味着,错误轨迹中包含对提升推理能力更关键的信号,但标准 OPD 无法识别并放大这种信号。若依赖答案正确性来区分 SGOs,又需要完整的 rollout,丧失 OPD 仅依赖前缀即可训练的优势。

为什么这个问题难 / 重要

难点在于 如何不依赖最终答案正确性的情况下,预先识别出可能错误的轨迹,并在 token 级别量化其重要性。这需要一种前瞻性信号,既与错误发生率相关,又能在仅看到前缀时计算。同时,该信号必须聚合为样本级权重,以保证训练稳定,不能引入昂贵的外部评估。业界对高效 on-policy 蒸馏的需求日益迫切,因为相比全 rollout 强化学习,前缀蒸馏的计算开销更低、迭代更快,若能挖掘错误轨迹的信息价值,将在数学推理、代码生成等任务上获得更大增益。

行业类比

这一挑战类似于强化学习中的 优先级经验回放 (prioritized experience replay):需要一种内在的重要性度量,将高信息量的训练样本赋予更大权重。但在 OPD 场景下,没有外部奖励信号,只能从师生分布差异中构造权重,类似用预测熵或 TD-error 作为优先级。

核心洞察

  • 在 on-policy 知识蒸馏中,学生模型生成的错误轨迹(negative trajectories)远比正确轨迹更有训练价值,因为它们保留了模型能力边界附近的探索性推理与自我反思行为,而仅用正确样本会缩短推理链、削弱深层推理能力。这一发现挑战了传统蒸馏默认所有样本等权或更重视正确样本的做法,为利用“失败经验”提升推理性能提供了实证依据。
  • ReNIO 通过学生-教师模型在 token 级别的概率比自动识别导致错误路径的关键 token,并基于这些 token 的概率比几何平均构造样本权重,从而在不依赖最终答案标签、仅使用前缀条件概率的情况下,为潜在错误轨迹分配更高权重。该方法避免了强化学习中依赖完整 rollout 的高方差问题,保留了 on-policy 前缀训练的高效性,同时显著提升了数学推理与代码生成任务的性能(最高相对提升 10%)。

方法

ReNIO 方法详解

输入:学生模型按在线策略生成的推理轨迹 (SGOs),以及教师模型提供的 token 级目标分布。无需最终答案的正确性标签。

关键模块

  1. Token 级重要性信号
    对轨迹中每个位置,计算学生与教师的概率比对数 log(P_student / P_teacher)。该比值天然反映学生偏离教师预期的程度——高比值区域通常对应错误推理萌芽。

  2. 长尾关键 Token 选择
    由于 log ratio 呈长尾分布,仅保留对数比最大的一小部分 token (Top-K),滤除噪声并聚焦于最有信息量的位置。

  3. 从关键 Token 到样本权重

    • 对选出的关键 token 的 log ratios 做 几何平均,聚合为一条轨迹的“不稳定性”分数。
    • 在 mini-batch 内进行 归一化,使权重总和与 batch size 相关,避免尺度漂移。
      这样得到的权重 天然倾向于错误轨迹,因为错误路径的学生概率通常显著低于教师概率,导致较高的 log ratio。整个过程无需观察最终答案,仅依赖前缀条件概率,保留了 OPD 的前缀训练优势。
  4. 加权在线策略蒸馏目标
    将归一化权重乘到每条轨迹的标准序列蒸馏损失上,得到加权目标:
    Loss = Σ_i w_i * KL(teacher(·|prefix_i) || student(·|prefix_i))。 高权重的轨迹被重点学习,迫使学生在容易出错的决策点上模仿教师。

输出:更新后的学生模型,在维持探索能力的同时提升推理正确率。

与同类方法的差异点:ReNIO 仅依赖 token 级概率比,完全无需完整 rollout 或答案标注,相比需要最终奖励信号的 RL 方法 (如 PPO/GRPO) 或基于答案正确性的过滤方法,更简洁且保留了 OPD 前缀训练的在线特性。

实验

实验设计

  • 基础框架:在标准 OPD(学生蒸馏教师)与 OPSD(学生自蒸馏)两种范式下,对 Qwen3-1.7B 和 R1-Distill-Qwen-7B 两个规模的学生模型进行验证。
  • 任务与数据:涵盖数学推理(如 GSM8K、MATH 等)与代码生成(如 HumanEval、MBPP 等)两类场景。
  • 对照实验:先通过受控过滤实验,对比“仅训练正确 SGO” vs “仅训练错误 SGO”的效果差异,揭示错误轨迹信息量更高的现象。
  • 评估方式:以生成准确率(或 pass@1)为主要指标,比较 ReNIO 加权策略相对均匀权重的提升幅度。

关键发现

  • 不对称训练效果:无论 OPD 还是 OPSD,只训练模型自己生成的错误输出,其表现反而明显优于只训练正确输出,这与常规直觉相反。
  • 轨迹长度与行为差异:仅用正确 SGO 训练会使模型产生更短推理链、弱反思行为;而错误 SGO 则保留了更多探索性推理,更贴近模型能力边界。
  • 权重自动分配:ReNIO 通过计算学生-教师概率比,在 token 级别识别导致推理错误的关键决策点,无需观察到最终答案正确性即可生成归一化样本权重,自然对“可能错误”的轨迹赋予更大权重。
  • 性能增益:在数学推理基准上,ReNIO 为 OPD/OPSD 带来最高 8.90%(Qwen3-1.7B)和 10.00%(R1-Distill-Qwen-7B)的相对提升;代码生成任务也观察到一致改善。

与基线的深度对比

  • 相比于均匀加权的 OPD,ReNIO 的核心优势在于信息优先级重排:它将训练资源集中于模型当前最易出错的路径,避免了大量无关正确轨迹稀释梯度信号。
  • 与需要完整 rollout 并依赖答案正确性的强化学习(如 PPO/GRPO)相比,ReNIO 仅需前缀条件概率,保留了 OPD 的 prefix training 效率优势,无需等待序列完成即可进行加权训练,在数学推理等需长链探索的任务中训练开销更低。
  • 该方法不同于传统 On-policy 蒸馏中人工过滤正确/错误样本的二值策略,连续权重能更细腻地反映轨迹中局部片段的信息密度,从而更稳定地提升学生模型的探索与反思能力。

行业影响

落地场景

  • 对话式 AI 与智能客服:需复杂推理(如多步计算、逻辑推导)的场景,可通过 ReNIO 蒸馏得到更可靠的学生模型,提升长难问题的一次解决率。
  • 代码生成工具(如 Copilot、CodeWhisperer 等):在代码修复、算法实现等任务中,利用 ReNIO 对错误轨迹的重加权,可增强模型对易错点的感知,生成更正确的代码。
  • 教育辅导与自适应学习:数学推理、证明类题目解答,模型需展示逐步思考过程。ReNIO 保留的探索性推理能提供更自然的解释,而非捷径式简短回答。

商业价值

  • 降低标注与数据成本ReNIO 不依赖最终答案标签,只需前缀条件概率,避免了昂贵的人工标注或完整 rollout 筛选,适合自监督训练流程,显著减少数据准备开销。
  • 提升模型在边界能力上的表现:通过强调错误轨迹中的关键 token,模型在自身能力边界的探索性推理得以保留,最终准确率提升(论文显示达 8.90%–10.00% 相对增益),直接优化关键业务指标(如代码通过率、问题解决率)。
  • 高效训练与快速迭代:与标准 OPD 几乎无额外计算开销,兼容现有硬件与框架,模型团队能以较低成本持续提升推理性能。

与现有产品 / 工作流的接口

集成方式极简,可作为现有 on-policy 蒸馏管线(如 DeepSeek-R1 的蒸馏流水线)的即插即用模块:

  1. 在现有 OPDOPSD 训练循环中,前向传播时记录学生与教师对同一前缀的 token 概率。
  2. ReNIO 提出的学生-教师概率比计算 token 重要性,选出关键 token 并聚合为样本权重。
  3. 将权重乘入原有 SFT 损失(例如交叉熵)进行加权训练。

该过程不需要修改模型结构或训练器,完全兼容 PyTorch / Transformers 生态。

具体用例

  • 代码助手(如 GitHub Copilot):当用户给出自然语言需求时,模型需生成包含多步逻辑的代码。使用 ReNIO 蒸馏后的模型,能在易出错的边界情况(如索引偏移、递归终止条件)上更鲁棒,减少生成错误代码的次数,提升开发者采纳率。
  • 医疗问答辅助系统:对症状推理和用药建议需严格逻辑链,模型通过 ReNIO 保留的探索性推理有助于避免捷径学习导致的危险简化,使模型在回答罕见病或复杂病例时更谨慎,间接提升合规性与安全性。

局限

  • **对教师模型依赖性强**:ReNIO 的性能高度依赖教师模型提供的概率分布质量。若教师模型本身在特定领域推理能力不足,或采用不确定的采样策略,`student-to-teacher ratio` 信号可能失效。论文使用 Qwen2.5-7B 系列较强教师模型,但在更弱或跨架构教师上的效果未知,限制了其在低成本蒸馏场景的普适性。
  • **仅验证数学与代码任务,泛化性待考**:实验局限于 GSM8K、MATH、MBPP 等具客观对错的任务。在开放域对话、创意写作等无明确正确轨迹的任务中,ReNIO 隐含的“错误路径高概率比”假设可能不成立。即使不依赖最终答案,其加权机制仍偏向特定模式的负向轨迹,迁移到其他任务需额外适配验证。
  • **计算开销与在线效率未充分分析**:虽然 ReNIO 只需前缀 token 概率,但每次生成后需对每个 token 计算师生分布概率比并筛选长尾 token,增加了训练时的计算开销。论文未给出 wall-clock 时间对比,实际大规模在线迭代中,该开销可能显著拖慢训练。此外,批量归一化依赖 batch 内样本分布,小批量下权重估计可能不稳定。
论文Chen Lin2026-06-22原文

相关内容