论文

H^2SD: 混合事后自蒸馏

H^2SD: 混合事后自蒸馏

基于可验证奖励的强化学习(RLVR)显著提升了大型语言模型在数学推理和代码生成等任务上的推理能力。然而,大多数RLVR方法为整个轨迹分配标量结果奖励,导致监督稀疏且令牌级信用分配有限。同策略蒸馏(OPD) 通过从更强的教师模型蒸馏令牌级分布来提供更密集的监督,但需要额外的教师且通常假设共享词汇表。同策略自蒸馏(OPSD) 通过将同一模型基于特权信息构建教师策略来消除这一依赖,但直接匹配教师分布可能导致信息泄露和优化不稳定。RLSD 避免直接匹配,仅用教师信号调节更新幅度,但在采样推理失败时无法提供显式修正方向。为解决这一权衡,我们提出 H^2SD,一种混合事后自蒸馏框架,根据轨迹正确性不同地使用教师: - 对于成功轨迹,教师接收被证实正确的学生响应及改写指令,其原始响应令牌上的概率用于调节更新幅度,而不改变奖励确定的方向。 - 对于失败轨迹,教师基于包含关键推理步骤和已验证答案的参考提示进行条件化,并最小化学生到教师的 反向KL散度。 在多个具有挑战性的推理基准上的实验表明,H^2SD 持续优于代表性的 RLVR、OPSD 和 RLSD 基线,同时保持稳定的优化和良好的生成效率。

论文精读

TL;DR H²SD 在 RLVR 中混合后见之明自蒸馏:成功轨迹用重述调控更新幅度,失败轨迹用提示提供校正方向,无需外部教师,实现稠密、稳定的优化。

问题

问题背景

在可验证奖励的强化学习(RLVR)范式下,大语言模型的推理能力(数学、代码生成)已取得显著提升,但主流方法仅对整个生成轨迹给出标量结果奖励,导致令牌级信用分配(token-level credit assignment)严重不足。

现有方法局限

  • On-policy distillation (OPD):从更强的教师模型蒸馏令牌分布,能提供稠密监督,但必须额外引入教师模型,且通常要求教师与学生共享词表,限制模型选择。
  • On-policy self-distillation (OPSD):通过给同一模型输入特权信息(如正确答案)构造“教师策略”,免去外部模型,然而直接匹配教师分布会带来信息泄漏(特权信息直接泄漏到训练数据)和优化不稳定。
  • RLSD:仅用教师信号调节更新幅度,避免直接匹配,但当采样推理失败时,无法提供明确的修正方向,导致错误轨迹无法有效利用。

为什么这个问题难/重要

RLVR 场景下,成功的轨迹只需增强已有正确行为,失败的轨迹则需要明确知道“哪里错、怎么改”,二者对教师信号的需求截然不同。现有方法要么过度依赖外部模型,要么在失败时缺乏纠偏信号,要么因直接匹配分布而面临优化不稳定。如何在不引入外部模型的前提下,利用模型自身能力(后见之明)为不同质量的轨迹提供差异化、稳定的令牌级反馈,是提升推理 RL 效率和上限的关键瓶颈。该方向直接影响数学、代码等复杂推理任务的训练效率和最终性能,业界高度关注。

行业类比

类似在自动驾驶训练中,算法对安全通过的场景只做正向微调,但对危险操作不仅惩罚,还由同一模型“回想”安全示范来显式纠偏——让模型从自己的 hindsight 中学得更精准。

核心洞察

  • H^2SD 通过**轨迹正确性感知的混合自蒸馏**区分成功与失败轨迹:对正确轨迹,教师利用重写指令仅调节更新幅度而不改变策略梯度方向,避免信息泄漏;对失败轨迹,教师基于参考提示提供显式纠正信号,通过最小化反向 KL 散度引导学生分布修正。这解决了 OPSD 因无差别拟合教师分布导致的 unstable optimization,以及 RLSD 在失败时无法提供 explicit correction direction 的固有问题,在稳定性和纠错能力间取得平衡。
  • **事后提示(Hindsight Hint)** 设计是 H^2SD 的核心创新之一:当采样得到错误轨迹时,向模型提供包含关键推理步骤和校验答案的提示,以此构造特权教师,再通过反向 KL 蒸馏强制学生从失败中学习纠正策略。该机制仅在失败时引入特权信息,避免了 OPSD 将正确轨迹信息全局暴露导致的信息泄漏,同时赋予模型从错误中恢复的能力,比直接行为克隆更安全且更符合强化学习探索-利用的范式。

方法

输入与整体流程

H²SD 以强化学习 with 可验证奖励(RLVR)为基础,通常基于 GRPO 等在线策略优化算法。每次迭代中,学生模型(策略)针对一批问题采样生成多条推理轨迹,并由环境返回二元结果奖励(正确/失败)。根据奖励信号,轨迹被分流至两个不同的教师蒸馏分支。

核心混合蒸馏模块

1. 成功轨迹:重述调制(Rephrasing-based Modulation)

  • 将学生的正确响应与一个重述指令(如“请用不同措辞复述此答案”)拼接,作为教师输入。教师由同一模型构成,但条件于已确认正确的答案,从而得到在原始响应 token 上的平滑概率分布。
  • 该分布不直接作为蒸馏目标,而是用于缩放策略梯度更新幅度:在标准 RL 梯度方向上,用教师分布对每个 token 的 log 概率差加权,使高置信 token 更新更保守,低置信 token 更新更激进,而不改变梯度方向。这避免了直接匹配分布可能引入的信息泄露。

2. 失败轨迹:提示引导蒸馏(Hint-guided Distillation)

  • 构建一个参考提示,包含关键推理步骤和已验证的答案,作为教师的额外条件。教师基于此提示生成 token 级概率。
  • 最小化学生分布到教师分布的逆向 KL 散度,迫使学生在错误路径上向正确的推理分布靠拢,提供显式的修正方向。此分支弥补了 RLSD 等仅调制幅度而缺乏方向引导的缺陷。

输出与优化

两分支的损失加权求和:成功分支用调制后的策略梯度损失;失败分支用逆向 KL 损失。最终更新学生模型参数。推理阶段使用原始学生,无需额外教师或提示,保持生成效率。

与同类方法的关键差异

H²SD 根据轨迹正确性选择性使用教师:成功时不改变 RL 方向仅调幅度(继承 RLSD 的稳定性),失败时提供显式方向(弥补 RLSD 的不足),且全程通过自蒸馏避免额外教师模型,在 OPSD 的直接匹配与 RLSD 的纯幅度调制之间取得折中。

实验

实验设计

本研究在多个数学推理(如 MATH、GSM8K)与代码生成(如 HumanEval、MBPP)基准上评估 H^2SD,对比基线包括GRPO(标准 RLVR)、OPSD(On-Policy Self-Distillation)以及RLSD(Reward-Weighted Self-Distillation)。实验统一使用相同的基础模型与提示策略,重点考察正确/失败轨迹采用不同蒸馏策略带来的影响。消融实验进一步分析了提示设计、重述指令及结果条件路由的作用。

关键发现

  • 性能提升:H^2SD 在所有基准上均超越 RLVR 基线,相较 OPSD 和 RLSD 亦有稳定提升,尤其在需要长链推理的任务上优势明显。
  • 优化稳定性:成功轨迹的幅度调制避免直接匹配导致的信息泄漏;失败轨迹的逆 KL 散度校正提供显式方向,使训练曲线比 OPSD 更平滑,收敛更快。
  • 生成效率:方法无需额外教师模型,推理时仅需标准采样,与 Base 模型开销相当,优于依赖大教师蒸馏的方案。

基线对比解读

  • vs. RLVR:纯结果奖励信号稀疏,H^2SD 通过混合自蒸馏注入 token 级监督,显著改善信用分配与样本效率。
  • vs. OPSD:OPSD 直接匹配条件教师分布可能泄漏正确答案信息,导致训练不稳定;H^2SD 在成功轨迹仅用教师信号调整更新幅度,避免分布崩塌。
  • vs. RLSD:RLSD 缺乏对失败轨迹的显式纠正方向,H^2SD 利用提示提供的参考推理步骤进行针对性调整,加速从错误中恢复。

行业影响

落地场景

H^2SD 特别适合需要高精度推理的生成式 AI 产品,如代码助手(生成与调试代码)、数学解题引擎技术客服机器人以及科学计算工具。这些场景依赖可验证的最终答案(unittest 通过与否、数值正确性),正是 RLVR 发挥优势的地方。例如,一个云平台提供自动代码修复功能时,使用 H^2SD 能让模型在遇到错误轨迹时获得明确的纠正信号,从而更快收敛到正确解法。

商业价值

该方法通过稳定训练过程提高样本效率直接降低算力成本:成功轨迹只做幅度调制而不改变方向,失败轨迹则利用构建的参考提示(hints)提供强纠正,避免了 OPSD 的分布泄漏和不稳定问题,也克服了 RLSD 在失败时就无力纠正的缺陷。对产品而言,这意味着更少的训练步数更高的最终准确率,从而减少 GPU 消耗,加快模型迭代。用户体验上,输出质量提升将直接转化为客户留存与付费意愿。

与现有产品/工作流的接口

H^2SD 可以无缝插入到已有的 RLVR 训练流水线中,只需要在原有 GRPO 或类似算法的基础上,增加一个"轨迹路由"模块:根据奖励信号判断成败,然后分别调用两种 teacher 前向过程计算 KL 惩罚或调制权重。它不需要额外的教师模型(与 OPD 区分),也不要求共享词表,因此对现有部署几乎无侵入。对于使用 vLLM 或 TRL 等框架的团队,只需在损失计算环节增加一个条件分支即可集成。

典型应用

  1. 教育科技公司的 AI 数学导师:学生在提交问题后,系统自动生成分步解答。H^2SD 训练的模型能在推理错误时被显式引导至正确步骤,从而减少输出离谱答案的几率,提升可信度。
  2. 企业级低代码平台的内置逻辑生成:用户输入自然语言业务规则,平台自动生成 SQL 或脚本。通过可执行验证奖励,H^2SD 能在生成失败时利用参考提示修复逻辑,提高生成通过率,降低人工质检成本。

局限

  • **训练效率瓶颈**:H²SD 对每条轨迹需额外前向传播——成功轨迹需带 rephrasing 指令重喂模型以获取调制概率,失败轨迹需利用参考提示(hint)构建教师分布。这使单步训练成本接近原始 RLVR 的 2 倍,且在长序列推理任务中,对成功轨迹仅用于幅度调制的计算投入可能边际收益有限,大规模训练时资源消耗成为实际部署的瓶颈。
  • **参考提示(hint)的质量依赖**:对于失败轨迹,方法通过最小化学生与基于 hint 的教师之间的反向 KL 散度来提供校正方向。hint 需包含关键推理步骤与验证答案,其质量直接影响学习信号的准确性。若自动生成的 hint 不够完备或引入偏差,可能导致次优的 token 级监督,尤其当验证器仅提供二元标签时,构造高质量 hint 本身是一个非平凡子问题。
  • **局限于可验证奖励任务**:H²SD 继承 RLVR 的根本假设——奖励信号必须客观可验证(如数学题答案、代码执行结果)。在创意写作、开放域对话等缺乏自动化验证器的场景,方法难以直接迁移。即便通过人工或模型打分生成奖励,不完美的奖励可能破坏成功/失败轨迹的划分,进而使混合蒸馏策略失效,限制了方法的普适范围。
论文Qiye Cai2026-07-21原文

相关内容