论文

Distilled Reinforcement Learning 用于 LLM 后训练

Distilled Reinforcement Learning 用于 LLM 后训练

大语言模型(LLM)后训练对提升推理、适应性和对齐至关重要。现有方法主要遵循两种范式:强化学习 (RL) 和 同策略蒸馏 (OPD)。然而,RL 依赖粗粒度的结果监督,导致信用分配困难且获取新知识的能力有限。OPD 通过 KL 散度无条件地匹配教师 logits,造成两难困境:相似的教师提供的新知识很少,而差异较大的教师往往产生无效指导,使 OPD 严重局限于同族蒸馏。 我们提出 Distilled Reinforcement Learning (Distilled RL),将教师监督集成到 RL 目标中,提供细粒度指导,选择性地传递新知识并避免无条件模仿。Distilled RL 包含三个组件:带有裁剪的逆向重要性采样、负样本重置和序列级几何归一化。通过简洁可解释的案例研究,我们证明 Distilled RL 能有效地将教师模型中先前不可用的知识迁移给学生模型。在同族和跨族蒸馏设置上的大量实验表明,Distilled RL 在 pass@1 和 pass@k 指标上均显著优于标准 RL 和 OPD。代码已开源。

论文精读

TL;DR Distilled RL 将教师监督融入强化学习目标,通过精细信号引导选择性知识迁移,解决 RL 难分配功劳与 OPD 盲目模仿的困境,在跨家族蒸馏上显著提升推理性能。

问题

LLM 后训练的核心挑战

当前大语言模型后训练聚焦于提升推理、指令遵循和任务泛化能力,使其从预训练的通用知识中提炼出更可控、更可靠的行为。监督微调(SFT)虽有效,但存在分布偏移和灾难性遗忘风险,因此强化学习(RL)在线蒸馏(OPD) 成为主流范式。

现有方法的技术局限

  • RL 的信用分配困境:标准 RL 仅依赖粗粒度的结果监督(如答案是否正确),难以将奖励信号精确分配到长推理链中的每个关键步骤,导致梯度信号稀疏、高方差,训练效率低且难以习得全新的知识或策略。
  • OPD 的无条件模仿陷阱:OPD 通过 KL 散度强制对齐学生与教师的 token 级概率分布,但存在两难:若教师模型与学生相似,知识增量极小;若教师差异显著,其 logits 通常包含噪声或不适配学生的表达,盲目匹配反而干扰学习。这使得 OPD 几乎被限制在同家族蒸馏内,无法利用异构模型的知识。

为什么这既难又重要

该问题的技术难点在于如何精细地解耦教师信号:既要传递教师具备而学生缺失的推理模式或事实知识,又要避免压制学生自身的探索优势。同时,跨模型家族的知识迁移具有极高产业价值——例如将巨型闭源模型的能力压缩到开源小模型,或融合多个专家各异的教师。但异构模型间的表示空间差异巨大,直接对齐风险极高,需要一种在“借鉴”与“自主”之间动态平衡的机制,这是当前 RLHF 和蒸馏研究的焦点难题。

行业类比:如同资深工程师指导新人调试复杂系统,高级指导不是只给最终评判(RL),也不是让新人逐行复制代码(OPD),而是在关键决策点给出解释和修正建议,同时允许新人保留自己的实现风格。

核心洞察

  • Distilled RL 将教师监督以细粒度奖励的形式注入 RL 目标,核心在于逆向重要性采样与截断、负样本重置和序列级几何归一化。这打破了标准 RL 仅依赖粗粒度结果信号的局限,也避免了 OPD 无条件匹配 logits 的弊端——相近教师无新知,差异大教师则引导无效。该方法可选择性迁移知识,突破模型族内蒸馏约束,为跨模型族知识迁移提供了灵活且高效的新范式。
  • 序列级几何归一化针对在线 RL 训练中不同序列奖励幅度差异大的问题,通过归一化稳定梯度更新,防止高方差序列主导训练。在消融实验中,该组件对性能提升贡献显著。配合可解释案例清晰展示教师知识(如关键 token 概率)向学生的转移,为实际跨模型族知识蒸馏提供了可验证、可调试的工程路径,对分布式训练和 RL 调参具有直接参考价值。

方法

方法概述

Distilled RL 将教师模型的细粒度监督信号无缝融入在线策略 RL 框架,核心目标是在保留探索能力的同时,解决标准 RL 的粗粒度信用分配与 OPD 的无条件模仿问题。整个流程遵循“学生策略采样 → 教师评分/加权 → 多组件梯度修正 → 策略更新”的闭环。

关键组件

  1. 反向重要性采样与裁剪(Reverse Importance Sampling with Clipping)

    • 不以传统方式直接从教师分布采样,而是在策略梯度中引入重要性权重,用教师概率与学生概率的比值调整每个 token 的更新方向。
    • 对极端比值进行裁剪,避免剧烈策略偏移,仅当教师能提供置信且有效的指导时才增大该步的梯度贡献。
  2. 负样本重置(Negative Sample Reset)

    • 将当前策略生成的低质量轨迹(奖励较低或导致无效输出)标记为“负样本”。
    • 这类样本不参与常规的策略提升,其更新方向被重置或大幅衰减,防止模型从错误行为中学习,并维持对教师有益信号的敏感性。
  3. 序列级几何归一化(Sequence-level Geometric Normalization)

    • 对每条生成序列的整体梯度进行几何平均归一化,替代简单的按 token 求和。
    • 有效平衡不同长度序列的贡献,避免短序列因 token 少而受忽略,或长序列因累积误差被过度惩罚。

训练动态

与 OPD 快速收敛但后续几乎停滞不同,Distilled RL 在初期可能收益平缓,但由于选择性吸收新知识,后期能持续突破,尤其在跨家族蒸馏场景中,即使教师与学生结构差异大,仍可稳定传递有效知识。

与同类方法的核心差异:标准 RL 仅依赖结果奖励;OPD 无条件匹配教师 logits,易引入噪声。Distilled RL 通过重要性裁剪与负样本重置,实现了条件化的教师知识迁移——只在教师信息可靠且有助于改善当前策略时才采纳,从而兼顾探索效率与泛化能力。

实验

实验设计

论文在数学推理代码生成等多项 benchmark 上进行评估,涵盖 同族蒸馏(相同基础模型架构)与 跨族蒸馏(不同系列 LLM 间知识迁移)两种核心设定。基线包括标准 RL(如 PPO)与 On-Policy Distillation(OPD,通过 KL 散度拟合教师 logits)。主要指标采用 pass@1pass@k,衡量生成正确解答的准确率与覆盖度。消融实验逐一验证了 负样本重置序列级几何归一化 与反向重要性采样裁剪等组件的独立贡献。

关键发现

Distilled RL 在所有设定下均显著超越 RL 与 OPD,尤其在跨族蒸馏中表现出强大的知识迁移能力——即使教师模型原本不具备某类解题策略,学生也能通过 Distilled RL 有效习得。训练动态显示:OPD 虽然收敛迅速,但缺乏持续提升;而 Distilled RL 在保持训练稳定的同时,最终性能明显更优。增大 rollout 数量对 OPD 的增益有限,但 Distilled RL 能更高效地利用采样数据。

对比解读

标准 RL 依赖粗粒度结果监督,导致信用分配困难,难以注入细粒度新知识;OPD 则无条件模仿教师,当教师与学生差异大时指导无效,差异小时信息量不足,形成转移困境。Distilled RL 通过将教师信号融入 RL 目标,以 反向重要性采样 选择性吸收有效知识、负样本重置 避免错误累积、序列级几何归一化 平衡长短序列梯度,实现了细粒度、可解释的知识迁移。这套组合突破了传统蒸馏的固有矛盾,为 LLM 后训练阶段高效融合外部知识提供了更通用的范式。

行业影响

落地场景

Distilled RL 主要适用于两类工业产品:(1) 大模型蒸馏为小模型的 API 服务降本场景,如对话机器人、代码助手、内容生成平台;(2) 跨架构或跨领域知识迁移,例如将通用大模型的推理能力注入医疗、金融等垂直领域的专用模型。在需要快速后训练、持续适应新数据的业务中(如电商推荐对话、教育个性化辅导),该方法通过细粒度教师信号可有效避免传统 RL 的奖励稀疏和 OPD 的无条件模仿问题。

商业价值

  • 降本:用更小的学生模型达到接近教师模型的性能,大幅降低推理成本(如 GPU 资源、API 调用费)。
  • 提效:相比标准 RL 和 OPD,Distilled RL 的训练收敛更快,pass@k 指标显著提升,缩短模型迭代周期,加快产品上市速度。
  • 体验提升:模型能更好地吸收教师模型中的新知识(如复杂推理、长程对话策略),减少错误输出,提升用户满意度和业务转化率。

与现有工作流的接口

该方法基于 on-policy RL 框架,可直接集成到现有 RLHF/PPO 训练栈中,如使用 DeepSpeed ChattrlRay 等。流程上可先进行 SFT,再用 Distilled RL 做后训练。代码已开源(GitHub 仓库),提供 reverse importance samplingnegative sample resetsequence-level geometric normalization 三个模块,可与主流推理引擎(如 vLLM)配合,在在线采样中降低通信开销。

具体落地案例

  1. 电商平台智能客服:将超大参数量的对话模型蒸馏为低延迟的轻量模型,部署在商品咨询和售后场景,既保证回答质量,又能应对高并发流量,节省 70% 以上的推理成本。
  2. 跨语言知识迁移:将英文数学推理大模型的能力迁移到小参数量的多语言模型中,用于教育辅导产品的答案解释,避免传统 OPD 在跨语言时因 teacher-student 差异过大而失效的问题。

局限

  • **对 teacher 模型的依赖性强**:Distilled RL 需要 teacher 模型提供细粒度 logits 监督,当 teacher 与 student 架构或训练数据差异过大时,teacher 知识可能不适用甚至给出误导性信号,导致训练不稳定或效果下降。论文虽然在跨家族蒸馏上做了实验,但并未讨论当 teacher 质量不高或不可获取时的方法 fallback 策略,这在实际工程中可能成为瓶颈。
  • **超参数与训练复杂度较高**:方法包含三个组件(reverse importance sampling clipping、negative sample reset、sequence-level geometric normalization),每个组件都引入了至少一个敏感超参数(如 clipping 阈值、reset 触发条件、归一化温度等),论文未给出调参自动化方案。在资源有限的迭代场景下,调参成本可能抵消其性能收益,限制了即插即用的易用性。
  • **任务覆盖面较窄**:实验主要在数学推理(如 GSM8K、MATH)和代码生成等有明确 ground-truth 的任务上验证,缺乏对开放式对话、安全对齐或长文本理解等任务的实验。Dis- tilled RL 依赖 rollout 级奖励信号,当奖励稀疏或难以定义时(如创造性写作),方法有效性仍有待检验。
论文Chen Wang2026-07-19原文

相关内容