论文

On-policy Distillation with Verifiable Reward

On-policy Distillation with Verifiable Reward

RLVR 与 OPD 已成为大语言模型后训练的两大主流范式。RLVR 面临稀疏的任务级反馈,而 OPD 提供密集的 token 级指导,但忽略轨迹正确性,性能受限于教师模型。将二者结合是有前景的方向:OPD 提供密集监督信号,RLVR 提供任务级正确性。然而,现有集成方法通常依赖加权组合或启发式切换,引入额外超参数和权衡。 我们提出 OPDVR(On-policy Distillation with Verifiable Reward),一种简洁有效的方法,无缝结合 OPD 与 RLVR,无需任何额外超参数。首先基于轨迹正确性重新表述采样 token OPD 的隐式奖励,然后应用 ReLU 门控机制 确保正确轨迹获得非负奖励,错误轨迹获得非正奖励,从而使蒸馏信号与任务成功对齐,同时保留教师的分布引导。此外,我们的修改将采样 token OPD 转化为真正的 RLVR 方法,使其可与任意策略梯度算法(如 GRPO)直接结合。 在六个推理基准上的实验表明,OPDVR 一致优于标准 OPD。代码已开源:https://github.com/LeapLabTHU/OPDVR。

论文精读

TL;DR OPDVR 通过 ReLU 门控将轨迹正确性注入 on-policy 蒸馏的隐式奖励,使 OPD 与 RLVR 无缝融合且不增加任何超参数,在多个推理基准上稳定超越标准 OPD。

问题

问题背景

当前 LLM 后训练主要依赖 RLVR 与 on-policy distillation (OPD)。RLVR 用可验证奖励提供任务级正确性信号,OPD 用教师模型提供 token 级密集监督。

现有方法局限

  • RLVR 仅返回稀疏的任务级奖惩,样本效率低,对长推理轨迹优化困难。
  • OPD 虽然逐 token 对齐教师分布,但完全忽略轨迹最终是否正确,导致学生模型上限被限制在教师水平,无法通过任务奖励突破。
  • 已有整合方案多采用加权组合或启发式切换,引入额外超参数(如平衡系数、切换阈值),且两种信号可能冲突,需要人工权衡。

为什么这个问题难且重要

核心挑战在于不引入新超参数的前提下,将 token 级蒸馏梯度与任务级验证奖励对齐:既要保留教师分布中的有效探索先验,又要让错误轨迹获得负反馈、正确轨迹获得正反馈。由于推理任务通常长程依赖、奖励稀疏,单纯 RLVR 很难稳定优化;单纯 OPD 又无法超越教师。业界对无需调参、可即插即用的后训练方法关注度高,因为能降低训练成本并提升稳定性。

行业类比

类似数学题的逐步求解辅助:既需要每一步推导的提示(密集信号),又需要最终答案对错的判定(稀疏奖励),若两者冲突,最好自动门控屏蔽错误步骤的指导,而不是由工程师手工调整权重。

核心洞察

  • OPDVR 的核心在于将 on-policy distillation 重新表述为具有可验证奖励的强化学习问题,通过对隐式奖励施加 ReLU gating 实现条件掩码,无需引入任何额外超参数。以往结合 OPD 与 RLVR 的方案多依赖加权组合或启发式切换,增加调参负担且难以平衡;OPDVR 直接修正奖励信号本身,使正确轨迹获得非负奖励、错误轨迹获得非正奖励,从而在保留教师 token 级分布指导的同时注入任务级正确性。这种最小侵入的融合机制为两类方法提供了无缝桥接。
  • 从 RLVR 视角重新审视 sampled-token OPD,发现其隐式奖励天然携带轨迹正确性信息,但标准 OPD 未显式利用。OPDVR 通过重新表述将其转化为 proper RLVR 方法,可直接对接任意策略梯度算法(如 GRPO)。理论分析进一步表明,OPDVR 的梯度方向与可验证奖励梯度一致,且在 token 级可以严格超越教师性能上限,而标准 OPD 受限于教师。这解释了其在六个推理基准上一致优于标准 OPD 的根本原因,而不仅是经验性改进。

方法

方法概述:OPDVR 将 on-policy distillation(OPD)与可验证奖励(RLVR)统一在同一个策略梯度框架内,无需额外超参数。

输入:on-policy 采样的推理轨迹,包含 prompt、模型生成的 token 序列、teacher 对每个 token 的蒸馏信号,以及任务源提供的二进制可验证奖励(轨迹正确/错误)。

关键模块

  1. 隐式奖励重表述:把 sampled-token OPD 中每个 token 的隐式奖励重新定义为与轨迹正确性关联的形式。具体地,正确轨迹的 token 获得非负奖励,错误轨迹的 token 获得非正奖励。
  2. ReLU 门控机制:在隐式奖励上应用 ReLU 门控,确保奖励符号完全由 trajectory 正确性决定,从而让蒸馏信号与最终任务成功对齐,同时仍保留 teacher 的 token 级分布指导。
  3. 策略梯度兼容:该改造使 sampled-token OPD 成为标准的 RLVR 方法,可直接嵌入 GRPO 等 policy gradient 算法,消除加权组合或启发式切换带来的调参负担。
  4. Group Relative Policy Distillation (GRPD):进一步在组内按相对优势进行蒸馏,提升多样性与稳定性。

输出:更新后的策略模型,在六个推理基准上一致优于标准 OPD。

与同类方法的差异:传统 OPD 与 RLVR 的结合依赖加权系数或规则切换,OPDVR 仅通过 ReLU 门控将正确性信号注入蒸馏过程,不引入任何新超参数。

实验

实验设计

论文在 六个推理基准 上评估了 OPDVR 与标准 OPD 的性能对比。虽然摘要未列出具体数据集名称,但实验章节包含主实验、Group Relative Policy Distillation、反向门控消融和训练动态分析。主要验证 OPDVR 通过 ReLU 门控 将蒸馏信号与轨迹正确性对齐,无需引入额外超参数。

关键发现

作者报告 OPDVR 在六个推理基准上 一致优于标准 OPD,且无需新增超参数。

这表明基于轨迹正确性的隐式奖励重构与 ReLU 门控 机制有效。OPDVR 将 sampled-token OPD 转化为合适的 RLVR 方法,可与策略梯度算法(如 GRPO)无缝结合。

与基线对比解读

标准 OPD 提供 稠密 token 级监督 但忽略轨迹正确性,性能上限受制于教师。OPDVR 在保留教师分布引导的同时,用 ReLU 门控 区分正确/错误轨迹的奖励符号,从而在策略优化中同时利用稠密信号和任务级正确性。实验显示这一改动在六个基准上带来稳定提升,且不增加调参成本。

行业影响

落地场景

OPDVR 适用于需要可验证奖励的推理密集型任务,例如数学解题助手、代码生成与调试、逻辑推理问答、金融分析报告生成等。这些场景中,模型输出可通过规则验证器(如单元测试、数学答案比对)自动判断正确性,天然适合 RLVR 训练。OPDVR 将教师蒸馏的密集 token 级信号与验证器提供的轨迹级正确性信号融合,可显著提升模型在长思维链任务上的准确率,尤其适合对推理可靠性要求高的企业级应用。

实际用例:- 一家在线教育平台部署的数学辅导 AI,需要用可验证答案对学生逐步解题过程打分。使用 OPDVR 后,模型不仅能给出正确答案,还能生成更连贯的推理步骤,减少“蒙对但过程错误”的情况。

  • 一个代码生成 SaaS 工具(类 Copilot)在用户环境中执行单元测试作为验证器,OPDVR 使模型在生成代码时更关注逻辑正确性,降低用户手动调试成本。

商业价值

  • 降本:OPDVR 无需额外超参数调优,减少了从 OPD 切换到 RLVR 的工程试错成本;同时通过融合教师信号,可能降低对大规模人工标注或高质量偏好数据的需求。
  • 增收/体验提升:在推理准确率上的稳定提升(论文中在六个基准上超越标准 OPD)直接带来产品核心指标的改善,如解题成功率、代码一次通过率,从而增强用户粘性与付费意愿。
  • 风险控制:ReLU 门控机制确保错误轨迹得到非正奖励,抑制模型生成高置信度但错误答案,降低金融、医疗等高风险场景的误导风险。

与现有产品/工作流的接口

OPDVR 可作为 策略梯度算法(如 GRPO)的一个即插即用奖励塑造模块,无需修改整体训练框架。

  • 现有 RLHF/RLVR 流水线中,只需替换掉原有奖励计算部分,将教师模型的对数概率差经过 ReLU 门控后作为逐 token 奖励,其余数据加载、采样、模型更新流程保持不变。
  • 在 开源训练栈(如 Hugging Face TRL、DeepSpeed)中集成简单,代码已开源(GitHub),可直接复用。
  • 对于已有蒸馏+验证器组合的团队,可将原先的加权求和或启发式切换逻辑替换为 OPDVR 的隐式奖励重参数化,消除额外超参数,简化生产配置管理。

局限

  • **对教师模型的依赖**:OPDVR 本质上仍是一种蒸馏方法,其性能上限受限于教师模型的质量。如果教师模型在推理任务上的能力不足,或者教师策略与目标任务的分布不匹配,ReLU 门控只能修正轨迹级别的正负奖励,无法超越教师的知识边界。论文中的改进证明了可以在教师基础上进一步提升,但没有讨论教师本身较弱时方法是否仍然有效。
  • **实验覆盖范围有限**:实验在六个推理基准上验证了 OPDVR 的有效性,但这些基准主要集中在数学或逻辑推理领域,缺少对开放式生成、多轮对话、代码生成等更广泛任务的评估。此外,论文未展示在更大规模模型(如 70B+)上的表现,也未与除标准 OPD 以外的其他 OPD 变体(如 KL 约束的 OPD)进行充分对比,泛化性有待进一步验证。
  • **ReLU 门控机制的简单性可能限制灵活性**:虽然 ReLU 门控避免了额外超参数,但其硬阈值特性(正确轨迹非负、错误轨迹非正)在某些情况下可能过于刚性。例如,对于部分正确的轨迹或奖励稀疏的任务,这种二值化处理可能丢失中间信息。论文没有探讨平滑门控或自适应门控的替代方案,因此在复杂奖励环境下,该机制可能不是最优选择。
论文Wenze Lin2026-08-25原文

相关内容