弱到强泛化 via Direct On-Policy Distillation
强化学习结合可验证奖励(RLVR)是提升语言模型推理能力的有效方法,但每训练一个新的大模型都需要生成大量轨迹(rollouts),成本高昂。随着模型规模增长,后训练本身成为瓶颈。 本文提出一种弱到强的替代方案:先在小模型上运行RL(代价更低),然后将其学到的知识转移到大模型。直接蒸馏RL后的弱教师模型效果不佳,因为教师最终策略混合了RL收益与小模型的局限。为此,我们提出Direct On-Policy Distillation(Direct-OPD),转移教师模型由RL引起的策略偏移。该方法比较RL后的教师与其RL前的参考模型,将两者对数概率比(log-ratio)作为密集的隐式奖励信号,用于学生模型。简言之,检查点对揭示了RL使弱模型更倾向于或更规避哪些动作,而Direct-OPD将此信号应用于强学生模型的在线策略状态(on-policy states),从而直接重用弱模型的RL监督信号,无需在目标模型上运行稀疏奖励的RL。 实验表明,Direct-OPD能持续利用弱教师改进强模型。例如,在8张A100 GPU上仅用4小时,便将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至58.3%。该方法优于按步匹配的直接RL,并支持多个策略偏移的顺序组合。我们的结果表明,RL结果可以作为隐式奖励信号跨模型规模重用,而不仅仅是作为最终模型来模仿。
论文精读
TL;DR Direct-OPD 将弱模型 RL 前后的策略变化转化为隐式奖励,直接蒸馏给强模型,无需在目标模型上重复昂贵 RL 训练,仅 4 小时将 Qwen3-1.7B 的 AIME 2024 成绩从 48.3% 提升至 58.3%.
问题
近年来,强化学习结合可验证奖励 (RLVR) 已成为提升大语言模型复杂推理能力的关键技术,在 MATH、AIME 等基准上不断刷新记录。然而,该方法依赖于在目标模型上大量生成 rollout 并进行策略优化,每训练一个新模型都需重复这一昂贵过程。
现有方法局限:传统的知识蒸馏或策略迁移通常将弱模型(教师)的最终输出分布作为监督信号,直接应用于强模型(学生)。这样虽能传递部分能力,但教师模型的最终策略本质上是一个混合体:既包含 RL 带来的有效改进,也固化了弱模型自身的表征偏差和容量限制。直接模仿会将这些偏差一同注入学生,导致性能提升幅度远低于重新执行 RL 的上限。此外,标准 RLVR 使用稀疏奖励(仅在完整输出后给出评分),训练信号密度低,加剧了大规模模型训练的波动和低效。
为什么这个问题重要:随着模型参数规模从数十亿向数千亿增长,后训练的计算开销已成为实际落地的瓶颈。在 8 张 A100 GPU 上对 1.7B 模型进行 RL 训练尚需数小时,对 70B 级别模型将变成资源黑洞。若能将弱模型上低成本获得的 RL 改进信号抽象为“隐性奖励”,直接迁移到强模型,则可避开在强模型上运行稀疏奖励 RL 的沉重负担。这不但能大幅降低算力成本,还实现了 RL 成果的跨规模复用,使 RL 训练从“一次性消耗品”变为可组合、可叠加的训练资产,对业界追求高效后训练、快速模型迭代具有重大意义。
行业类比:好比在 自动驾驶感知系统 中,先用小型网络在仿真环境进行强化学习探索驾驶策略,然后将策略偏移(何时加速、减速、变道)编码为稠密隐式奖励,用于引导大型端到端模型的训练,从而避免在完整模型上进行全量风险尝试与高额仿真交互开销。
核心洞察
- 直接蒸馏 RL 后的教师策略会同时继承小模型的固有限制;Direct-OPD 转而提取“RL 引起的策略偏移”——通过比较教师 RL 前后模型在相同状态下的动作 log-ratio,将其作为密集隐式奖励信号传递给更强的学生模型。这一信号仅编码了 RL 所累积的行为偏好变化,剥离了教师基础能力的约束,使强模型能在自身 on-policy 状态上接收有效监督,从而避免传统蒸馏中教师上限成为学生瓶颈的问题。
- Direct-OPD 将稀疏的验证奖励 RL 问题转化为基于密集隐式奖励的监督学习,摆脱了对目标模型生成大量 rollout 和奖励标注的依赖。实验表明,在 8 张 A100 上仅用 4 小时,即可将 Qwen3-1.7B 在 AIME 2024 上的准确率从 48.3% 提升至 58.3%,且优于步数匹配的直接 RL 基线。这种训练范式大幅降低了后训练的计算成本,使 RL 对齐信号能跨模型规模高效复用。
- 多个独立的策略偏移可以顺序组合,累积不同阶段的 RL 提升。这种可组合性意味着一次弱模型的 RL 实验产物(政策偏移)可以被多次用于不断增强不同规模的目标模型,甚至叠加来自不同 teacher 的偏移,为 RL 成果的跨模型、跨任务复用提供了新范式,而不仅仅是得到一个可供模仿的最终模型。
方法
方法流程
输入:
- 一个已完成 RLVR 训练的弱教师模型及其训练前的检查点(pre-RL reference)。
- 一个待提升的强学生模型。
- 推理任务提示数据。
关键模块:Direct On-Policy Distillation (Direct-OPD)
Direct-OPD 不直接蒸馏教师的后 RL 策略,而是蒸馏策略偏移(policy shift)——即教师模型在 RL 训练前后对每个动作的偏好变化。
- 学生在线采样:学生模型根据提示生成完整的推理序列(on-policy rollout)。
- 计算隐式奖励:对于学生序列中的每个 token,分别用教师模型的 pre-RL 和 post-RL 检查点计算对数概率,取差值
log π_post - log π_pre。该 log-ratio 作为密集、逐 token 的隐式奖励信号,指示 RL 使该动作变得更可取或更不可取。 - 蒸馏目标:以隐式奖励为权重,最大化学生模型在自身生成序列上的加权对数似然,等价于在序列级别使用该奖励进行策略优化。训练中通过自适应 KL 散度控制约束学生相对于其初始策略的偏离幅度,防止奖励信号不可靠时过拟合。
输出
一个经过 Direct-OPD 蒸馏的学生模型,在推理任务上显著提升。例如,在 AIME 2024 基准上,仅用 8 张 A100 GPU 训练 4 小时,Qwen3-1.7B 的准确率从 48.3% 提升至 58.3%。
与同类方法的差异
不同于传统的 on-policy 蒸馏直接模仿教师输出,Direct-OPD 传递的是教师策略的改进方向(即 RL 带来的相对变化),使强学生能复用弱模型的探索成果,而不受其能力上限的制约。
实验
实验设计
Direct-OPD 首先在一个小模型(弱教师)上运行完整的 RLVR 训练流程,得到两个检查点:
- pre-RL 参考模型(RL 前的策略)
- post-RL 教师模型(RL 后的策略)
实验将这两个检查点的对数概率差作为隐式稠密奖励,直接用于优化一个更大的目标学生模型。训练时,学生模型在其自身在线生成的状态(on-policy states)上,根据教师模型对同一状态的行为变化概率调整策略。
评估基准是 AIME 2024(数学竞赛题集),对比基线包括:
- 直接监督微调教师输出(SFT-distill)
- 等效训练步数的直接 RL(step-matched direct RL)
关键发现
- 高效迁移:仅用 8 张 A100 GPU 训练 4 小时,Qwen3-1.7B 在 AIME 2024 上的准确率从 48.3% 提升至 58.3%(+10.0%)。
- 策略偏移优于模型复制:直接蒸馏教师最终模型无法剥离小模型固有的局限性;Direct-OPD 通过提取 RL 诱导的行为变化,传递了更纯粹的推理能力提升。
- 超越在线 RL:在同等训练步数下,Direct-OPD 显著优于直接在目标模型上运行 RL,证明重用预计算的政策偏移比重新采样更高效。
- 支持顺序组合:可将多个教师模型(例如不同 RL 阶段或不同奖励函数)的政策偏移依次应用于同一学生,实现模块化能力叠加。
基线对比深度解读
常规的弱到强蒸馏(即用弱模型输出微调强模型)会迫使强模型模仿弱模型的所有行为,包括其固有的错误模式。Direct-OPD 的创新在于解耦了“RL 带来的有益变化”与“弱模型自身能力”,仅传递前者。
与 step-matched direct RL 相比,Direct-OPD 避免了目标模型在 RL 训练中需要不断生成采样导致的大量计算开销,而是利用教师已归纳好的行为偏好作为奖励信号,既稳定又经济。这一结果表明,RL 的结果可以被提取并封装为可跨规模重用的隐式奖励,而非仅作为最终产物去模仿,为大规模模型的持续改进提供了新的工程范式。
行业影响
落地场景
Direct-OPD 将小模型通过 RL 训练得到的策略偏移 (policy shift) 作为隐式奖励,用于指导大模型的行为,适用于所有需要 RLVR(Reinforcement Learning with Verifiable Rewards) 提升推理能力的场景,且计算资源有限。
- 代码生成助手: 在代码执行反馈下,用小模型做 RL 探索,再将学到的编程偏好迁移到超大尺寸代码模型,低成本提升复杂任务(如算法竞赛题)的解决率。
- 数学与科学推理应用: 利用低成本小模型在数学验证环境下 RL 迭代,再将推理风格迁移到更强的基础模型,适用于在线题库、教育辅助等产品。
- 企业级知识库问答: 先用小模型在结构化数据(如知识图谱)上 RL 优化逻辑推理路径,再迁移到产品模型中,避免高并发场景下大模型 RL 的成本爆炸。
商业价值
核心价值在于 大幅降低大模型后训练成本 与 加速迭代周期。
- 降本: 将 RL 采样阶段的算力消耗从大模型转移到小模型,例如原论文在 8 张 A100 GPU 上 4 小时内将 Qwen3-1.7B 的 AIME 2024 准确率从 48.3% 提升至 58.3%,若直接对大模型做 RL 则需数倍至数十倍的 GPU 小时。
- 增收/体验提升: 可在不改变最终模型架构的前提下,通过重复利用已训练的
teacher checkpoint对 (pre-RL与post-RL),快速为多个产品线注入领域推理能力,缩短从研发到上线的周期。 - 顺序组合策略: 支持将多个小模型在不同任务上获得的
policy shift按序组合,形成叠加增益,提升通用模型的多面能力,增加产品差异化。
与现有工作流集成
Direct-OPD 可作为现有 RLVR 流水线中的 蒸馏替代步骤 或 补充阶段,无缝对接当前主流训练栈。
- 训练流程集成: 在常见的
SFT → RLVR → 蒸馏管线中,用 Direct-OPD 替换最后阶段的传统蒸馏,只需要存储小模型的pre-RL和post-RL权重,无需改动大模型结构或生成新的稠密奖励函数。 - 与参数高效微调 (PEFT) 协同: 大模型可配合 LoRA 等轻量适配器进行训练,Direct-OPD 的
log-ratio隐式奖励本质上是 token 级梯度信号,可直接用于更新适配器权重,进一步降低显存需求。 - 现有工具兼容: 依赖标准的
verifiable reward环境(如代码执行器、数学验证器),与主流 RL 框架(如 TRL, OpenRLHF)输出的checkpoint格式完全兼容,团队无需重建基础设施。
具体应用案例: 某全球电商平台计划升级其商品搜索问答功能,需要模型具备复杂条件推理(如“推荐适合户外运动且重量低于 2kg 的帐篷”)。直接用超大模型做 RL 会占用数千 GPU 小时。该团队可先用 0.5B 参数小模型在模拟购物决策环境(可验证奖励)下 RL 训练,获得 pre/post-RL checkpoint 对,然后通过 Direct-OPD 将推理偏好迁移到 7B 的生产模型上,仅需少量额外训练即达到同等推理性能,成本节省 70% 以上。另一场景为在线编程教育平台:用小模型通过代码执行反馈 RL 学习编程纠错策略,再迁移到强模型,提供智能代码审查服务,提升学生提交代码的反馈质量,同时避免实时调用超大模型的延迟与成本。
局限
- **依赖高质量RL teacher与paired checkpoints**:Direct-OPD 要求已有经过RLVR训练的弱模型(教师)及其自身的预RL参考点。若小模型的RL结果欠佳(例如奖励稀疏或训练不稳定),其产生的策略偏移(policy shift)可能包含噪声,直接作为隐式奖励信号会误导强模型,导致训练失败或性能退化。这本质上仍消费了一次完整的RL pipeline,并未完全消除对RL的依赖。
- **实验领域单一,泛化性待验证**:当前验证集中在数学推理任务(AIME 2024),虽然在Qwen3系列模型上有显著提升,但方法在其他典型推理场景(如代码生成、多轮对话、复杂指令跟随)上的有效性未得到评估。特别是面对分布外数据或任务时,teacher-shift奖励是否仍能提供有意义的学习信号,仍需进一步探索。
- **自适应KL控制对超参数敏感**:方法引入Adaptive KL Control来约束student与teacher-shift奖励之间的偏离,其效果依赖于目标KL散度的设定和 teacher-shift reward 的绝对值大小。在实际部署中,不同尺寸模型(如1.7B teacher对7B student)或不同任务可能需要差异化设置,自动调节机制的鲁棒性尚未在更广泛setting中验证,这增加了工程落地时的调参成本。