论文

MInTRL: Off-policy 干预可以提升 On-policy RL

MInTRL: Off-policy 干预可以提升 On-policy RL

可验证奖励的强化学习 通常在 on-policy 设定下进行,训练数据贴近当前策略,但学习范围被限制在策略自身能够探索到的轨迹内。相比之下,off-policy 方法(如 supervised fine-tuning)能够利用超出基座模型能力的外部知识,却可能面临较大的 distribution shift。因此核心挑战在于:在不牺牲可学习性的前提下扩大探索范围。 为此,本文提出 Minimal Intervention Reinforcement Learning(MInTRL),通过在原本 on-policy 的 rollout 中进行稀疏、局部的干预来扩展探索前沿。具体做法是: - 生成阶段:由一个 judge-intervention policy 周期性地审查当前策略的输出,将错误的后缀替换为简短修正,随后立即把控制权交还给策略; - 训练阶段:采用 sequence-level advantage-regression 目标,从而无需 importance sampling。 作者表明,稀疏的局部干预能在保持轨迹整体 on-policy 性质的同时,显著提升覆盖范围,超越有限预算的 on-policy 采样。在数学与代码基准上,MInTRL 持续优于标准的 on-policy 与 off-policy 基线。消融实验显示,MInTRL 在自我干预以及不同 judge policy 下均保持有效,且性能在中等干预强度时达到峰值,凸显了「最小干预」的重要性。这些结果确立了最小干预作为增强 on-policy RL 的有效范式。

论文精读

TL;DR MInTRL 在 on-policy rollout 中引入稀疏、局部 judge 干预,用序列级优势回归训练,在数学与代码基准上稳定超越标准 on-policy 与 off-policy 基线。

问题

问题背景

当前具备可验证奖励的 LLM 推理训练(数学、代码等任务)主要采用 on-policy RL(如 GRPO),目标是让训练数据贴近当前策略分布,以稳定优势估计与策略更新。

现有方法局限

  • On-policy RL 受限于策略自身的探索边界:在有限采样预算下,模型很难覆盖高奖励但低概率的轨迹,容易陷入局部最优,无法利用外部知识或纠正已知错误模式。
  • Off-policy SFT / 蒸馏 可以引入更强模型的数据,但直接混合大规模 off-policy 样本会导致严重分布偏移,降低优势估计可靠性,甚至损害策略性能。
  • 现有折中方案如 MENTOR 虽然引入干预,但干预过于频繁,或依赖额外的重要性采样(importance sampling),影响训练效率与稳定性。

为什么难且重要

核心难点在于 coverage–learnability trade-off:扩大探索覆盖度时,偏差和方差会上升,需要设计一种既能注入外部信息、又保持轨迹整体 on-policy 性质的机制。MInTRL 通过稀疏局部干预和序列级 advantage-regression objective 消除了重要性采样需求,在数学与代码基准上同时超越标准 on-policy 和 off-policy 基线。消融实验显示中等干预强度最优,证明 minimal intervention 是可工程落地的方向。

行业类比

类似于自动驾驶中的 human-in-the-loop takeover:只在关键错误片段短暂接管并修正,随后立即交还控制权,既扩展了安全探索边界,又不破坏整体策略学习分布。

核心洞察

  • MInTRL 的核心思想是在 on-policy rollout 中引入稀疏、局部的干预,以扩展探索范围而不牺牲轨迹的整体 on-policy 性质。与 off-policy 监督微调相比,干预只替换错误后缀、保留大部分原始生成,从而避免大分布偏移;与纯 on-policy 采样相比,干预注入了策略自身难以发现的外部知识,提高了覆盖。这解决了 RLVR 中探索与可学习性的根本权衡。
  • MInTRL 采用序列级 advantage-regression 目标,完全避免重要性采样。由于干预令牌是局部的,传统 off-policy 方法需要重要性采样来校正训练分布与行为分布的不匹配,但 MInTRL 通过回归目标直接利用序列级优势,使得学习不再受限于重要性比率的方差问题,训练更稳定且实现更简单。
  • 实验表明干预强度存在最优区间,最小干预原则对性能至关重要。当干预过于频繁或过于稀少时,性能下降;中等强度达到峰值。这提示在实际部署中需要平衡外部知识注入与策略自主探索,为超参数选择提供了实用指导,并验证了方法命名的合理性。

方法

方法概述

MInTRL 的输入包括当前策略模型、一个 judge–intervention 策略(可以是外部模型或 self-intervention)、以及带可验证奖励的任务。核心流程分为采样与训练两个阶段。

采样阶段:半 on-policy 轨迹生成

  • 当前策略生成 rollout,judge–intervention 策略周期性地评估输出后缀。
  • 一旦检测到错误,立即用短修正片段替换错误后缀,随后控制权交还当前策略继续生成。
  • 这种稀疏、局部干预让轨迹大部分由当前策略产生,但能突破其探索局限。

训练阶段:序列级优势回归

  • 对收集到的轨迹,使用 序列级优势(sequence-level advantage)作为回归目标,直接优化策略,无需重要性采样。
  • 实际实现包括四个关键设计:
    1. Step-level intervention localization:定位到错误步骤,最小化干预范围。
    2. Control-based advantage estimation:利用控制变量减少方差。
    3. Relaxed anchor for intervention tokens:对修正片段施加宽松的监督信号,避免过度约束。
    4. Early stopping:防止过度训练。

输出为更新后的策略,其探索覆盖范围显著高于有限预算的 on-policy 采样,同时保持轨迹的整体 on-policy 性质。

与同类方法的差异点:MInTRL 通过最小干预桥接 on-policy 与 off-policy,既利用外部知识扩展探索,又避免了重要性采样带来的高方差与分布偏移问题。

实验

实验设计

在数学与代码基准上对比 MInTRL、标准 on-policy RL(如 GRPO)与 off-policy SFT 基线,考察 rollout 覆盖度、训练动态与最终性能。

关键发现

  • 稀疏局部干预显著提升有限采样预算下的探索覆盖,同时保持轨迹整体 on-policy 特性。
  • 序列级 advantage-regression 消除了重要性采样需求,训练稳定。
  • 训练过程中模型对外部干预的依赖逐步降低,推理行为发生可观测变化。
  • 消融显示自干预、不同 judge 策略均有效,性能在中等干预强度达到峰值,证明“最小干预”合理。

与基线对比

相比纯 on-policy 方法,MInTRL 突破策略自身发现能力的上限;相比 off-policy SFT,避免了大规模分布偏移导致的可学习性损失。其优势来自在错误后缀处插入短纠正后立即交还控制权,使轨迹既包含外部知识又贴近当前策略,为 RLVR 提供了一种新的探索扩展范式。

行业影响

落地场景

MInTRL 适用于具备可验证奖励的推理任务,如数学解题、代码生成、SQL 生成、形式化证明等。具体用例:

  • 在线教育平台:数学/编程题自动解答与分步提示。当前模型可能无法独立探索出正确路径,MInTRL 通过稀疏局部干预扩展探索前沿,训练出覆盖更强推理策略的模型,提升题目解答覆盖率与正确率。
  • 企业级代码助手:在生成代码或单元测试时,部署轻量 judge-intervention policy 对错误后缀进行短修正,立即将控制权交还主策略,提高代码通过率,同时保持轨迹接近 on-policy 分布,降低灾难性遗忘风险。

商业价值

  • 降本:减少对大规模人工标注或昂贵教师模型的持续蒸馏需求;干预是稀疏短修正,推理增量成本可控。
  • 增收/体验提升:在数学与代码 benchmark 上稳定超越标准 on-policy 与 off-policy 基线,直接改善产品核心指标(如解题正确率、代码通过率),提升用户留存与付费转化。
  • 训练效率:采用 sequence-level advantage-regression 目标,无需 importance sampling,训练更稳定,缩短实验迭代周期,降低 GPU 消耗。

与现有产品/工作流的接口

  • 在现有 RLVR 训练栈(如 verl、OpenRLHF、TRL)中替换 rollout 采样器:新增 judge-intervention policy 作为外部组件,在生成过程中按周期审查并注入短修正后返回控制权;该 judge 可以是同一 base model(self-intervention)或轻量模型。
  • 训练目标从 PPO/GRPO 改为 sequence-level advantage regression,无需维护 critic 或 importance ratio,实现与调试成本低。
  • 可作为 on-policy 数据增强步骤,与现有离线数据蒸馏/重放流程结合,对已部署推理服务进行持续策略改进。

局限

  • 依赖外部 judge-intervention 模型的质量与可靠性。MInTRL 在 rollout 过程中依赖 judge 策略给出纠正,若 judge 本身存在偏差或错误,会引入噪声或错误示范,影响学习稳定性。论文虽验证了不同 judge 策略下的鲁棒性,但并未深入分析 judge 策略与训练策略之间的分布不匹配,以及 judge 错误对最终策略性能的长期影响。实际部署中,高质量领域 judge 模型可能不易获取或成本高昂,限制了方法在资源受限场景的适用性。
  • 计算开销与推理效率问题。MInTRL 在生成阶段需要 judge-intervention 策略周期性地对当前输出进行审查和修正,增加了推理成本。虽然论文附录包含效率分析,但相对于标准 GRPO 或其他 on-policy 方法,额外 judge 推理步骤可能导致训练时间显著延长,特别是在大规模模型和长序列场景。论文未提供在真实分布式训练环境下的端到端时间开销对比,也未讨论如何优化 judge 的调用频率以平衡探索增益与计算成本。
  • 实验范围限于数学和代码推理任务,泛化性未充分验证。MInTRL 的核心假设是稀疏局部干预能扩展探索而不引入明显分布偏移,这一假设在结构清晰、奖励可验证的任务中成立,但在更开放或奖励稀疏的领域(如对话、创意写作)是否仍然有效尚未可知。此外,论文只比较了有限的基线方法,缺乏与最新 RLVR 方法的全面对比,例如不同优势估计或离策略校正技术组合下的表现,这限制了结论的普适性。
论文Mingyu Chen2026-09-11原文

相关内容