论文

推动超越舒适区:面向 RLVR 的高效策略引导探索

推动超越舒适区:面向 RLVR 的高效策略引导探索

现有基于可验证奖励的强化学习(RLVR)通过扩展 rollout 数量来提升大语言模型推理能力,但这种方式计算成本高昂,且对探索过程的控制有限。 为此,本文提出 NudgeRL 框架,通过结构化与多样性驱动的探索来提升 RLVR 效率。核心创新包括:策略推动(Strategy Nudging)——在每次 rollout 中引入轻量级的策略级上下文,以生成多样化的推理轨迹,避免依赖昂贵的 oracle 监督;统一优化目标——将奖励信号分解为上下文间与上下文内两部分,并引入蒸馏目标将探索所得行为迁移回基础策略。 在五个数学基准上的实验表明,NudgeRL 以最高 8 倍更少的 rollout 预算超越了标准 GRPO,并在平均性能上优于基于 oracle 的强化学习基线。结果证明,结构化、上下文驱动的探索可成为暴力 rollout 扩展与基于特权信息的可行性导向方法的有效替代方案。

论文精读

TL;DR NudgeRL 通过策略轻推注入多样化推理,在仅需 1/8 rollout 样本下超越 GRPO,并优于 oracle 基线,实现高效探索。

问题

问题背景

当前,RLVR(Reinforcement Learning with Verifiable Rewards)已成为提升大语言模型推理能力的可扩展范式。它通过可验证的奖励信号驱动策略优化,在数学、代码等有标准答案的任务上效果显著。业界关注点逐渐从“能否优化”转向“如何高效探索”——即如何让模型在巨大的推理空间中,自主发现多样且正确的解题路径。

现有方法局限

主流 RLVR 方法(如 GRPO)依赖暴力增加采样数量(rollout scaling) 来扩展探索范围,但这会带来计算成本线性增长,且重复采样往往浪费在相似轨迹上。另一类做法是通过修改优化目标(如添加熵奖励)来鼓励多样性,但控制力度有限,容易引入噪声。此外,部分工作使用 oracle 信息(如预知正确推理步骤)来指导探索,但这类特权信息在多数现实场景中不可得,泛化性差。这些方法的根本问题在于:没有对“探索什么”进行结构化引导,导致探索效率低下,新行为发现速度慢。

为何困难且重要

RLVR 的探索难点在于,大语言模型的推理空间呈指数级,而正确轨迹像稀疏的孤岛。若无引导,策略极易陷入早熟收敛(只依赖少数已知路径),而暴力探索成本过高。该问题的解决直接关系到 RLVR 能否在有限算力下最大化性能增益,对工业界部署自动化推理系统至关重要。如果能够以更低成本发现更丰富的推理策略,就能加速模型在数学竞赛、程序合成等领域的自我改进闭环。这不仅是算法问题,更是资源效率的瓶颈。

行业类比

这类似于自动驾驶仿真训练:如果只让车辆在简单直线道路上反复行驶(盲目滚动采样),永远学不会复杂路况处理;而若能系统性地注入“天气变化”“突发障碍”等策略上下文(如 NudgeRL 的 Strategy Nudging),无需昂贵真人标注,就能低成本覆盖长尾场景,提升策略鲁棒性。

核心洞察

  • **Strategy Nudging** 用轻量级策略级上下文(strategy-level contexts)引导每次 rollout,在不依赖外部 oracle 或增大采样预算的情况下实现多样性探索。与 brute-force 的 rollout 缩放(如直接增加 GRPO 采样数)相比,这种方法将探索结构化,让模型主动尝试不同的推理模式(如不同的证明策略),而非被动等待稀疏的奖励信号。同时,它区别于使用特权信息(如 oracle 标签)的方法,不引入训练-推理分布偏移,工程代价小,可直接集成到现有 RLVR 流程中。
  • **Inter-Intra Group Advantage 与蒸馏目标的联合优化**将奖励信号拆解为组间(不同策略上下文)和组内(同一上下文内)的相对优势,并引入蒸馏损失将探索中习得的行为迁回基础策略。这解决了两个核心问题:一方面通过组间优势鼓励跨策略探索,避免模式坍塌;另一方面蒸馏确保推理时不再依赖上下文,从而获得的改进得以泛化。与仅依赖组内相对优势的 GRPO 相比,该目标在数学基准上以 8 倍更小的采样量取得更优效果,体现了平衡探索-利用和跨策略迁移的价值。

方法

输入与总体流程

NudgeRL 框架接收一个问题基础策略模型,在 RLVR 训练中通过结构化探索来提升推理能力。与直接扩增 rollout 数量不同,NudgeRL 在每次 rollout 前注入策略级上下文(strategy-level contexts),引导模型生成多样化的推理路径,从而以更低成本覆盖更丰富的解空间。

关键模块设计

Strategy Nudging(策略微调)

该模块是探索多样性的核心驱动。对于每个训练问题,系统首先利用一个轻量提示(无需 oracle 监督)生成一组策略描述(如“尝试归纳法”“枚举边界情况”),这些描述较为抽象,不泄露解题细节。随后,在生成 rollout 时,将每条策略描述拼接到 prompt 前缀,条件化地指导采样,产生策略感知的多样化轨迹。相比完全无引导的随机采样,这种微调能主动跳出模型当前偏好区域,且避免了引入答案信息导致的捷径学习。

Inter-Intra Group Advantage(组间-组内优势分解)

为了从结构化探索中有效学习,奖励信号被分解为两部分:

  • Inter-context advantage:衡量某个策略组相对于其他组的整体表现,促进跨策略的探索-利用平衡。
  • Intra-context advantage:衡量同一策略组内不同 rollout 的相对质量,鼓励组内精细优化。

这种分解使得优化过程既能保留有前景的策略方向,又能在组内区分高奖励轨迹,防止单策略内方差过大影响学习稳定性。

Distillation Objective(蒸馏目标)

策略微调只在训练时存在。为将探索中发现的有效推理模式固化到基础策略中,NudgeRL 加入一个蒸馏项,最小化上下文条件化策略与基础策略在正确轨迹上的输出分布差异。这使得最终模型在推理时无需额外 prefix,即可继承训练时学到的高级思维模式。

输出与差异点

训练输出为一个增强后的基础策略模型,其推理能力在多个数学基准上超越标准 GRPO(即便后者使用多达 8 倍 rollout 预算),同时优于依赖 oracle prefix 的基线方法。核心差异在于:NudgeRL 通过低成本、非特权信息的策略级微调实现结构化探索,并借助组间-组内优势分解与蒸馏将探索收益无损迁移至最终策略,从而提供了一种更高效且可扩展的替代方案,避免了暴力扩充 rollout 或使用 oracle 信息的局限。

实验

实验设计

论文在五个数学推理基准上评估 NudgeRL,与标准 GRPOoracle引导的基线进行对比。GRPO 使用最高 8x 的 rollout 预算。NudgeRL 引入策略轻推(Strategy Nudging),为每个 rollout 提供策略级上下文提示,以低成本诱导多样化的推理路径;训练采用统一的奖励分解(组间与组内优势)和蒸馏目标,将探索所得行为迁移回基础策略。

关键发现

  • 样本效率:NudgeRL 在使用远少于 GRPO 的 rollout 数量(最多节省 8x 预算)的情况下,达到或超越 GRPO 的性能,证明了上下文驱动探索可大幅减少无效采样。
  • 超越 oracle:在五个基准上平均优于依赖特权信息的 oracle 引导方法,说明轻量级策略提示比昂贵的外部监督更有效。
  • 结构化探索机制:奖励分解使模型能平衡不同策略间的探索与利用,蒸馏损失则确保新发现的能力内化到基础策略中,避免灾难性遗忘。

与基线的深度对比

GRPO 虽能通过暴力扩展 rollout 提升推理,但计算代价高且探索不可控;NudgeRL 以策略级上下文实现了可控的多样性,显著降低算力需求,对实际工程更有吸引力。相较 oracle 方法,NudgeRL 不依赖 ground-truth 策略标注,泛化性和可扩展性更强。这一思路为RLVR 的高效探索提供了新的范式:用上下文调节取代大规模重采样,为大规模语言模型推理训练提供了可落地的优化路径。

行业影响

落地场景

NudgeRL 通过 策略轻推(Strategy Nudging)注入轻量级上下文,引导 LLM 在 RLVR 训练中生成多样的推理路径。这直接赋能需要复杂推理的 AI 产品,如 代码生成助手数学辅导系统金融分析报告工具 等。尤其适合资源受限的部署(如中小规模 GPU 集群),能以少至 1/8 的 rollout 达到同等或更优效果,显著降低探索成本。

商业价值

  • 降本:相比 GRPO 的暴力扩展 rollout(计算成本线性增长),NudgeRL 在相同性能下减少 80% 以上的采样开销,节约 GPU 时和能耗。
  • 体验提升:多样化的推理轨迹使模型能生成多角度解答,提升编程助手的问题覆盖度或教育辅导的解释深度,增强用户留存。
  • 增收潜力:更智能的推理能力可成为产品差异化优势,支撑付费版或企业级订阅。

集成接口

NudgeRL 可作为轻量插件嵌入现有 RLVR 流水线:

  1. 定义 策略上下文池(如 逆向推导枚举验证 等);
  2. 在采样阶段,随机选取上下文并 prepend 到 prompt,生成带有策略偏差的 rollout;
  3. 替换 GRPO 目标为 组间-组内优势 与蒸馏损失联合优化,无需修改模型架构。 兼容主流框架(TRL、DeepSpeed-Chat),推理时通过 system prompt 激活特定策略即可。

落地案例

  • AI 编程教育平台:学员提交 Python 习题,NudgeRL 策略模型按 分步调试类比已知算法 等上下文生成多版讲解,平台根据学员历史选择最佳讲解,提高学习完成率。
  • 金融舆情监控:分析财报时,策略上下文如 聚焦现金流异常对比行业均值 引导模型从多维度发现风险,自动生成预警摘要,辅助分析师快速决策。

局限

  • **仅限数学推理任务验证**:实验只在五个数学基准(MATH500、AIME24、AMC23、Minerva、OlympiadBench)上进行,未覆盖代码生成、多跳问答等常见推理场景。工程上若将 NudgeRL 迁移至新领域,需重新设计策略上下文的生成模板,并验证上下文能否有效引导多样化推理,否则可能退化为无引导探索,泛化成本较高。
  • **依赖外部 LLM 生成策略上下文**:Strategy Nudging 借助 GPT-4o 为每个问题生成策略名称与描述,虽离线完成,但实际部署时增加了预处理流水线的复杂度与外部 API 依赖。与 oracle 引导方法(如 POPE)相比,NudgeRL 回避了昂贵标注,但上下文质量受限于生成模型能力,可能出现无效或冗余策略,影响探索效率,且难以应对在线动态变化的任务分布。
  • **超参数较多且敏感**:NudgeRL 引入 λ、β、p_drop 等新超参,实验消融显示其对性能有显著影响,但工作未给出自动调节方案或跨任务稳定性分析。实际投产时,调参成本高,且当任务分布或环境变化后可能需重新搜索,缺乏自适应性。与标准 GRPO 的简单性相比,这套多超参机制增加了工程维护负担,可能阻碍其在快速迭代的 RLVR 流水线中落地。
论文Chanuk Lee2026-05-15原文

相关内容