Rationale-Guided Policy Optimization:学习以自适应 rationale 脚手架进行推理
问题背景:on-policy 强化学习已成为提升大语言模型推理能力的核心范式,但其效果常受 奖励稀疏 制约——当模型无法为困难问题探索出正确轨迹时,优化过程几乎得不到有效信号,训练可能停滞。已有方法借助 off-policy 示范、专家轨迹或模型生成解答来缓解,但通常要求辅助数据与强化学习任务格式一致,往往依赖从更强模型做拒绝采样才能获得合适的训练轨迹。 方法:我们提出 Rationale-Guided Policy Optimization(RGPO),一个按模型当前能力自适应利用 ground-truth rationale 信息、同时保留其探索自由的框架。RGPO 不把参考解答当作固定的模仿目标,而是将其用作 临时脚手架:rationale 先帮助模型生成更优回复,随后仅把其中 奖励更高、由模型自身生成 的解答迁移回原本无引导的训练设置。这一设计让训练得以利用可得的 ground-truth 信息,而无需 off-policy 数据遵循与 RL 任务相同的格式。 实验:在纯语言与视觉语言推理两类设置中,RGPO 均持续优于 RLVR 基线;消融实验显示,自适应 rationale 引导 是性能增益的关键来源。 结论:这些结果表明,RGPO 为降低奖励稀疏、稳定强化学习,并提升纯文本与多模态模型的推理表现,提供了一种实用且通用的方案。
论文精读
TL;DR RGPO 用 ground-truth rationale 作自适应脚手架引导模型生成更优解,只回传高奖励自生成样本做无引导训练,缓解奖励稀疏且无需离线数据格式匹配,在文本/多模态推理中稳定优于 RLVR。
问题
问题背景:当前推理增强聚焦于 on-policy RL,典型如 RLVR 已成为提升 LLM 推理能力的主流范式,其核心挑战是在稀疏奖励下维持有效探索。
现有方法局限:奖励稀疏性导致模型面对困难问题时难以发现正确轨迹,优化信号匮乏,训练容易停滞。现有缓解方案引入 off-policy 演示、专家轨迹或模型生成解,但普遍要求辅助数据与 RL 任务格式严格匹配,通常需从更强模型做 rejection sampling 获取合适轨迹,无法直接利用已有的 ground-truth rationale(自然语言解释)。这一格式约束限制了数据来源,也增加了工程复杂度。
为什么难/重要:难点在于如何在保持模型自由探索的同时,自适应注入 ground-truth 信息,既缓解稀疏奖励又不破坏 on-policy 学习性质。该问题在纯文本和视觉语言推理任务中普遍存在,是限制 RLVR 规模化应用的关键瓶颈。若能解决,将大幅提升强化学习训练稳定性和推理性能,对多模态模型同样实用。
行业类比:类似自动驾驶中利用专家示范引导策略学习,但需避免过度依赖示范而丧失自主探索能力。
核心洞察
- RGPO 将 ground-truth rationale 作为自适应脚手架而非固定的模仿目标,根据模型当前能力动态介入,保持探索自由度。与现有依赖 rejection sampling 或格式匹配 off-policy 数据的方法不同,RGPO 允许 rationale 用于生成改进的响应,但只将高奖励的模型生成解迁移回原始无引导设置,从而在不要求辅助数据格式一致的前提下利用 ground-truth 信息。
- RGPO 的核心贡献在于从引导到无引导的迁移机制:先用 rationale 帮助模型逃离稀疏奖励的困境,再将高奖励样本用于无引导策略优化。这区别于直接把 rationale 当作训练标签或强制模型模仿,它使得最终策略始终在原始任务分布上优化,避免了对 rationale 格式的依赖,同时显著缓解了困难问题上的奖励稀疏问题。
方法
输入与目标
RGPO 接收推理任务 prompt x、可选的 ground-truth rationale r*(或专家提示),以及当前策略 πθ。目标是缓解奖励稀疏:在困难问题上,模型难以采样到正确轨迹,导致梯度信号缺失。
关键模块:自适应 rationale 引导 rollout
- 能力评估:在每个训练步,先用 unguided rollout 估计当前策略在任务上的成功率,作为引入辅助的依据。
- 引导生成:对成功率较低的 prompt,将 rationale 作为临时脚手架拼接到输入,引导模型生成更可能获得高奖励的响应
y_guided。 - 样本筛选与转移:仅保留奖励高于 unguided 基线或达到阈值的
y_guided,并将这些高质量模型生成解转移到原始 prompt 下,作为策略优化的训练数据(x, y_guided)。 - 策略优化:在原始 prompt 上应用 RLVR(如 PPO / GRPO)更新策略,优势估计基于 unguided 条件下的表现,确保模型最终学会不依赖 rationale 也能推理。
设计动机与输出
rationale 不作为固定模仿目标,而是临时脚手架:只在探索困难时介入,训练数据始终是模型自身生成的结果,避免格式不匹配和分布偏移。随着训练推进,模型能力提升,可自适应降低 rationale 使用频率,实现逐步退出。
与同类方法的差异
与 rejection sampling from stronger models 或固定演示学习不同,RGPO 不要求 off-policy 数据遵循相同格式,且 rationale 仅用于引导生成,优化目标始终保持在原始 prompt 上,因此更稳定、更通用。
实验
实验设计
RGPO 在 受控仿真环境、语言推理基准 与 视觉语言推理基准 三类设置下验证。基线包括 on-policy RLVR、off-policy 监督与引导探索方法;消融实验对比固定 rationale 引导、无引导与自适应引导。
关键发现
- 在语言与多模态推理任务上,RGPO 相比 RLVR 基线取得一致提升,但具体数值在摘要中未给出。
- 自适应 rationale 引导 是关键贡献:模型仅在自身探索失败时才引入 ground-truth rationale 作为临时 scaffold,之后仅将高奖励模型生成解迁移回原始无引导设置。
- 该方法降低 reward sparsity,帮助困难问题上获得有效学习信号,避免优化停滞。
与基线对比解读
不同于需要 off-policy 数据严格匹配 RL 格式的拒绝采样方案,RGPO 不要求参考解与任务格式一致。它利用 rationale 作为可丢弃的脚手架,而非固定模仿目标,因此能在保留探索自由度的同时利用 ground-truth 信息。这一设计更通用,适合文本与多模态模型。
行业影响
落地场景
RGPO 适合需要多步推理和复杂任务求解的 AI 产品,尤其当正确轨迹稀缺导致 on-policy RL 停滞时。典型应用包括:
- 编程助手:代码生成与调试中,模型需逐步推导算法逻辑,RGPO 用参考解析引导探索,解决难题成功率提高。
- 多模态推理:视觉问答、文档理解等结合图像与文本的多跳推理任务,RGPO 对视觉语言模型同样有效。
- 企业知识助手:处理合同条款、政策规则等需要逻辑推演的场景。
商业价值
- 降本:减少对高质量离策略示范数据的依赖。RGPO 允许参考 rationale 与 RL 任务格式不同,可直接使用现成的解析、注释或规则说明,无需用强模型拒绝采样生成同格式轨迹,节省算力与标注成本。
- 提效与体验:缓解 reward sparsity,训练更稳定,模型在困难问题上的成功率提升,直接改善用户满意度与产品竞争力。
- 对 AI 基础设施商,RGPO 可作为训练框架插件,帮助客户快速提升模型推理能力。
与现有工作流接口
- 在现有 RLVR(基于可验证奖励)流程中,RGPO 可替换 rollout 阶段:对低奖励或失败的 prompt,注入 ground-truth rationale 作为前缀或提示,引导模型生成改进响应;筛选高奖励的自生成解后,切换回原始无引导设置继续优化。
- 集成要求:训练数据需包含每个 question 对应的 rationale(如答案解析、中间步骤),这类信息在题库、代码注释、客服知识库中普遍存在,或可由 LLM 低成本生成。
- 与 TRL、OpenRLHF 等训练库兼容,可作为自定义 reward 或策略循环的改动。
具体 use case:
- 电商智能客服处理复杂售后规则(优惠叠加、退款条件),需要多步推理。RGPO 注入规则解释作为临时引导,模型生成解决方案后,仅保留经规则引擎验证的高奖励回答用于后续训练,逐步脱离引导,最终实现自主推理。
- 企业数据分析助手将自然语言查询转化为 SQL 或分析报告,涉及多表 join 和聚合逻辑。RGPO 用查询对应的逻辑步骤作为 rationale 引导,显著提升复杂查询生成准确率。
局限
- **依赖 ground-truth rationale 的可获取性与质量**。RGPO 的核心假设是训练集中存在高质量 reasoning rationale,但在许多真实任务中获取逐步推理标注成本高昂,且 rationale 可能噪声大或格式与模型推理不一致。若 rationale 缺失或低质,自适应引导可能失效,甚至误导策略。与纯 RLVR 相比,额外的数据准备成为部署门槛。实际工程中需要评估 rationale 成本与收益,或采用自动生成 rationale 的替代方案,但这又可能引入偏差。
- **实验覆盖范围与模型规模有限**。论文在语言推理(如数学 / 逻辑)和视觉语言任务上验证,但未涉及更开放的生成 / 对话场景,且未报告大规模模型(如 70B+)上的表现。小模型上的提升不一定迁移到超大模型,因为大模型可能本身对稀疏奖励更鲁棒或已有隐式推理能力。此外,消融实验虽表明 adaptive 机制关键,但未与更先进的 off-policy 方法(如 ReST、V-STaR 等)充分对比,限制了其在完整 RL pipeline 中的相对优势判断。
- **训练复杂度与额外计算开销**。RGPO 引入引导 / 非引导双阶段 rollout 和奖励比较机制,相比标准 RLVR 增加了采样次数和策略更新步骤,可能显著提高 GPU 时耗。文中未提供详细的计算开销对比(如每步 wall-clock time 或 token 成本),导致实际部署时难以预估成本。对于资源受限的团队,额外的 rationale 引导可能不划算,需要更轻量的自适应调度策略。