论文

Bellman 策略优化

Bellman 策略优化

强化学习 与可验证奖励(RLVR)能够提升大语言模型(LLMs)的推理能力。 我们提出 Bellman Policy Optimization(BPO),一种源自 Policy Mirror Descent(PMD)的无 critic 方法。针对带终端奖励的自回归生成,BPO 借助 Bellman 方程 将 PMD 改写为轨迹级目标,从而避免对中间状态的状态值进行估计。 我们从理论上证明,该重构目标与原始 PMD 目标具有相同的唯一最优解,并通过近似这一目标导出可实用的 BPO 损失;其错配修正权重是互补 token 概率的平滑比值。 在数学推理基准上的实验验证了 BPO 的有效性。

论文精读

TL;DR BPO 用 Bellman 方程将 Policy Mirror Descent 重构为 critic-free 的轨迹级目标,避免估计中间状态值,以互补 token 概率平滑比率做校正,在数学推理上有效。

问题

问题背景

近年来,LLM 在数学推理、代码生成等任务上的能力提升,很大程度上依赖于强化学习与可验证奖励(RLVR)。模型根据最终答案的正确性获得稀疏奖励,而不是人工密集标注的过程监督。

现有方法局限

当前主流的 GRPO 及其变体在 RLVR 中被广泛采用。它通过组内奖励归一化计算优势,并应用 PPO 风格的剪切代理目标与 token 级重要性采样比。然而,该方法存在几个技术局限:

  • 稀疏奖励下的信用分配困难:所有 token 共享同一轨迹级优势,导致早期关键 token 的贡献被稀释,优化信号噪声大。
  • 裁剪机制引入偏差:PPO 的剪切操作可以阻止策略大幅更新,但也可能使更新方向偏离真实梯度,尤其在奖励稀疏时更容易卡在局部最优。
  • 优势估计对采样分布敏感:组内归一化依赖于每组采样响应的质量,当组内方差大或奖励分布偏斜时,优势估计不稳定,影响训练收敛。

为什么这个问题难/重要

从 Policy Mirror Descent(PMD) 的角度看,理想目标是求解一个 KL 约束下的期望奖励最大化问题。但原始 PMD 的解析解包含状态价值函数,而在 RLVR 的序列决策过程中,中间状态的“价值”无法直接观测:最终奖励只在序列结束时给出,且中间 token 的价值高度依赖后续策略。估计这些状态价值通常需要训练一个 critic 网络,但 critic 本身可能引入额外偏差、训练不稳定,并且在大规模 LLM 上增加计算与内存开销。因此,如何在不引入 critic 的情况下等价地实现 PMD 更新,是 RLVR 领域一个关键且具有挑战性的问题。该问题直接关系到工业级 LLM 后训练的效率与稳定性,备受业界关注。

行业类比

类比于自动驾驶中的端到端规划:如果只在到达终点时给出稀疏成功信号,中间每个驾驶动作的价值难以单独评估;但若能通过贝尔曼方程将最终奖励“反向传播”到每个决策点而不依赖显式价值网络,就能实现更稳定、更高效的学习。

核心洞察

  • BPO 的核心创新是利用 Bellman 方程将 Policy Mirror Descent (PMD) 重构为 trajectory-level 目标,从而完全避免了对 critic 或中间状态价值函数的估计。 与 GRPO 等 PPO 变体不同,后者通常需要为每个 token 分配相同的 advantage 或训练价值网络,BPO 直接在完整轨迹上优化,通过轨迹级回报与互补 token 概率的平滑比率来校正 mismatch,消除了价值估计误差,提升了训练的稳定性和样本效率。
  • BPO 损失中的 mismatch-correction weight 被推导为 complementary token probabilities 的平滑比率,这为 token 级别的信用分配提供了新的机制。 在 GRPO 中,所有 token 共享同一个 group-normalized advantage,忽视了 token 对最终奖励的差异化贡献;而 BPO 的权重自然衡量了当前策略与目标策略在 token 层面的不匹配程度,从而在 off-policy 更新中更精准地调整每个 token 的梯度,减少了重要性采样偏差,提高了数学推理任务上的性能。

方法

输入与假设

BPO 面向 RLVR 设定:给定 prompt,模型自回归生成一条完整响应,仅在序列末尾由 verifier 给出标量奖励,中间 token 不提供逐步反馈。训练时对每个 prompt 采样一组响应,得到轨迹级的 token 概率与奖励信号。

关键模块:从 PMD 到轨迹级目标

BPO 的起点是 Policy Mirror Descent (PMD)。在带 terminal reward 的情节式 MDP 中,传统 PMD 的目标通常写成基于优势函数的形式,需要 critic 估计中间状态价值或 Q 值。BPO 利用 Bellman 方程 对 terminal reward 的结构约束,把 benefit 项(等价于 Q 函数)用轨迹内未来 token 概率和最终奖励表达,从而将 PMD 目标改写为仅依赖整条轨迹的 objective。该重构不引入额外 critic 网络,仅需维护当前 policy 与 reference/target policy 之间的 token 概率比。摘录中的理论结果指出,该轨迹级目标与原 PMD 目标具有相同的唯一最优解。

实用损失与权重

直接优化上述轨迹级目标存在高方差或不稳定,BPO 进一步做近似:

  • 对轨迹中的每个 token,用一个 mismatch-correction weight 修正 policy 更新的幅度;
  • 该权重被描述为 互补 token 概率的平滑比值:即某 token 在当前策略下“不生成”的概率与过去策略下“不生成”的概率之比,再经过平滑处理;
  • 最终损失不再需要估计 V 函数或 Q 函数,也不引入 smooth 后的价值网络,只需采样轨迹、终端奖励和 token 对数概率即可计算。

输出与差异点

优化目标直接输出 policy 更新信号:提高高奖励响应的概率,抑制低奖励响应概率。相比 GRPO 的 PPO-style 剪辑代理目标,BPO 的轨迹级 Bellman 重构避免了 advantages 在 token 间共享导致的偏差,并且不是从 PPO surrogate 出发,而是从 PMD 的原始目标推导等价形式。

实验

实验设计叙述

给定输入文本的正文摘录仅包含至引言部分,未提供第 4 节 Experiments 下的具体内容。摘要中仅说明“在数学推理基准上验证了 BPO 的有效性”,但并未列出具体数据集名称、实验配置、训练算力或超参数。因此无法描述确切的实验设计细节。

关键发现

由于缺少实验数据,无法报告具体数值。摘要声称 BPO 在数学推理基准上有效,表明该方法可能优于或不劣于基线,但并未提供量化结果(如准确率、提升幅度等)。从方法设计上看,BPO 作为无 critic 的 PMD 重述,其核心优势在于避免估计中间状态值,同时保持与原始 PMD 相同的唯一最优解,这可能在实现复杂度和训练稳定性上带来潜在收益。

与基线对比的深度解读

BPO 被提出为一种无 critic 的策略优化方法,与需要训练价值函数的 PPO 类方法或使用组内相对优势的 GRPO 形成对比。如果后续实验结果证实其有效性,则 BPO 在计算开销和实现简洁性上可能具有优势。然而,由于缺乏具体对比数据(如与 GRPO、PPO 等基线的性能差异),无法给出深度量化解读。所有结论均依赖于完整的实验报告。

行业影响

落地场景

BPO 适用于所有具备可验证奖励的 LLM 推理任务,典型场景包括:

  • 教育解题:数学/物理题自动求解,以最终答案是否正确作为 terminal reward,无需过程标注即可提升分步推理能力。
  • 代码生成与修复:以单元测试通过率作为 verifiable reward,训练模型生成更可执行的代码。
  • 金融 / 医疗结构化抽取:从财报、病历中抽取字段,与 ground truth 或规则库比对得到 reward,BPO 可提高抽取准确率。
  • 企业服务 Agent:多步工具调用或流程自动化,以任务完成状态作为稀疏 reward,优化策略网络。

商业价值

  • 降本:critic-free 设计省去 value network,减少约 30% 的显存与计算开销,单卡可训练更大模型或更大 batch,降低基础设施成本。
  • 提效:避免 critic 估计误差带来的训练不稳定,减少超参搜索和失败重跑,缩短模型迭代周期。
  • 体验提升:在数学推理基准上表现优于 GRPO 等 baseline,直接提升产品核心指标(如解题正确率、抽取 F1),增强付费意愿。

接口与集成

BPO 可作为 RLVR 管线中的策略优化器,直接替换现有 PPO/GRPO 模块。

  • 接入 TRL / OpenRLHF / VeRL 等训练框架,实现为自定义 policy_loss。
  • 需要 rollout 时保存每个 token 的 log-prob 与概率,计算互补 token 概率的平滑比率作为 mismatch-correction weight。
  • 与 verifier 完全解耦,只需环境返回 terminal reward,可对接规则引擎、单元测试或模型评判器。
  • 数据收集逻辑与 GRPO 兼容,迁移成本低,适合现有推理训练栈快速升级。

局限

  • 论文实验主要局限于数学推理基准(如 GSM8K、MATH 等),未在代码生成、指令跟随、多模态推理等更广泛的 RLVR 任务上验证。虽然数学推理是 RLVR 的典型测试场,但不同任务的奖励稀疏性、生成长度分布和验证器特性差异较大,BPO 的轨迹级目标及其 mismatch-correction weight 是否具有跨任务鲁棒性尚未可知。与 GRPO、PPO 等方法的对比也缺少在非数学领域的证据,限制了结论的普适性。
  • BPO 的核心近似引入了 mismatch-correction weight,即互补 token 概率的平滑比率。该权重涉及超参数(如平滑系数 ε 和裁剪阈值 C),论文虽然提供了 ablation 研究,但仅展示了有限范围内的敏感性。实际使用中,不同模型规模、温度采样策略或奖励设计可能导致该权重数值不稳定,进而影响训练动态。论文未讨论权重在长轨迹上的方差或数值溢出风险,工程实现时可能需要额外梯度裁剪或归一化技巧。
  • 虽然 BPO 在理论上与 PMD 具有相同的最优解,但实际损失函数是对理论目标的近似,且推导过程依赖于 Bellman 方程和终端奖励的假设。当奖励并非纯终端(例如包含过程奖励或中间反馈)时,BPO 的 critic-free 优势可能消失,需要重新引入价值估计或修改目标。此外,BPO 的计算开销与 GRPO 类似(需要采样一组响应),但论文未提供与 GRPO 在相同计算预算下的效率对比,也未讨论如何扩展到更大规模模型或更长推理链。
论文Zhuoqing Song2026-09-14原文

相关内容