最佳实践评论家优化(BPCO)
基于组的强化学习方法(如 GRPO)通过为每个提示采样多条响应来避免训练评论家。然而,一个可靠的评论家本可以从单条响应中估计 token 级优势,但标准的基于评论家的训练流程往往不稳定。 我们研究了这种不稳定性,并提出了 Best Practice Critic Optimization(BPCO),一种结合了 DPPO、有界于奖励范围的值预测、蒙特卡洛值目标、未归一化的策略优势以及长度自适应广义优势估计的配方。由于评论家仅在训练时使用,BPCO 还可以将其条件于奖励定义信息(如参考答案或评分标准),这些信息对策略模型是隐藏的。控制实验隔离了每个设计选择的影响。 在数学推理任务上,使用从 1.5B 参数到 30B-A3B 专家混合的模型,BPCO 持续改进强基于评论家的基线,并且每个提示只采样一个响应就匹配或超过基于组的基线。同一配方也改善了基于评分标准的奖励学习。 这些结果表明,精心设计的评论家为组相对优势估计提供了可靠的替代方案。代码位于 https://github.com/QPHutu/goldencritic。
论文精读
TL;DR BPCO 通过结合有界值预测、蒙特卡洛目标与长度自适应 GAE,稳定了基于 critic 的强化学习,以单响应采样达到甚至超越 group-based 方法。
问题
当前 LLM 强化学习在数学推理、指令跟随等任务上,主流依赖 GRPO 等 group-based 方法,通过每组采样多条响应比较奖励来估计优势,避免训练 critic。这类方法虽有效,但推理成本随组内采样数线性增长,且优势估计是相对排序,依赖组内响应质量分布——若同质或噪声大,token 级 credit assignment 会失真。
Critic-based 方法(如 PPO)理论上可用单响应估计 token-level advantage,但标准价值网络训练不稳定:值函数目标高方差、奖励稀疏,长序列中微小偏差经时序传递累积,常导致策略退化或奖励不增。因此业界长期在“多采样换稳定”与“单采样但易崩”之间权衡,缺乏可靠的 critic 训练配方。
BPCO 的动机正在于解决这一矛盾:通过 DPPO、值预测截断到奖励范围、Monte Carlo value target、去掉优势归一化、以及 length-adaptive GAE 等逐一验证的设计,将 critic 稳定性提升到可匹配 group-based baseline 的水平。其关键挑战在于,LLM 的轨迹极长且奖励通常只在序列末尾出现,任何价值函数误差都会被策略更新放大;而可靠的单响应 critic 能大幅降低训练时的采样与推理开销,对提升 RL 样本效率有直接工程价值。
行业类比:类似在游戏 AI 中用训练好的 value head 替代昂贵的 Monte Carlo 树搜索 rollouts,以一次前向计算实现接近多次模拟的决策质量。
核心洞察
- Critic 可以通过精细设计稳定化单响应强化学习,替代群体相对优势估计。 BPCO 证明通过将值预测限制在奖励范围内、使用无偏 MC 目标、移除优势归一化,并采用长度自适应 GAE,单响应采样的 critic-based PPO 可以匹配甚至超越 GRPO 的群体采样性能,将推理采样成本降低 N 倍。这打破了“critic 训练不稳定、只能依赖群体采样”的固有认知,为 LLM 推理强化学习提供了单样本训练的高效路径。
- Critic 可利用训练时特权信息(参考答案或评分标准)提升价值估计精度,而策略保持通用。 BPCO 允许 critic 看到 reward-defining 信息,这些信息在部署时不可用,但训练时可精确指导 token 级 credit assignment。这是群体方法无法做到的,因为群体方法仅依赖多个响应之间的相对比较,无法显式利用参考答案;该设计突破了常规 RL 中 critic 与 policy 共享观测的假设,为任务特定奖励的利用提供了新思路。
方法
输入与总体流程
BPCO 面向单条采样的强化学习轨迹,输入为 prompt 对应的一条完整 response 及其最终标量 reward(可来自正确性评分或 rubric)。训练时同时更新策略模型与 critic 模型,critic 仅训练阶段存在,因此允许额外输入 reward 定义信息,如参考解答、评分标准,这些信息对策略隐藏。
关键模块
- 策略优化目标:采用 DPPO 作为策略优化目标,通过 KL 约束稳定策略更新。
- critic 值域有界:将 value 预测 clip 到 reward 的取值范围内,防止价值估计发散。
- Monte Carlo 值目标:使用无偏的 MC 回报作为 critic 训练目标,而非 bootstrap,减少估计偏差。
- 优势无归一化:策略更新时不对优势做批次归一化,保留 token 级信号幅度。
- 特权信息 critic:critic 输入额外包含 reward 定义信息,使其价值估计更准确,且不影响策略输入分布。
- 长度自适应 GAE:根据 response 长度动态调整广义优势估计的 λ 或窗口,适配长序列的 credit assignment。
输出
critic 输出逐 token 的 value,结合 MC target 和 GAE 生成 token 级 advantage,驱动策略参数更新。整个 recipe 使 critic-based 方法在单采样设置下稳定。
与同类方法的差异:BPCO 在仅采样一条 response 的条件下,通过上述组合达到或超过 GRPO 等多采样 group-based 方法的性能,同时利用特权信息增强 critic,这是传统 critic 方法未系统探索的。
实验
实验设计
BPCO 通过一系列控制实验逐步构建:从 DPPO 替代 PPO 开始,依次加入价值预测有界、蒙特卡洛价值目标、移除优势归一化、给 critic 提供特权信息、长度自适应 GAE。在数学推理任务上,评测模型规模覆盖 1.5B 到 30B-A3B 混合专家。对比基线包括强 critic-based 方法与 group-based 方法(如 GRPO)。此外还验证了 rubric-based 奖励场景。
关键发现
- BPCO 一致提升 critic-based 基线。
- 仅采样单条响应即可匹配或超越 group-based 基线,提升样本效率。
- 同一配方可改善 rubric-based 奖励学习。
- 结果证明精心设计的 critic 是 group-relative advantage estimation 的可靠替代。
与基线对比解读
与标准 critic-based 方法相比,BPCO 通过有界价值预测 和 蒙特卡洛目标 缓解了训练不稳定;与 GRPO 等 group-based 方法相比,BPCO 每个 prompt 只需一个响应,降低计算开销。特权信息仅用于训练 critic,不影响策略推理,为工程部署提供便利。总体表明,critic-based 方案在合适设计下可媲美 group-based 方法,且具备更优的样本效率。
行业影响
落地场景
BPCO 为需要高效 RL 训练的团队提供了单响应 critic 方案。典型场景包括:
- 在线教育:数学题分步解答训练,critic 可访问参考答案和评分 rubric,为每个 token 提供细粒度优势信号,减少每组采样数量。
- 企业客服:基于 rubric 的回复质量优化,critic 隐藏 rubric 避免策略过拟合,单次采样即可训练。
- 代码生成平台:单元测试通过的稀疏奖励下,critic 利用测试结果信息提供 token 级 credit assignment。
商业价值
核心价值在降低推理成本:group-based 方法每 prompt 需采样 4-8 个响应,BPCO 仅需 1 个,推理量降低数倍,直接节省训练时的 GPU 资源与时间。同时保持性能匹配或超过 GRPO,因此不牺牲模型质量。此外,privileged critic 设计允许将人工标注或参考信息只给 critic,避免策略依赖捷径,提升奖励模型泛化能力,长期减少数据清洗和迭代成本。
与现有工作流集成
BPCO 可作为 RLHF/RLVR 流程中的 critic 优化 drop-in 替换。现有框架(如 TRL、OpenRLHF)已支持 PPO 变体,主要改动:
- 将 critic 值预测 clamp 到
[min_reward, max_reward]; - 改用 Monte Carlo 目标替代 bootstrapped TD 目标;
- 移除 advantage 归一化;
- 采用长度自适应 GAE(根据序列长度调整 λ 或 γ);
- 将额外信息(rubric、参考答案)作为 critic 的输入,仅训练时可见。
这些改动可直接集成到自定义 reward 函数的训练 pipeline 中,无需重构数据或奖励模型。对于已经使用组相对优势的团队,迁移成本低,可逐步试点单响应训练。
局限
- - **任务与模型覆盖有限**:实验主要在数学推理任务(如 GSM8K、MATH 等)以及 1.5B 至 30B-A3B MoE 规模的模型上进行,未涉及指令跟随、代码生成、对话等更广泛的 LLM 应用场景。BPCO 依赖的 **privileged information**(参考答案或评分细则)在这些非客观评价任务中往往难以定义或获取,限制了方法的通用性。此外,更大规模模型(如 70B+、稠密模型)上的表现尚未验证,无法确定 critic 训练的稳定性是否随规模扩展。
- - **privileged information 的可用性与泄漏风险**:BPCO 允许 critic 在训练时访问 **reward-defining information**(如参考答案、评分标准),但策略不可见。这要求训练数据必须提供此类信息,而真实场景中许多 RL 数据仅有最终奖励信号或人工偏好排序,没有明确参考答案;即使有,也可能存在信息通过 critic 输出隐式泄漏给策略的风险。论文未讨论如何在缺失信息时降级使用 BPCO,也未提供防止泄漏的具体机制。
- - **方法为多组件组合,缺乏理论分析**:BPCO 集成了 **DPPO**、bounded value、**Monte Carlo value targets**、unnormalized advantages、length-adaptive GAE 等多项设计,消融实验表明每步改进幅度有限,主要是累积效应。没有单个组件起决定性作用,导致工程上难以判断哪些组件在何种条件下必不可少。论文未提供收敛性、偏差-方差或样本复杂度的理论分析,超参数(如 value clipping 范围、GAE lambda、长度惩罚系数)需要额外搜索,可能影响实际部署效率。