论文

PACT: 从信用分配到 Critic 对齐

PACT: 从信用分配到 Critic 对齐

强化学习已成为大语言模型(LLM)后训练的核心组件,但 token 级 credit 一直缺乏公认的数学定义,其与常用训练信号的关系也不清晰。本文提出 Completeness、Prefix Consistency 与 Neutrality 三条正则性条件,并证明它们唯一确定 token 级 credit。 这一刻画提供了统一视角,用以解释现有算法中的诸多现象,并指导改进的 actor-critic 训练流程: - On-Policy Distillation (OPD) 中的理想教师充当隐式 critic,其诱导的期望策略梯度与 token 级 credit 成正比; - 响应级的 REINFORCE Leave-One-Out (RLOO) 信号虽粒度更粗,却与 token 级 credit 的期望策略梯度贡献相匹配; - 在结果奖励有界时可建立近似的 credit 稀疏性,并说明 Generalized Advantage Estimation (GAE) 中中间 critic 误差可与 credit 本身相当。 据此提出 Policy Aligned Critic Training (PACT),采用 Actor-then-Critic 的更新顺序,对 critic 训练施加重要性采样修正,使 critic 更好地对齐更新后的策略。在 agentic 数学推理中,PACT 于四个基准上取得 72.87% 平均准确率,分别超出 GRPO 与 PPO 8.80 和 13.16 个百分点;在 SWE-bench Verified 上通过率达 67.4%,分别超出 PPO、GRPO 与 SAO 2.4、2.0 和 3.8 个百分点。

论文精读

TL;DR PACT 用三条正则条件唯一确定 token-level credit,统一解释 OPD/RLOO/GAE,并提出 Actor-then-Critic 更新顺序,在数学推理和 SWE-bench Verified 上大幅超越 GRPO/PPO。

问题

问题背景

LLM 后训练广泛采用强化学习(如 PPO、GRPO、RLOO)来优化策略,但 token 级信用分配一直没有公认数学定义,导致对训练信号与梯度的理解停留在经验层面。

现有方法局限

  • 响应级奖励稀疏:多数 RLVR/RLHF 只在序列末尾给一个标量奖励,中间 token 的贡献无法直接观测。
  • 启发式信用分配:RLOO 的 leave-one-out baseline 和 GAE 使用组级均值或时序差分近似,缺乏理论唯一性刻画;OPD 的教师虽然实践中有效,但其作为隐式 critic 的条件未明确。
  • Critic 与策略失配:常见 actor-critic 更新 critic 时不对 actor 最新策略做重要性采样修正,导致 critic 目标分布漂移,中间误差在稀疏奖励下可与真实信用同量级。

为什么难 / 重要

  • 不可观测性:token 级奖励是隐变量,只能通过正则性条件(Completeness、Prefix Consistency、Neutrality)约束,证明唯一性需要精细构造。
  • 误差放大:有界结果奖励下信用近似稀疏,但中间 critic 误差可能累积,GAE 对误差敏感,实际训练不稳定。
  • 业界关注度:数学推理、SWE-bench 等 agentic 任务对信用分配质量高度敏感,现有算法在这些基准上提升有限,需要能同时对齐 critic 和策略的步骤。

行业类比

类似自动驾驶 中,把一次行程的安全性归因到每一帧决策:若 credit 分配偏差,策略会学到错误的中途动作,最终事故率上升;PACT 的角色相当于重新校准每一帧的贡献估计。

核心洞察

  • Token-level credit assignment 存在唯一数学定义,由 Completeness、Prefix Consistency、Neutrality 三个正则条件共同确定。这个定理为 LLM 强化学习中长期缺乏公认定义的 token 级奖励分解提供了统一基础。与以往各算法独立设计 credit 信号(如 GAE 的 λ-return、RLOO 的留一基线)不同,该框架揭示了它们之间的深层等价性:例如 RLOO 的响应级信号在期望上与 token-level credit 诱导的策略梯度一致,OPD 教师则隐式充当 critic。因此,这不是又一个启发式算法,而是为理解、诊断和设计 credit assignment 方法提供了一个可证明的理论透镜。
  • PACT 的核心设计是 Actor-then-Critic 更新顺序加 importance sampling 纠正 critic 训练,以缓解 GAE 中 critic 误差与真实 credit 同量级的问题。传统 actor-critic 通常 critic 先于 actor 更新,或使用同一批 on-policy 数据同时更新两者,导致 critic 评估的是旧策略下的值函数,而 actor 已前进一步,二者错位。PACT 先更新 actor,再用重要性权重对 critic 训练做 off-policy 修正,使 critic 目标对齐更新后的策略。这一顺序调整显式考虑了策略漂移,在数学推理与 SWE-bench Verified 上带来显著提升(如 SWE-bench Verified 67.4%,超过 PPO/GRPO/SAO 2.0–3.8 个百分点)。

方法

输入与目标

输入为 LLM 策略生成的轨迹与最终结果奖励(如验证器得分),目标是估计 token 级信用并改进 actor-critic 训练。

关键模块

  1. 唯一信用表征:通过 Completeness、Prefix Consistency、Neutrality 三个正则条件,将 token 级信用唯一定义为条件期望增量。该表征统一了解释 OPD、RLOO、GAE 等算法的理论框架。
  2. Actor-then-Critic 更新顺序:先用策略梯度更新 actor,使策略移动;再固定新的 policy,用旧轨迹训练 critic。
  3. 概率化值估计与重要性加权:critic 使用概率化值目标,将归一化奖励视为标签,采用带重要性权重的 BCE 目标;重要性采样权重校正旧轨迹的分布偏移,使 critic 对准更新后的 policy。

输出

输出一个与更新后策略对齐的 critic,为下一轮 actor 更新提供可靠的 token 级信用 / 优势信号;最终提升 LLM 在数学推理和代码生成上的表现。

与 PPO/GRPO 中 critic 通常与 actor 同时更新或 critic 滞后明显不同,PACT 显式通过 Actor-then-Critic 顺序和 critic 侧重要性采样解决 critic 的 off-policy 漂移,显著降低中间 critic 误差。

实验

实验设计

PACT 在两类任务上验证:智能体数学推理(4 个 benchmark,具体名称未列)与 SWE-bench Verified(代码代理任务)。对比基线包括 GRPO、PPO、SAO 等主流策略优化算法。训练细节未在摘要展开,但可从主体推断采用 actor-critic 架构,并通过 Actor-then-Critic 更新顺序 + 重要性采样修正 提升 critic 对齐。

关键发现

  • 数学推理平均准确率 72.87%,较 GRPO 提升 8.80 个百分点,较 PPO 提升 13.16 个百分点。
  • SWE-bench Verified 通过率 67.4%,分别超出 PPO、GRPO、SAO 2.4 / 2.0 / 3.8 个百分点。
  • 消融实验验证了 critic 目标函数与重要性采样修正的有效性(正文未给出具体数值,但摘要明确列举)。

与基线深度解读

PACT 的核心优势来自对 token-level credit 的严格刻画与 critic 对齐机制。传统 PPO/GRPO 的 critic 或基线往往基于旧策略或粗粒度奖励,导致梯度估计偏差;PACT 通过在 critic 训练中引入 on-policy 重要性采样校正,使 value 估计更贴近当前策略,从而在智能体长程推理任务中显著降低 variance。尤其与 SAO 对比,PACT 在 SWE-bench 上仍增益 3.8 个百分点,说明 strategic critic alignment 比单纯优化采样或基线更关键。工程上,该更新顺序不会大幅增加内存或算力开销,却能有稳定提升,适合实际部署。

行业影响

落地场景

PACT 可直接用于 LLM 后训练强化学习阶段,尤其适合需要精确 token 级信用分配的任务,如数学分步推理、代码编辑与 agent 工作流。典型产品包括:教育解题助手(生成逐步数学推导)、代码助手(基于 SWE-bench 的修改定位与补丁生成)、企业级 agent 平台(多步工具调用与长程决策)。这些场景中 critic 偏差会逐渐累积导致策略退化,PACT 的 Actor-then-Critic 顺序与重要性采样校正能够保持 critic 与当前策略对齐。

商业价值

论文在四个数学基准上平均准确率 72.87%,超过 GRPO 8.80 个百分点、PPO 13.16 个百分点;在 SWE-bench Verified 上达到 67.4% 通过率,优于 PPO、GRPO 和 SAO。商业收益体现在:

  • 模型性能提升:直接降低长程推理错误率,增强用户信任与付费意愿。
  • 训练成本节约:减少 critic 误差引起的策略震荡,降低超参调优与重复训练轮次。
  • 体验改善:数学解答与代码修复的步骤更稳定,减少错误中间步骤,提升产品专业形象。

与现有产品/工作流的接口

PACT 可作为现有 RLHF/RLAIF 训练栈中的 critic 训练策略替换,兼容 TRL、OpenRLHF、VeRL 等框架。集成步骤:

  1. 将 critic 更新延迟到 actor 更新之后,形成一步 off-policy 延迟。
  2. 对 critic 训练目标添加基于当前与旧策略概率比的重要性权重,修正分布偏移。
  3. 保持 actor 损失函数不变,仅替换 critic 损失为 BCE with importance-weighted targets。

需注意:PACT 依赖多 rollout 重要性采样,对分布式采样框架有额外数据请求,需要在训练编排层做适配。

局限

  • **理论假设的理想化**:论文提出的三个正则条件(Completeness, Prefix Consistency, Neutrality)在数学上简洁优雅,为 token-level credit 提供了唯一表征,但这些条件在真实 LLM 训练中可能无法严格满足。例如,Prefix Consistency 要求前缀相同则后续 credit 分配一致,但实际 reward 模型可能对长上下文存在位置偏差或语义漂移,导致条件被破坏。论文未充分讨论条件近似满足时的理论退化程度,以及 PACT 在非理想环境下的鲁棒性,这可能限制其在复杂多步推理或开放域任务中的适用性。
  • **实验覆盖范围有限**:论文仅在数学推理(四个 benchmark)和 SWE-bench Verified 上验证 PACT,缺少对话、指令跟随、安全对齐等典型 LLM RLHF 场景,难以证明方法的普适性。此外,基线对比中缺少一些近期 critic 对齐工作(如 Dr. GRPO、Reinforce++ 等),使得改进幅度可能被高估。PACT 引入了 critic 训练和重要性采样校正,相比 GRPO 等无 critic 方法增加了计算和内存开销,论文未提供详细的成本分析或效率对比,实际部署时可能成为瓶颈。
  • **与同类工作的差异化不足**:PACT 的核心贡献之一是 critic 对齐和 off-policy 同步,但已有大量工作研究 critic 正则化、trust region 约束和重要性采样校正,论文未充分建立与这些方法的理论联系或进行直接实验对比。例如,PPO 本身已有 clip 机制和新旧策略比例约束,GAE 也有误差控制手段,PACT 的改进是否在这些基础上有实质性超越,仍需更多消融和对比。另外,理论中关于 credit sparsity 和 GAE 误差敏感性的结论,其实际影响程度未通过大规模实验量化。
论文Jiayan Fu2026-09-22原文

相关内容