后训练中被忽视的免费午餐:面向 LLM Agent 的进展优势
过程奖励模型能够提供细粒度、步骤级的语言模型评估,但在 agentic 场景中构建它们极其困难:长期交互、不可逆动作和随机环境反馈使得大规模人工标注和蒙特卡洛估计都不可行。本研究表明,强化学习(RL)后训练已经提供了有效步骤级打分的要素,无需专门训练奖励模型。 我们从一般随机马尔可夫决策过程(MDP)中推导出一个隐式优势函数,称为 进展优势 ——RL 训练策略与其参考策略的对数概率比恰好恢复了最优优势函数。这一形式使得所得信号无需标注、领域无关,并且是标准 RL 后训练流程的副产品。 我们在五个基准和四个模型家族上,针对三种不同应用验证了进展优势的有效性:测试时扩展、不确定性量化和失败归因。在所有设置中,它始终优于基于置信度的基线,并且尽管不需要任务特定训练,却超越了专用训练奖励模型。我们还对进展优势的特征进行了深入分析,为实际 agentic 系统中的采用提供了实用指导。
论文精读
TL;DR RL 后训练自带的策略-参考对数概率比可直接作为最优优势函数,无需额外训练即提供步骤级评分,免费解锁 agent 测试时缩放、不确定性量化和故障归因。
问题
问题背景
大语言模型 (LLM) 在需要多步推理与交互的智能体任务中,步骤级的过程监督 (process supervision) 比最终结果监督更能提升决策质量和可解释性。为此,业界开始关注过程奖励模型 (Process Reward Model, PRM),期望对每一步进行精细化评分,从而指导搜索、归因和不确定性量化。
现有方法局限
构建 PRM 的传统路径高度依赖以下两种方案,但在智能体环境 (agentic settings) 中几乎不可用:
- 人工标注步骤级正确性:智能体交互轨迹极长 (long-horizon)、动作不可逆 (irreversible actions),且环境反馈高度随机 (stochastic feedback),人工判断每一步的“好与坏”极度昂贵且难以一致。
- 蒙特卡洛 roll-out 估计:为每个步骤采样多条未来路径以估计期望回报,但智能体环境的随机转移概率使 roll-out 方差极大,且许多真实世界任务根本无法重置到中间状态。
这两类方案在规模扩展性上均遭遇瓶颈,导致现有 PRM 几乎无法覆盖开放域的智能体任务。
为何困难且重要
难点源于智能体任务的双重随机性——策略的随机性叠加环境转移的随机性,使得直接建模步骤价值函数 (value function) 或优势函数 (advantage function) 极为困难。同时,业界对可靠步骤评估的需求持续升温:测试时推理缩放 (test-time scaling)、失败步骤归因 (failure attribution) 和不确定性感知 (uncertainty quantification) 等上层应用,都高度依赖高质量的步骤级信号。缺少这类信号,LLM agent 的决策仍停留在粗粒度、低可靠性的阶段。
行业类比
这类似于自动驾驶中的安全判别——传统方法需专门训练一个代价高昂的场景理解模型,而本文发现,直接从驾驶策略的策略改进信号中,可以提取出同等有效的步骤级风险评分,近乎零成本。
核心洞察
- **从 RL 后训练中免费获得步骤级评估信号,无需额外训练过程奖励模型 (PRM)**:在智能体设置中,人工标注和蒙特卡洛估计步骤级奖励成本极高,而 **progress advantage** 通过 RL 策略与参考策略的对数概率比直接恢复最优优势函数,将评估信号变成标准 RL 微调管道的副产品。这意味着任何经过 RLHF/RL 训练的模型都自带步骤评分能力,无需针对特定环境或领域重新标注或训练奖励模型,极大降低了构建步骤级可解释性、测试时扩展和不确定性量化系统的门槛。
- **progress advantage 信号无标注、领域无关,且优于专有奖励模型和置信度基线**:实验表明,尽管未使用任何任务特定训练数据,progress advantage 在 **test-time scaling**、**uncertainty quantification** 和 **failure attribution** 三个任务五个基准四个模型家族上均超越基于置信度的基线方法,甚至优于专门训练的 **AgentPRM** 等奖励模型。这揭示了 RL 后训练隐式捕获的分布偏移信息比显式训练的奖励信号更稳健,且其“相对进步”的语义天然适配随机环境中的步骤级信用分配,为智能体系统的可靠决策提供了即插即用的评估手段。
方法
核心思想:从RL后训练中免费获得步骤级评分
输入:LLM agent与环境交互的完整轨迹,包含状态(环境观察)和动作(模型生成的文本或工具调用),无需任何额外标注。
关键模块:隐式过程奖励建模
策略对构造
利用标准RL后训练流程中产生的两个策略:RL训练后的策略(如PPO微调的π_RL)和其参考策略(通常是初始SFT模型π_ref)。作者从随机MDP理论出发证明:在这两个策略的对数概率比log π_RL(a|s) - log π_ref(a|s)恰好恢复了该状态-动作对的最优优势函数,将这个量命名为进度优势(Progress Advantage)。概率计算与聚合
从模型输出中提取token级log概率,将动作序列的文本概率通过求和或平均转换为动作级概率。为提高鲁棒性,实践中采用top-k平均或逐token平均(而非简单求和),避免长序列概率过于偏向长度。PPO训练中的裁剪代用损失(clipping surrogate loss) 隐含[KL]正则,保证π_RL与π_ref的差异在合理范围内,从而维持进度优势的有效性。步骤级评分输出
对轨迹中的每一步,计算其进度优势值。该信号天然具备以下属性:- 标注无关:不依赖人工打分或蒙特卡洛估计,直接从已有模型参数中提取。
- 域未知:对任务、环境无任何前提假设。
- 即插即用:只需加载已有RL checkpoint,无需任何额外训练。
输出与应用
- 测试时扩展(Test-time Scaling):用进度优势对候选动作加权投票或筛选,提升最终答案的正确性。
- 不确定性量化(Uncertainty Quantification):利用多步中进度优势的方差作为模型不确定性的代理。
- 失败归因(Failure Attribution):捕捉轨迹中进度优势的突然下降位置,反推出错步骤。
与同类方法的差异
传统过程奖励模型(如ThinkPRM、AgentPRM)需要专门设计标注流程或逐步骤的蒙特卡洛价值估计来训练专用评判器,成本高且难以应对随机环境中的不可逆动作和延迟反馈。进度优势直接从RL后训练策略的对数概率比中诞生,完全不依赖额外模型训练,且在多个agent基准上性能超越精心训练的专用[PRM],真正实现了“免费午餐”式的步骤级评估。
实验
实验设计
通过 进度优势 (progress advantage) 这一隐式过程奖励信号,论文在不训练专用奖励模型的前提下,系统评估其在三类下游任务中的表现:(1) 测试时扩展 (test-time scaling),即根据步骤评分选择最优轨迹;(2) 不确定性量化 (uncertainty quantification),利用评分判断模型对当前状态的置信度;(3) 失败归因 (failure attribution),在长程交互中将失败追踪到具体步骤。实验覆盖 5 个 agent 基准和 4 个模型家族,包括多种不同规模和训练方式的 LLM。基线方法包括置信度自评估、专用奖励模型 (如 DeepConf, AgentPRM) 以及 LLM-as-a-Judge 等。
关键发现
- 全面优于置信度基线:在所有任务和基准上,进度优势一致超越基于置信度的评分方法,无需任何任务特定训练。
- 超越专用奖励模型:尽管进度优势完全源于 RL 后训练副产品且无需标注,其质量仍超过针对 agent 场景精心训练的专用奖励模型。
- 消融验证设计合理性:对比
π_θ与π_ref的联合使用比单用π_θ更有效;token 级 log 概率比优于平均聚合;参考策略选择 RL 初始模型 (π_ref) 比使用预训练模型更能捕捉有意义的进展信息。
与基线的深度对比
进度优势的核心竞争力在于其 零成本、域无关 的特性。传统方法要么依赖昂贵的人工标注 (ThinkPRM),要么需通过蒙特卡洛模拟估计过程奖励 (AgentPRM),要么仅利用模型自身置信度 (Self-Certainty),这些在随机环境与不可逆动作下均面临严重失效或成本瓶颈。进度优势从 RL 训练后的策略与参考策略的对数概率比中直接推导出最优优势函数,无需环境模型或额外标注,且理论保证适用于一般随机 MDP。实验显示,在测试时扩展中,它能更准确识别关键决策点,从而在同等预算下获得更高成功率;在不确定性量化中,其评分与真实环境奖励的 Spearman 相关性显著高于所有基线;在失败归因中,它更精确定位错误步骤,为后续自修正提供可靠信号。这一范式挑战了“过程奖励必须显式建模”的固有认知,为大规模 agent 部署开启了低门槛、高可靠的自我评估通道。
行业影响
落地场景
该方法的核心资产是隐式过程奖励 (progress advantage)——直接从 RL 后训练中提取的、无需额外训练的步骤级评估信号。所有需要长程规划与多步决策质量评估的 LLM Agent 系统均可受益:
- 软件工程 Agent (如代码生成与调试):在交互式编程环境中,实时判断每步操作是否逼近目标,避免无效探索;
- 多轮对话客服:评估每一轮回复的进展,决定是否转向人工坐席;
- 机器人任务规划:在具有随机环境反馈的物理仿真中,对子序列打分以优化计划生成;
- 金融分析 Agent:在多步推理中量化不确定性,提前终止低置信度路径。
商业价值
- 降本:模型训练阶段无需人工标注或蒙特卡洛采样来构建专用过程奖励模型,直接复用 RL 后训练产生的 policy / reference 对,节省标注与重训练支出。
- 增效与体验提升:在测试时通过 progress advantage 进行路径剪枝与不确定性量化,可显著降低无效 API 调用成本;失败归因能力让系统更易调试,缩短 Agent 从开发到上线的周期;用户体验方面,Agent 能主动识别低确定性步骤并请求确认,减少错误传播。
与现有产品/工作流接口
集成极为轻量:只需在推理 pipeline 中同时保持 RL 训练后 policy 和 reference policy 的 log-probability。现有 RL 训练框架 (如 TRL、DeepSpeed-Chat) 可直接输出该对。推理时可作为插件嵌入 vLLM、SGLang 等引擎:
- 对每条生成序列,按 token 或步骤汇总 progress advantage,作为 score 字段返回;
- 在 Agent 框架 (LangChain、AutoGen) 中,将该分数作为路由/终止条件,如阈值联动触发人工接管;
- 与现有置信度方法互补,不需要推翻现有评分体系。
具体落地 Use Case
- 电商客服 Agent:在退换货、订单追踪等长程对话中,每轮生成后计算 progress advantage,当连续下降或低于阈值时自动转向人工坐席,避免模型幻觉导致不可逆操作,同时降低人工处理量。
- 自动驾驶中的行为规划:在生成的候选轨迹序列上,用 progress advantage 筛选出能稳定向目标靠近的动作序列,并在不确定性突然升高(如传感器噪声)时触发安全降级策略,提升长尾场景的决策安全性。
局限
- **依赖 RL 后训练与 token 概率访问**:进度优势需要一组经过 RL 微调的策略对(当前策略与参考策略)及其 token 级对数概率,若任务未进行 RL 后训练或模型仅通过 API 提供黑盒输出,则方法无法直接应用。论文在 limitation 部分也指出,这限制了其在无 RL 管线或闭源模型上的部署。
- **环境随机性与分布偏移的隐含假设**:理论推导建立在随机 MDP 和特定 KL 正则化假设上,当环境转移高度非平稳或 RL 训练导致策略与参考分布差异过大时,对数概率比作为优势函数的估计可能产生偏差。实验主要覆盖回合较短、确定性较强的代理基准,对长期规划或连续动作空间的鲁棒性尚待验证。
- **信号可解释性与聚合策略薄弱**:相比显式训练的过程奖励模型,进度优势是隐式信号,缺乏对中间步骤的语义校准能力,在故障归因中虽有效但不如专用模型直观。不同聚合策略(平均、max)对性能影响明显,而论文未提供系统性选择准则,实践中需额外调试。