论文

APPO: Agentic Procedural Policy Optimization

APPO: Agentic Procedural Policy Optimization

近年来,智能体强化学习(RL)的进展显著提升了大型语言模型智能体的多轮工具使用能力。然而,现有方法大多在粗粒度的启发式单元(如工具调用边界或固定工作流)上进行信用分配,难以识别哪些中间决策影响下游结果。本文从两个角度研究智能体RL:分支位置和分支后信用分配。初步分析表明,有影响力的决策点广泛分布于生成的整个序列中,而非集中于工具调用处,而仅凭令牌熵无法可靠反映其对最终结果的影响。基于这些观察,我们提出智能体过程策略优化(APPO),将分支和信用分配从粗粒度交互单元转移到序列中的细粒度决策点。APPO使用分支分数选择分支位置,该分数结合令牌不确定性与后续延续的策略诱导似然增益,从而实现更定向的探索,同时过滤掉虚假的高熵位置。此外,它引入过程级优势缩放,以更好地在分支 rollout 间分配信用。在13个基准上的实验表明,APPO在保持高效工具调用和行为可解释性的同时,一致地将强智能体RL基线提高了近4个百分点。

论文精读

TL;DR APPO 将智能体 RL 的分支与信用分配从粗粒度工具调用转向令牌级决策点,通过分支得分与过程级优势缩放精细控制探索,在13个基准上平均提升近4分且保持可解释性。

问题

问题背景
随着大语言模型(LLM)在工具调用、多轮交互等代理任务中日益广泛,如何通过强化学习(RL)优化代理策略,以提升长期成功率和任务完成质量,成为 Agentic RL 的核心议题。

现有方法局限
主流方法(如 ToolRL、Workflow-based RL)将信用分配(credit assignment)绑定在粗粒度的启发式单元上,例如工具调用边界或预定义工作流步骤。然而,关键决策点往往广泛散布于整个生成 token 序列中,而非仅集中在工具调用处。此外,仅依赖 token 熵来识别重要决策位置并不可靠——高熵位置未必真正影响最终结果,而低熵位置也可能至关重要。这导致探索盲目、信用分配失准,限制了策略优化的上限。

为什么这个问题难且重要
首先,LLM 代理的轨迹通常包含数千乃至数万个 token,从中精准定位影响长期回报的关键决策点(branching points)本身就极具挑战。其次,在选定分支点后,如何将后续轨迹获得的奖励合理归因到每个分支路径(即过程级优势估计),是另一个核心难题。若这两环处理不当,RL 训练要么探索效率低下,要么引入高方差,最终导致策略收敛缓慢甚至次优。在业界,随着 Agent 应用从简单对话扩展到复杂自主任务(如软件操控、多步数据分析),对高效、可解释的策略优化技术的需求正急剧增长。

行业类比
这一挑战类似于自动驾驶规划中识别关键状态——不是道路上的每一帧都同等重要,需要定位那些必须做出正确决策的瞬间(如路口转向、行人避让),并精确评估选择的后果。

核心洞察

  • APPO 将 agentic RL 的分支粒度从工具调用边界下移到了生成序列中的细粒度决策点,突破了现有方法只能在粗粒度交互单元进行探索的局限。现有方法如 DAPO、GRPO 等通常以工具调用或完整轮次为分支单元,但实际影响最终结果的决策往往分散在各个 token 位置,而不局限于工具调用边界。APPO 的 Branching Score 结合了 token 不确定性(熵)和执行该决策后策略对后续序列的似然增益,从而筛选出真正关键的分支点,避免了仅依赖熵导致的高噪音分支。这种细粒度分支能更精准地捕获影响下游结果的中间决策,大幅提升探索效率和最终性能。
  • APPO 提出了 procedure-level advantage scaling,改进了多分支 rollout 的信用分配机制。常规方法在分支后对不同轨迹计算优势函数时,往往直接按 token 级别平均,忽视了分支点之后步骤的反馈延迟差异。APPO 的过程级优势缩放根据分支深度动态调整不同决策步骤的优势权重,使得早期决策的信用能正确反映其对最终结果的滞后影响。这一设计与 Branching Score 选点策略协同,共同提高了策略优化的稳定性,同时保持了良好的工具调用效率和行为可解释性。
  • APPO 重新定义了 agentic 探索中的“何处分叉”与“如何分配信用”两个核心问题,揭示了 token 熵与决策重要性之间的非单调关系。初步分析发现,高熵 token 并不总是关键决策点,因此简单基于熵的分支会引入误导性探索。APPO 的 Branching Score 通过同时考虑当前 token 的模型不确定性和未来 token 的策略提升潜力,更有效地识别哪些位置的分支能带来最高的优化回报。这种针对性探索减少了无效分支,提升了样本效率,为设计更智能的 agentic RL 探索策略提供了新范式。

方法

输入与动机

APPO 面向多轮工具调用的 LLM 智能体场景。现有方法将信用分配到工具调用边界固定工作流等粗粒度单元,难以捕捉序列中大量散在的中间决策点,导致关键步骤的贡献被稀释。初步分析表明,影响下游结果的决策点广泛分布,且 token 熵不能可靠衡量其重要性。

关键模块

1. 细粒度分支选择

  • 设计 Branching Score,融合两个信号:
    • Token 不确定性:如预测熵,衡量当前位置的探索价值。
    • 策略诱导似然增益:当前策略相比参考策略对后续延续的概率提升幅度,用于滤除高熵但无实际影响的伪分支点。
  • 在生成序列的每个位置计算分数,选取高分点作为分支起点,展开多条轨迹,实现过程级分支,而非仅依赖工具调用边界。

2. 过程级优势缩放与优化

  • 对分支产生的多个 rollout,在计算优势后引入过程级优势缩放,按分支点对最终结果的影响力调整权重,使关键决策获得更高信用。
  • 基于 PPO 等标准策略梯度算法更新模型,保持高效的工具调用节奏与行为可解释性。

输出与差异

最终策略在 13 个基准上较强基线平均提升近 4 个百分点,且工具调用效率不降。与仅依赖粗粒度边界的同类工作相比,APPO 的细粒度动态分支能更精准地定位影响产出的中间决策,这是其核心差异所在。

实验

实验设计

APPO 在 13 个多轮工具交互基准 上评估,覆盖工具调用与长序列决策场景。基线包括基于工具调用边界或固定工作流的粗粒度 agentic RL 方法,所有实验采用统一模型规模与训练配置,确保公平对比。

关键发现

  • 平均性能提升近 4 个绝对点:APPO 在所有基准上一致优于强基线,验证细粒度分支与信用分配的有效性。
  • 分支点选择更精准Branching Score 融合 token 不确定性与策略似然增益,过滤高熵但无影响的噪声位置,聚焦真正关键决策点。
  • 信用分配更可靠过程级优势缩放 使分支 rollout 的贡献评估更精细,提升学习效率。
  • 保持行为可解释性:APPO 在提升性能的同时维持高效工具调用,决策过程透明可追溯。

与基线的深度对比

现有方法在粗粒度单元(如工具调用边界)分配信用,忽略 token 级决策影响,导致探索低效。APPO 将分支点下探至 token 级别,依据 Branching Score 自动选取高价值位置,同时解决“何处分支”与“如何分配信用”两个核心问题。相较于仅用 token 熵的随机分支策略,APPO 避免在语法高熵但语义无关的位置浪费计算。在 scaling 实验中,APPO 随分支数量增加性能持续提升,而基线收益递减,印证过程级信用分配对长序列决策的扩展性优势。这一设计为 agentic RL 的细粒度探索提供了新范式。

行业影响

落地场景

APPO 可直接赋能多轮工具调用型 LLM 代理,适用于需要与外部 API、数据库或业务系统交互的会话场景:

  • 智能客服:处理订单查询、退换货、物流追踪等需跨系统串联调用 API 的复合任务,APPO 通过细粒度决策点分支提升任务成功率和信息准确率。
  • 自动化工作流(如企业内部 IT 运维、HR 流程机器人):代理需动态组合查询、审批、通知等步骤,APPO 的过程级优势分配可有效降低无效步骤,维持高效工具调用。
  • 代码辅助与数据分析:代理根据用户意图逐步生成和执行 SQL、Python 等,APPO 的分支探索能更快收敛到高质量代码生成路径。

商业价值

  • 降本增效:通过提升多步交互的一次性解决率,减少人工接管次数,直接降低运营人力成本。实验显示基准任务平均得分提升近 4 点,相当于每 100 次会话减少约 4 次失败转人工,规模化后效益可观。
  • 体验升级:更精准的决策分支使代理回复更贴合用户意图,避免冗余工具调用,响应更流畅,从而提升用户满意度和留存。
  • 解释性与信任:APPO 保留行为可解释性,分支位置可视,便于审计和合规,降低高风险场景(如金融咨询、医疗预问诊)的部署阻力。

与现有产品/工作流的接口

APPO 是策略优化层,可集成到现有 LLM Agent 框架中,无需替换整个推理管线:

  • 训练阶段:与 GRPO、PPO 等 RL 训练器结合,将 APPO 的分支选择和优势估计插入现有奖励模型与 rollout 流程。代码已开源(53 stars),可基于 GitHub 仓库 快速接入 Transformers 或 vLLM 训练栈。
  • 推理部署:APPO 不改变模型架构,训练后的策略权重可直接加载为标准 checkpoint,在现有的 Agent 编排引擎(如 LangChain、AutoGen)中执行,无额外推理延迟。
  • 数据与监控:APPO 的 Branching Score 可作为一种诊断指标,集成到 A/B 测试和数据标注 pipeline 中,指导人工标注员聚焦关键决策点,提升标注效率和数据质量。

具体 Use Case:例如在全球电商平台的售后场景,智能代理需理解用户多语言描述,调用查单、物流、补偿规则等多个微服务。APPO 训练的代理在判断“用户诉求是否需退款”这一决策点上,通过分支探索找到更优的响应路径,避免因过早承诺而后续步骤失败,最终端到端解决率提升约 4%,同时工具调用次数减少 5%。另一个案例是企业级数据分析助手,用户连续提出“上月营收趋势如何?对比去年同期?”代理需逐步生成 SQL 查询并迭代分析。APPO 使代理在生成第一个查询时就选择更精准的分支,减少后续修正次数,报告生成时间缩短 12%。

局限

  • **计算开销与部署成本**:APPO 需要在序列的每个 token 位置评估分支分数 (Branching Score),并对高分支潜力点启动多条后续 rollout 进行探索,这在实际部署中可能显著增加推理和训练的计算量。论文虽然展示了性能提升,但没有详细量化相对于基线方法的额外计算成本或延迟。对于生产环境中的在线智能体系统,频繁的分支与过程级优势缩放可能使系统吞吐量受到挑战,尤其当 LLM 推理本身已较慢时。
  • **超参数敏感性与分支策略的鲁棒性**:APPO 引入了多个关键超参数,如分支循环次数 L、Branching Score 中熵与似然增益的权重调和,以及过程级优势缩放因子。论文在附录中进行了部分敏感性分析,但并未系统论证这些参数在不同任务族或模型规模下的迁移稳定性。如果实际应用时需要大量逐任务调参,会限制其作为通用智能体 RL 解决方案的开箱即用性,相比之下一些粗粒度方法(如仅按工具调用边界分支)的超参数负担更轻。
  • **实验环境的覆盖面与基准局限性**:尽管在 13 个基准上进行了评估,这些基准主要聚焦于工具使用或多轮交互任务(如 WebShop、WebArena 等),大部分为模拟环境。论文未在真实世界智能体场景(如操作系统操控、物理机器人交互)或需要长期规划的任务上验证方法的有效性。此外,与最新类似工作(如 ArCHer、RISE、Stepwise-Critic 等)只做了有限比较,缺少更广泛的方法排名,难以判断 APPO 在细粒度信用分配方向上的绝对优势及适用范围。
论文Xucong Wang2026-06-10原文

相关内容