StepPO: 基于步骤对齐策略优化的智能体强化学习
智能体强化学习正成为提升大语言模型智能体能力的关键后训练范式。然而,现有的 RL 算法大多沿用 token 中心范式(如 RLHF、RLVR),以 token 为基本单元进行建模与优化。这导致 智能体 RL 的粒度不匹配:模型在 token 层面优化预测,而智能体却通过“观察-行动”循环做出 步骤级决策。 为解决这一问题,本文提出 StepPO,一种 步骤中心范式。其核心是将 token 级马尔可夫决策过程重新建模为 步骤级 MDP,以交互步骤为轨迹基本单元;并设计 步骤级信用分配,使策略优化与智能体决策的自然粒度对齐。StepPO 在多轮智能体-环境交互中实现步骤级策略优化。 实验覆盖多跳问答、学术论文搜索和文本世界行动任务,StepPO 持续优于多种 RL 算法。进一步分析揭示了步骤中心范式如何改善智能体训练,为理解智能体行为及训练更强大的 LLM 智能体提供了实用路径。
论文精读
TL;DR StepPO 将智能体强化学习从 token 级 MDP 重构为步骤级 MDP,以步骤级信用分配对齐策略优化与决策粒度,在多轮交互任务中一致超越现有 RL 方法。
问题
领域背景
让 LLM 作为 智能体 (agent) 在多轮交互中完成规划、工具调用和决策,已成为提升 LLM 实际应用能力的关键方向。智能体强化学习 (agentic RL) 正在成为这类场景的核心后训练范式,目标是在环境反馈中优化策略,提升任务成功率。
现有方法的局限
当前 agentic RL 普遍沿用 RLHF / RLVR 的 token 中心范式 (token-centric paradigm),将模型输出视为扁平 token 序列,以每个 token 作为 MDP 的最小决策单元。这种做法至少带来三个问题:
- 粒度错配 (granularity mismatch):agent 的实际决策发生在 步骤级 (step-level)——一次完整的思考-观察-动作循环,但优化却作用于 token 级,导致策略梯度无法精准对应动作的影响;
- 信用分配偏差:token 级奖励(如 KL 惩罚、序列末任务奖励)无法反映中间步骤对最终结果的贡献,容易让 agent 只学到表面 token 分布,而非规划能力;
- 训练低效与不稳定:多轮交互中 token 数量极大,这种扁平序列使长程 credit assignment 问题更严重,PPO 等算法常出现发散或高方差。
技术挑战与重要性
将优化粒度从 token 升级到 step 并非简单聚合,原因在于:步骤边界自动化识别与步骤级回报估计高度依赖任务结构;同时,step-level MDP 的构建必须兼容现有 RL 训练系统,避免引入过高计算开销。业界对复杂任务 agent(如多跳 QA、深度研究、 text-world 行动)的要求越来越高,原始的 token 级 RL 很难让模型学习到“何时调用工具”“如何根据观察调整计划”等高层决策。因此,设计一个 与 agent 决策粒度对齐的优化范式,成为提升 agent 训练效果的关键瓶颈。
行业类比
这类似于在对话系统中,以对话轮次 (turn-level) 而不是每个 token 来建模对话策略——更能直接优化系统行为的整体一致性。
核心洞察
- token-centric 范式的粒度错配是 agentic RL 训练低效的关键瓶颈。传统 RLHF/RLVR 以 token 为基本优化单元,但 LLM agent 的决策本质是 step 级(多轮交互的观察-行动循环),token 级信度分配会将单个 step 内的所有 token 错误地同等对待,导致奖励信号的传播与 agent 实际决策结构脱节。StepPO 通过将 MDP 重新定义为 step 级,直接对齐优化粒度与决策粒度,避免了跨 token 的噪声累积,这是与 PPO/GRPO 等现有算法最根本的差异。
- step 级信用分配(step-level credit assignment)将环境奖励精确归因到每个交互步,消除了 token 级方法中基于启发式(如单词似然度)进行分配所引入的偏差。StepPO 让策略梯度直接反映 step 的贡献,而不依赖预处理的价值函数或人工设计的 token 级奖励分解,使得 agent 能够更清晰地学习到哪些行动步骤导致了任务成功,尤其在长程决策任务中显著提升了样本效率。这一步级优化视角比 GSPO/GiGPO 等近期尝试更彻底,因为它从 MDP 定义层面就切断了 token 级建模的依赖。
方法
输入:多轮交互轨迹
StepPO 的输入是 agent 与环境多轮交互的原始轨迹,每个轨迹由一系列 交互步骤(interaction steps) 构成。每一步包含 环境观测(observation)、agent 的 思考与动作(thought & action) 以及可选的 工具调用结果。这些步骤天然对应 agent 做出决策的粒度,避免了 token 级建模的信息碎片化。
关键模块:Step‑Aligned 建模、表示与信用分配
Step‑Level MDP 重定义
StepPO 将 agentic RL 从传统的 token‑level MDP 重新形式化为 step‑level MDP。状态为历史步骤序列与当前环境反馈,动作为 agent 在单步中生成的完整文本块(含思考/工具调用),奖励为轨迹结束后根据最终结果计算的标量回报。此举使策略优化单元与 agent 决策单元对齐。Step‑Level 轨迹表示
不再将轨迹展平为无结构的 token 流,而是维护 step‑wise 序列:(s1, a1, r1, o1), (s2, a2, r2, o2), ...。该表示天然支持跨步骤的依赖性建模和分层信用分配。Step‑Level Credit Assignment
核心是 step‑level actor objective。不采用 token‑level 的逐 token KL 惩罚或平均奖励分配,而是对每个 step 计算一个 步级优势估计(step‑wise advantage),并据此加权该步生成动作的对数概率。具体而言,对整条轨迹仅赋予一个最终奖励,然后通过时间差分或蒙特卡洛方式将回报分解到各个 step,使得早期关键步骤能获得更高赋值。策略梯度在每个 step 上独立计算,但梯度累积时保留 step 边界——这与 GAE/PPO 在 token 粒度上广播奖励值形成鲜明对比。训练系统优化
采用 step‑native data representation 直接存储结构化步骤数据,避免 token 化后再还原的冗余。数据管理模块支持 异步训练,解耦 rollout 生成与策略更新,提升 GPU 利用率。计算效率优化包括对长轨迹的 step 级缓存与批量处理,显著降低显存占用(原文报告训练效率提升 ~2‑3×)。
输出:Step‑Aligned 策略
最终输出一个在 step 粒度上优化的 LLM agent 策略,能够在多轮交互中更高效地归因决策贡献,避免 token 级优化带来的信用稀释或噪声。
差异点
StepPO 与 DPO/PPO/GRPO 等 token‑centric 方法的根本区别在于:它不是优化每个 token 的条件概率,而是优化每个交互步骤的完整决策,从而让信用分配与 agent 的行为粒度自然对齐,解决了 LLM agent 训练中长期存在的粒度失配问题。
实验
实验设计
实验在四种多轮交互任务上评估 StepPO:Multi-hop QA、Academic Paper Search、ALFWorld 和 WebShop。基线包括基于 ReAct 提示的零样本方法以及多种强化学习算法:PPO、Reinforce++、GRPO、RLOO、GSPO 和 GiGPO。所有方法统一采用 Qwen2.5-7B 作为基础语言模型,训练细节与环境构建见附录。
关键发现
StepPO 在所有任务上一致优于所有对比方法,验证了步级策略优化的有效性。消融实验表明:① 步级信用分配对性能贡献显著;② 步级 MDP 建模比传统 token 级 MDP 更适合 agent 任务。训练动态分析显示 StepPO 的奖励曲线上升更稳定,方差更低,证明步级优化能更准确地分配信用。步级难度分析进一步揭示 StepPO 在复杂步骤上的优势更明显,表明其能有效捕捉 agent 决策中步骤间的依赖关系。
与基线对比解读
与 token 级 RL 方法(如 PPO、GRPO)相比,StepPO 的核心区别在于将环境交互的每一步作为一个决策单元,而非以 token 为单位进行优化。这种粒度对齐使得信用分配更自然:当轨迹奖励回传时,StepPO 按步分配,避免了 token 级方法中信号被稀释或错误累积的问题。相较于同为步级优化的 GSPO,StepPO 的步级 MDP 形式化更为系统,且增加了显式的步级信用剪枝,能更精确地识别失败步骤,减少无效探索。在需要多步推理和工具使用的场景(如 Academic Paper Search)中,StepPO 的提升幅度往往更大,说明步级范式更适应复杂交互环境。
行业影响
落地场景
StepPO 提供的 step-level policy optimization 与 step-level credit assignment 直接适用于多轮交互的 LLM Agent 产品。典型场景包括:
- 电商购物助手:处理多步商品筛选、比价、下单,每一步依赖前一步的环境反馈(搜索结果、库存)。
- 企业 IT 运维 Agent:自动排查网络故障,通过多轮命令执行与日志分析逐步定位问题。
- 学术研究辅助:论文搜索与信息提取,Agent 需循环查询数据库、阅读摘要、筛选文献。
- 代码助手:多步重构或调试,根据解释器输出决定下一步修改。
这些场景的共同点是 Agent 的行为粒度是 step 而非 token,现有 token 级 RL 方法(PPO/GRPO)会因粒度不匹配导致次优策略。StepPO 从训练层面解决了这个问题,使 Agent 能更稳健地完成长程任务。
商业价值
StepPO 带来的价值侧重于 降本与体验提升:
- 成功率提升:在 Multi-hop QA、ALFWorld 等任务上,StepPO 一致优于 token-centric 基线,意味着更少的无效交互与人工干预,直接降低运营成本。
- 工具使用效率:step 级信用分配抑制了不必要的工具调用,缩短推理路径,减少 API 调用费用与延迟。
- 训练数据效率:step 级表示天然适合异步训练与数据管理,提升训练吞吐量,加速模型迭代。
对商业产品而言,更高的任务完成率与更低的每次交互成本可直接转化为更优的单价模型或更好的用户留存。
与现有产品 / 工作流的接口
StepPO 可作为现有 LLM RL 训练管线的 即插即用增强组件:
- 数据层:只需将交互轨迹从 token 序列转化为 step 序列(每个 step 包含 observation + action),现有 RL 框架(如 OpenRLHF、veRL)可适配。
- 算法层:StepPO 的 step-level actor objective 与 value function 可与 PPO、GRPO 等算法正交融合,作为信用分配模块替换原有 token 级 reward 累积。
- 工程化:论文提出的 step-native data representation 与 asynchronous training 设计参考了主流分布式训练模式,可直接集成进现有的 Ray、Kubernetes 编排的 RL 平台。
具体落地 Use Case
1. 电商购物助手
用户在对话中提出“帮我找一款适合跑步的无线耳机,预算 200 美元”。Agent 需要:① 搜索商品;② 读取评价;③ 对比参数;④ 给出推荐并生成购买链接。每一步成功与否会影响后续决策。Token 级 RL 容易对单个 token 给予错误信用(例如“搜索关键词”中某个 token 对最终奖励的贡献被高估),导致 Agent 过度优化关键词而非整体策略。StepPO 将 credit 分配到 step 上,能让模型学会“当搜索结果不理想时,换用更具体的查询词”,而非盲目堆砌 token。训练后,Agent 的任务完成率提升,减少无效搜索轮次,直接降低搜索 API 成本与用户等待时间。
2. 企业 IT 运维自动化工单处理
员工提交“无法连接公司 VPN”的工单,Agent 自动执行:① 查询设备网络配置;② ping 网关;③ 检查 VPN 服务器状态;④ 根据结果重启客户端或重置配置。StepPO 通过对 step 级信用(例如“重启客户端”这一步骤的成功与否)进行优化,使模型学习到在特定错误码下直接重启,而非反复尝试 ping 浪费步骤。集成的训练管线可复用企业已有的工单日志数据,将日志切分为 step 轨迹,使用 StepPO 微调现有 LLM,即可得到更可靠的自动化 Agent。
局限
- StepPO依赖环境提供明确的步骤边界,对缺失自然离散步骤的交互任务(如开放式对话)适用性有限。在连续动作空间中,步骤粒度的定义本身存在歧义,可能导致策略优化不稳定。此外,步骤级MDP的建模假设每个步骤内仍为token级自回归生成,但步骤间的状态转移需要额外的环境反馈,这增加了系统与环境的耦合,限制了在离线数据或模拟环境不完善场景下的应用。
- 论文虽然提出了异步训练设计来优化效率,但步骤级信用分配(step-level credit assignment)需要维护步骤级别的价值估计,可能引入额外的计算和内存开销。在长轨迹任务中,步骤数量的增长会放大这种开销,而论文未与最优的token级方法(如GRPO、GSPO)作严格的效率对比,这使得工程落地的性价比存疑。
- 实验主要在Multi-hop QA、学术搜索、ALFWorld等相对封闭的智能体基准上进行,未验证StepPO在更广泛的开域推理任务(如数学、代码、工具组合)上的有效性。骨干模型仅限于7B规模的LLM,缺乏在大模型(如70B+)上的扩展性分析,因此对大规模生产场景的参考价值有限。同时,与最近提出的分层RL方法(如ArCHer)缺乏对比,新颖性边界不够清晰。