论文

AgentOPSD: 用于智能体强化学习的递归自蒸馏

AgentOPSD: 用于智能体强化学习的递归自蒸馏

强化学习(RL) 结合可验证奖励时,通常构建轨迹级优势估计,但在长程、多轮智能体任务中,往往难以准确归因于少数关键决策。近期工作引入特权自蒸馏进行信用分配,提供更密集的监督信号,但此类局部信号如何表示序贯信用仍不清楚。 我们提出 AgentOPSD——一种无评论家、递归的回合级信用分配方法,用于智能体强化学习。AgentOPSD 将 token 级师生对数概率差距聚合为回合级证据,并在对数几率空间中递归更新贝叶斯信念状态。这产生了一种原则性的重加权方案,将稀疏结果监督转化为回合级信用信号,并通过相邻状态间的边际信念修正来识别关键回合。该方法与标准策略优化完全兼容,且无需额外评论家或额外 rollout。 我们在 ALFWorld、WebShop 和 Search-QA 上使用 Qwen2.5 模型(3B 和 7B 两种规模)进行评估。AgentOPSD 优于 GRPO 和强自蒸馏基线,在 Qwen2.5-7B 上于 ALFWorld 达到 89.1% 成功率。消融实验表明,性能提升归因于回合级聚合和依赖历史的递归信念更新。

论文精读

TL;DR AgentOPSD 通过递归贝叶斯信念更新将稀疏结果信号转化为回合级信用,无需额外 critic 与 rollouts,显著提升长程智能体任务性能。

问题

问题背景

智能体强化学习(Agentic RL)在长周期、多回合任务(如 Web 导航、具身交互)中面临稀疏奖励挑战:模型仅在交互结束后获得终局成败信号,但难以辨明过程中哪些关键行动真正决定了结果。

现有方法局限

当前主流方案——如 GRPO 等基于可验证奖励的 critic-free 策略优化——直接使用轨迹级优势估计,无法将稀疏结局信号细粒度地分解到每个决策步。虽然近期工作尝试通过特权自蒸馏(privileged self-distillation)注入局部监督,将教师模型(具有额外信息)的 log 概率作为“软标签”来指导策略,但这些方法普遍缺乏对顺序信用分配的显式建模:它们要么简单地对所有 token 施加均匀的密度约束,要么仅在 token 级聚合 log 概率差异,牺牲了回合间的时间依赖性和非线性关系,导致关键步骤的信用被稀释或误分配。

技术难点与重要性

核心难点在于:在无 critic 网络且无需额外 rollout 的前提下,如何将单一终局反馈转换为每个回合(turn)的可信信用信号?这要求方法既能捕捉策略在回合粒度上的行为变化,又能利用历史上下文进行动态、累积的合理性推断。此外,错误地将非关键回合标记为关键,可能误导策略更新方向,损害收敛稳定性。业界对此高度关注,因为精准的信用分配不仅能提升样本效率,还能为智能体的决策过程提供可解释性,对部署可靠的自主系统至关重要。

行业类比

这一问题类似自动驾驶中的端到端规划:一次成功的变道由数十个连贯动作组成,事后仅知是否发生碰撞,却需定位是哪个瞬间的判断失误(如过早加速)导致了失败——精确的帧级功劳回溯是提升模型安全性的关键。

核心洞察

  • **递归贝叶斯信用分配** 将 token 级 teacher-student log-prob 差距聚合为回合级证据,并在对数几率空间递归更新信念状态。这种方式与 GRPO 的轨迹级优势或简单 token 级自蒸馏有本质不同,因为它把稀疏结局监督转化为依赖历史的回合级密集信号,能够区分不同回合对最终结果的方向性贡献。这使得智能体在长程任务中能更准确地归因于少数关键决策,而无需引入额外的 critic 网络或新的 rollout 开销。
  • **关键回合识别** 通过计算相邻状态间的边际信念修正来实现,从而精确定位对成败起决定性作用的决策时刻。消融实验表明,AgentOPSD 的性能增益主要来自回合级聚合与历史依赖的递归更新,而非仅仅利用特权信息;在 ALFWorld 上,Qwen2.5-7B 模型成功率高达 89.1%,显著超越 GRPO 和现有自蒸馏基线。该方法完全兼容标准策略优化流程,为长程智能体任务的信用分配提供了一种原则性且易于集成的解决方案。

方法

方法流程

AgentOPSD 以回合级交互轨迹为输入,无需额外环境采样或 critic 网络。其核心是将稀疏的轨迹最终奖励转换为逐回合信用信号,用于策略优化。

关键模块

  1. 回合证据聚合:从 token 级 teacher-student log-probability 差值(教师模型与当前策略的 log 概率比)出发,将每个回合内的 token 级差异聚合成一个标量“证据”,衡量该回合对最终结果的贡献方向与强度。
  2. 贝叶斯信念递归更新:在 log-odds 空间维护一个隐式信念状态,该状态编码了截至当前回合对最终成功/失败的累积证据。每收到一个新回合的证据,就通过 Bayesian 更新公式递归刷新信念,自然融入了历史依赖,而非独立看待各步。
  3. 关键回合识别与优势重塑:比较连续两回合间的信念修正量(marginal belief revision),若修正量显著,则该回合被识别为关键决策点。通过 Bounded Advantage Reshaping 将信念状态映射为带符号的信用信号,并对原始策略梯度的优势项进行重加权,使关键回合获得更高幅度的更新。

输出

输出为回合级的信用加权优势,可直接嵌入 PPO 等策略优化框架,替换传统稀疏奖励或 GRPO 的轨迹级优势,使训练信号密度大幅提升。

与同类方法的差异点:不同于 GRPO 仅凭轨迹级标量构造优势、或 OPSD 简单的自我蒸馏平均,AgentOPSD 通过贝叶斯递归实现动态、历史敏感的信用分配,无需 critic 即可将结果归因到少数关键回合。

实验

实验设计

AgentOPSD 在三个长序列多轮交互式任务上评估:

  • ALFWorld(具身指令跟随)
  • WebShop(在线购物导航)
  • Search-QA(多跳检索问答)

使用 Qwen2.5 系列模型(3B 和 7B 规模),以 GRPO(群组相对策略优化)和多种自蒸馏强化学习基线(如 OPSD、StepOPSD、GRPO+OPSD)作为对比。所有方法均采用可验证二元结局奖励,不依赖过程监督。AgentOPSD 不需要额外的 critic 网络或额外采样,通过递归贝叶斯信念更新将稀疏结局信号转化为轮次级信用信号。

关键发现

  1. 显著超越强基线:在 ALFWorld 上,AgentOPSD 以 Qwen2.5-7B 达到 89.1% 成功率,明显优于 GRPO 及同类的特权自蒸馏方法;差距随交互轮次增加而扩大,证明方法对长程信用分配的有效性。
  2. 增益来源明确:消融实验揭示,性能提升归功于 轮次级聚合(turn-level aggregation)与历史依赖的递归信念更新,而非单纯的特权信息访问。
  3. 通用性:在 WebShop 与 Search-QA 上同样取得一致提升,表明方法对多样化 agentic 环境具有鲁棒性。

与基线的深度对比

传统 GRPO 使用轨迹级优势,无法区分少数关键决策;OPSD 等自蒸馏方案虽然提供更密集的局部监督,但未能合理表达序列信用。AgentOPSD 的创新在于:

  • 通过对数概率差聚合为轮级证据,并维持一个对数几率空间的贝叶斯信念状态,动态重加权每个轮次的重要性。
  • 这一设计使得信用分配既与结局对齐,又依赖于历史状态变化,能够识别出真正的关键轮次(边际信念修正大的 step)。
  • 与需要额外 critic 的 Actor-Critic 方法相比,该方法完全兼容标准策略优化流程,工程落地门槛低;与 StepOPSD 等直接使用 local signal 的方法相比,递归更新避免了对局部信号的简单加权,从而在长程任务中更稳定。

行业影响

落地场景

AgentOPSD 提供了一种稀疏奖励下精准分配长序列决策信用的方法,直接适用于多轮交互的 GUI 代理(如 Web 导航、移动端操作)、对话式任务完成(客户服务、个人助理)和工具调用型智能体(代码执行、API 编排)。典型业务包括电商平台的自动购物助手(类似 WebShop 场景)、知识检索与问答系统(类似 Search-QA)、以及物理环境仿真操作(类似 ALFWorld)。这些场景的共同点是:任务由一连串动作构成,只有最终结果有明确成功/失败反馈,中间步骤缺乏密集监督。AgentOPSD 通过无 Critic 的递归信用分配,能从端到端的结果中识别出关键决策回合,使其成为训练和优化长序列智能体的实用组件。

商业价值

  • 降低标注成本:无需人工标注中间步骤的质量,仅需最终结果奖励(如订单完成、问题解决),大幅减少数据标注投入。
  • 提升模型产投比:与现有策略优化算法(如 PPO、GRPO)完全兼容,可在不增加额外 rollout 或 Critic 网络的前提下提升成功率(如在 Qwen2.5-7B 上将 ALFWorld 成功率推至 89.1%),这对于追求高任务完成率的商业智能体(如自动客服、流程自动化)直接意味着服务交付质量和自动化率的跃升。
  • 加速迭代:方法计算轻量,不依赖价值函数近似,训练更稳定、收敛更快,有利于快速试错和模型更新。

现有工作流集成

AgentOPSD 的设计天然适合插入到基于策略梯度的 RL 训练管线中。它可以在在线采样后,利用已有的教师模型(如 SFT 教师或上一代策略)和学生模型的对数概率差异,计算出回合级优势估计,再喂入策略更新步骤。不需要额外的 Critic 网络或独立的评估阶段,因此可以与主流 RLHF/RLAIF 框架(如 TRL、OpenRLHF)结合,作为信用分配的重参数化模块。在部署上,只需要在训练循环中添加一个轻量级的递归信念状态更新模块,对推理管线完全透明,不会增加线上延迟。

具体落地案例

  1. 电商智能购物助手:用户在对话中提出模糊购物需求(“帮我找一款适合送礼的咖啡机”),智能体需多轮搜索、筛选、比较,最终下单。只有当订单成功生成时才有正向奖励,中间哪些搜索词、点击行为是关键决策难以分辨。AgentOPSD 可自动识别出“添加价格筛选”“查看评价详情”等转折点,让模型学习到更优的搜索策略,提升首单成功率,降低人工接管率。

  2. 企业 RPA 与流程自动化:在发票处理、合同审核等长流程中,智能体需跨多个系统操作,最终以“任务完成”为信号。通过 AgentOPSD 分配信用,能找出哪些系统交互步骤对最终结果影响最大,从而优化流程步骤的鲁棒性和执行顺序,实现更可靠的无人工介入流程自动化。

局限

  • **依赖教师模型质量**:AgentOPSD 建立在特权自蒸馏之上,需要教师模型提供令牌级对数概率作为监督信号。教师模型的选择直接影响信用分配的质量,若教师模型能力不足或与任务不匹配,可能导致误导性奖励信号。论文未探讨教师模型规模或类型的影响,也未提供在教师模型较弱时的鲁棒性分析。这限制了方法在资源受限或教师模型不可用场景下的应用。
  • **递归更新对长序列的稳定性**:方法使用贝叶斯信念递归更新,并引入证据衰减 γ 来避免过度依赖历史。然而,非常长的交互序列(如数十轮以上)可能导致信念漂移或超参数敏感性增加。消融实验虽然分析了 γ 的影响,但只在三个基准上测试,这些基准的轮数有限。对于扩展到更复杂的多轮对话或长期规划任务,递归更新的稳定性和超参数调优可能成为瓶颈。
  • **评估范围有限**:实验仅在 ALFWorld、WebShop 和 Search-QA 上进行,模型为 Qwen2.5-3B/7B,未涉及更大参数模型(如 13B、70B)或更多样化的智能体任务(如代码生成、工具使用)。也未与基于批评家的方法(如 PPO with value function)进行直接比较,无法全面评估在各类任务中的优势。此外,数据集可能偏向于特定类型的决策任务,泛化到真实世界代理场景仍有待验证。
论文Zi-Han Wang2026-08-06原文

相关内容