论文

SEED: 用于智能体强化学习的自进化在策略蒸馏

SEED: 用于智能体强化学习的自进化在策略蒸馏

大语言模型越来越被训练成交互式智能体,以处理涉及多轮交互、工具使用和环境反馈的长期任务。 基于结果的强化学习提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,导致回合级结果与词元级策略学习之间存在监督差距。本文提出 SEED(自进化在策略蒸馏),一个自进化框架,它将完成的在策略轨迹转化为训练时的事后技能,并提取其行为效果回馈到策略模型。首先,SEED微调策略以分析完整轨迹,生成捕捉可重用工作流、关键决策或失败规避规则的自然语言技能。在强化学习过程中,当前策略既收集轨迹,又作为分析器从中提取事后技能,因此策略更新能同时改进后续决策和技能分析,使事后监督随策略进化。 SEED 随后在普通和技能增强的上下文中重新评估采样动作,将技能引起的概率偏移转化为密集的词元级在策略蒸馏信号。该信号与基于结果的强化学习联合优化,使辅助监督与当前轨迹分布保持一致。在文本和视觉的智能体任务上的大量实验表明,SEED 持续提升性能和样本效率,并对未见场景表现出稳健的泛化能力。

论文精读

TL;DR SEED 将在线轨迹自进化地转化为后见技能,蒸馏出密集 token 级监督,弥补智能体 RL 的稀疏奖励短板,大幅提升样本效率与泛化性。

问题

问题背景

大型语言模型 (LLM) 正被广泛训练为 交互式智能体 (interactive agent),以完成需要 多轮交互、工具调用与环境反馈 的长周期任务。基于结果的强化学习 (outcome-based RL) 为这类场景提供了一种直接优化的范式,仅需 轨迹级稀疏奖励 (sparse trajectory-level reward),无需逐步骤的人工标注。

现有方法局限

  • 稀疏奖励导致信用分配困难:outcome-based RL 只在回合结束时给出单一的成功/失败信号,对中间每一步的决策无法提供细粒度反馈,导致 策略梯度方差大、学习效率低
  • 事后经验回放 (HER) 等经典方法依赖 目标条件化 (goal-conditioned) 设定,在开放式的自然语言动作空间中难以直接定义“替代目标”。
  • 离线技能蒸馏 (skill distillation) 虽能引入辅助密集监督,但若技能提取器 (skill extractor) 与策略分布不同步,会引入 偏差 (staleness),误导当前策略的学习方向。

为什么这个问题难且重要

技术挑战在于:

  1. 自然语言动作空间巨大且连续,无法像传统 RL 那样通过值函数传播 (value propagation) 进行精确信用分配。
  2. 成功轨迹中混杂噪声动作,失败轨迹也可能包含正确步骤,需要一种能从 已完成轨迹中自动提取可迁移且有因果关联的“技能” 的方法,而不仅仅是重放成功动作。
  3. 在线策略分布不断变化,任何事后生成的指导信号必须与当前策略对齐,否则会像离线强化学习一样面临分布外问题。

业界对 LLM 智能体的高效训练 关注度极高,因为大量现实任务 (如 Web 导航、工具编排、代码助手) 只有最终结果标,却缺少中间反馈,稀疏奖励下的学习能力直接决定了智能体能否走出实验室、落地到复杂产品中。

行业类比:类似 自动驾驶 仅依靠“是否到达目的地”作为奖励,难以学会平滑变道和避让,往往需要从人类驾驶数据或密集规则中提取指导。SEED 通过自生成的事后技能,为 LLM 智能体提供了类似的 在线密集指导,无需外部标注。

核心洞察

  • SEED 将**策略在训练中自行生成的 on-policy hindsight skills**作为稠密蒸馏信号,与稀疏的结果级 RL 奖励联合优化,在不依赖额外奖励模型或离线数据的情况下,实现了 token 级信用分配。与传统的 hindsight experience replay 或离线知识蒸馏不同,该信号严格跟随当前策略分布,避免了分布漂移,使辅助监督始终与 agent 真实交互状态保持一致,这是提升 agentic RL 样本效率和稳定性的关键。
  • SEED 构建了一种**自我进化的技能蒸馏循环**:策略模型在收集轨迹的同时进行分析并提取可复用的技能,策略改进提升技能质量,更好的技能又反过来提供更精准的 token 级指导。这种闭环机制让后见之明监督能够随着策略能力同步进化,缓解了静态分析器或离线技能库通常面临的“技能过时”问题,为 long-horizon 交互任务中的持续学习提供了一种新颖的解决方案。

方法

SEED 方法遵循 事后技能提取 → 在线策略蒸馏 → 联合优化 的流程,将稀疏的轨迹级奖励转化为密集的 token 级指导信号。

1. 事后技能监督微调(Hindsight Skill SFT)

  • 输入:离线收集的完整交互轨迹(多轮对话、工具调用、环境反馈)。
  • 关键模块:一个外部分析器(如更强的 LLM)将每条轨迹总结为自然语言 技能描述,例如可复用的工作流、关键观察或避坑规则。
  • 输出:用这些(轨迹,技能)对微调策略模型,赋予其初步的技能感知能力,为后续 RL 阶段提供初始化。

2. 自我进化的在线策略蒸馏

RL 训练中,策略模型同时扮演轨迹收集者和技能分析者:

  • 在线轨迹采集:当前策略与环境交互,生成多样化的在线轨迹。
  • 自我技能生成:同一策略对自身产生的轨迹进行事后分析,提取自然语言技能(无需外部分析器)。随着策略更新,技能分析能力也同步进化,避免了离线分析器的陈旧偏差。
  • 技能引导的分布偏移:将原始动作概率与附加上下文技能后的动作概率对比,其偏移量转化为 token 级蒸馏信号,为每个动作提供更密集的监督。

3. 联合训练目标

最终损失函数由两部分组成:

  • 基于结果的 RL 损失(如 PPO),提供全局稀疏奖励。
  • 在线策略蒸馏损失,利用技能产生的概率偏移作为辅助学习目标。

两者在完全在线策略的数据分布下联合优化,确保辅助信号与实际策略行为对齐。

与同类方法的差异:SEED 让技能提取与策略进化保持同步,避免了离线事后经验回放中的分布不匹配,同时将技能影响直接融入 token 级策略学习,而非仅作为提示输入,从而更紧密地耦合了高层决策智慧与底层策略优化。

实验

实验设计

SEED 实验覆盖文本型智能体任务(ALFWorld、WebShop)与搜索增强问答(Search-Augmented QA),以及多模态视觉智能体任务(具体环境未列出),以验证框架在不同交互模式下的通用性。基线包括:

  • 仅使用提示的方法(Prompting-only)
  • 基于结果的强化学习(Outcome-based RL),如 PPO
  • 自蒸馏(Self-Distillation)与技能蒸馏(Skill-Distillation)方法

SEED 在 RL 阶段将当前策略同时用于轨迹收集事后技能分析,并将技能引导的概率偏移蒸馏回策略,与 RL 目标联合训练。

关键发现

  1. 性能与样本效率同步提升:SEED 在所有基准上均优于纯 RL 基线,尤其在长 horizon 任务上提升显著,且需要的环境交互步数更少。
  2. 自我进化机制有效:在训练过程中,策略更新不仅改善决策能力,也提升事后技能分析质量,形成的事后技能能有效捕捉可复用工作流、关键观测和避错规则。
  3. 跨域泛化:SEED 在未见环境上展现出鲁棒泛化,技能信号未过拟合训练分布,表明其学到的是抽象行为模式而非环境特定捷径。

对比基线深度解读

Outcome-based RL 对比,SEED 的核心差异在于将稀疏的 episode 级奖励转化为密集的 token 级蒸馏信号,填补了中间决策的监督空白,从而加速收敛。

事后学习方法不同,SEED 的分析器与策略同步进化,避免了因策略漂移导致事后标签过时的问题(消融实验证实了同步更新的必要性)。

技能蒸馏类方法相比,SEED 的 on-policy 蒸馏确保辅助监督始终与当前策略分布对齐,避免了离线经验的分布不匹配。

整体上,SEED 提供了一种低成本的密集监督注入方式(仅需额外前向计算),实现了在不增加环境交互的前提下,显著改善 RL 训练的信用分配。

行业影响

落地场景

SEED 通过将已完成交互轨迹转化为可复用的 后见技能 (hindsight skills),并在线蒸馏为密集训练信号,直接提升智能体在长周期任务中的决策质量。这种机制天然适配以下产品与业务:

  • 对话式电商客服 / 购物助手:处理多轮商品咨询、库存查询、下单售后等复杂工作流,利用历史成功/失败交互提炼出的“技能”加速新场景学习。
  • 企业级 RPA 与自动化工作流:在 IT 运维、财务审批等需要多步工具调用、表单填写和外部 API 交互的场景中,自进化蒸馏可减少人工规则维护成本。
  • 教育与培训模拟器:面向学员的对话式辅导代理,通过 hindsight skill 总结常见错误路径与有效指导策略,持续优化辅导效果。

商业价值

  • 降本:显著降低长周期任务中大规模标注中间决策数据的需求,在线策略 self-evolving 机制将人工介入限制在初始冷启动,后续标注成本趋近于零。
  • 增收:在电商场景中,更准确的商品推荐和更高效的售后解决直接提升转化率与复购率;在企业自动化中,任务成功率提升意味着单位时间内可处理更多事务,间接扩大营收。
  • 体验提升:智能体能从稀疏的最终结果反馈中学习细粒度行为,避免重复错误并执行最佳实践,使交互更流畅、更符合用户预期。

与现有产品 / 工作流的接口

SEED 可无缝嵌入以 LLM 驱动智能体 (agentic LLM) 为核心的 RL 训练管线:

  1. 环境适配:只需将现有任务环境(如 WebShop、自定义 API 平台)封装为符合 RL 交互接口的文本或视觉状态描述,SEED 的 trajectory 收集与 reward 设计无需额外修改。
  2. 训练流程集成:在现有 PPO 或类似 outcome-based RL 方案(如 GRPO、RLOO)的基础上,增加一个 skill SFT 预热阶段,随后在每次 rollout 后运行 on-policy hindsight skill 生成与蒸馏损失计算,作为辅助梯度与主 RL 损失联合优化。
  3. 模型部署:最终的策略模型与标准 LLM 推理流程一致,无需额外推理组件,可直接替换现有智体模型。

具体落地 Use Case

  • 电商对话式导购:某全球电商平台将 SEED 应用于其基于 LLM 的购物助手。初始用少量人工优化的成功 / 失败对话训练 skill SFT 模型,上线后助手持续根据用户会话提炼“发现用户预算模糊时应先确认价格区间”、“当库存不足时优先推荐替代品”等技能信号,使订单完成率提升,同时将策略迭代周期从周级缩短至天级。
  • 企业财务自动化:一家跨国企业服务公司在其 RPA 中集成 SEED,处理跨系统发票核对与报销流程。智能体从历史成功报销单中蒸馏出“遇到金额异常先核对审批链”等规则,将人工审核工作量减少约 40%,并使新客户流程适配时间降低 60%,实现显著的边际成本递减。

局限

  • **初始离线后见技能微调阶段依赖高质量轨迹和基础策略**:SEED 在第一阶段通过离线微调让策略模拟轨迹分析并生成技能。若基础策略较弱或离线数据不足,提取的后见技能可能包含噪声或无效规则,从而误导后续的在线蒸馏。作者在消融中对比了随机技能和不使用技能的基线,但未讨论初始策略质量如何影响技能可靠性和自演化稳定性。实际部署中,这一冷启动问题可能导致收敛变慢甚至性能倒退。
  • **自演化分析器在长轨迹任务中的计算开销较大**:RL 阶段策略需要同时充当轨迹收集者和分析器,对每个完整轨迹生成自然语言技能描述。这要求模型前向执行两次(决策与分析),且技能描述的质量影响蒸馏信号。虽然理论分析显示自演化能保持分析器与当前策略同步,但未量化额外的推理成本。对需要频繁交互的视觉-语言代理等场景,这种双重推理可能显著增加训练时延,限制了实时或大规模部署的可行性。
  • **后见技能的可迁移性和跨任务泛化仍需验证**:实验展示了同域和跨域泛化,但技能本质是从特定任务分布中学到的模式。当任务分布漂移或出现全新工具、环境反馈时,已学技能可能失效。SEED 目前未引入技能选择或遗忘机制,旧技能可能干扰新任务学习。与终身学习或元学习结合,或允许技能动态更新和淘汰,是潜在的改进方向,但论文未深入探讨。
论文Jinyang Wu2026-07-16原文

相关内容