论文

SkillRise: 面向跨任务技能演化的智能体强化学习

SkillRise: 面向跨任务技能演化的智能体强化学习

大型语言模型智能体经常遇到相关但不同的任务,这些任务共享可重用的解决方案模式。然而,标准的智能体强化学习将任务视为独立的片段,而现有的技能学习方法要么专注于对一个任务的重复尝试,要么使用多阶段的流水线,将提取、检索和执行纠缠在一起。 我们提出 SkillRise,一个用于跨任务学习技能的统一强化学习框架。SkillRise 将相关实例组织成逐渐具有挑战性的序列,并使用单一策略交替进行任务求解和技能文档策展,该技能文档直接传递给下一个任务。解耦的信用分配通过当前任务结果监督求解,通过折扣的后继下游结果监督策展。 在 ALFWorld、WebShop 和 ScienceWorld 上的实验表明,SkillRise 在所有对比方法中实现了最强的 Pass@1 性能,相比最强基线提升了 2.3 到 8.5 个百分点。尽管在不同任务上训练,其学到的策展策略在相同任务的重复尝试中仍然有效。进一步分析揭示了测试时跨任务的扩展性:即使每个任务只尝试一次,随着相关任务序列变长,性能也会提升。这一趋势表明 SkillRise 跨任务重用可迁移技能,而非受益于同一任务的重复采样。 SkillRise 在显著降低多阶段技能学习流水线的运行时开销的同时,保持强劲性能。总之,这些结果为 LLM 智能体提取、精炼和重用跨任务可迁移技能提供了一种简单高效的训练范式。

论文精读

TL;DR SkillRise 将多个相关任务组织成难度递增序列,用单一策略交替解决问题并维护一份可进化技能文档,通过解耦信用分配让技能在任务间迁移,在多个基准上 Pass@1 显著超越最强基线。

问题

问题背景

LLM 智能体在真实环境中执行任务(如 Web 导航、具身操作)时,常面临相关但不同的任务序列,这些任务共享可复用的解决模式。当前智能体强化学习(agentic RL)的主流方法专注于单个任务实例的优化,缺乏跨任务技能积累的机制,限制了泛化与效率。

现有方法局限

  1. 独立片段训练:Standard RL(如 ReAct、Reflexion)将每个任务视为独立 episode,完全忽略跨任务的知识迁移,导致在相似任务上反复试错。
  2. 单任务内学习:部分技能学习方法(如 Expel、Voyager)从同一任务的多次重试中提炼经验,但局限在任务内,无法泛化到新任务。
  3. 多阶段管道:其他方案(如 DEPS、ExpeL)采用“提取 → 检索 → 执行”的分阶段流水线,将技能学习与任务执行耦合,带来额外的检索开销与超参数调优负担,且技能库的静态更新难以适应任务流分布的变化。
  4. 信用分配缺失:跨任务场景中,早期技能的收益需要到下游任务才能体现,现有方法缺乏解耦的信用分配(decoupled credit assignment),难以区分技能对当前任务与未来任务的贡献。

技术挑战与业界关注

跨任务技能学习的核心难点在于:

  • 长程信用分配:RL 智能体必须学会在连续任务中,哪里以及何时记录经验,并评估其对后续任务的价值,这涉及折扣远期收益的设计。
  • 动态技能演化:技能文档需在推理过程中持续更新(curation),而非固定检索,这对策略的规划与文本生成能力提出高要求。
  • 训练-推理效率平衡:既要保持跨任务滚出的可扩展性,又要避免多阶段管道带来的大量运行时开销。工业界对 LLM 智能体的持续学习与部署成本高度敏感,这一方向直接关系到自主代理的实用化。

行业类比

类似软件工程中构建可复用库:智能体在解决连续性任务时,自动提炼可迁移的“代码片段/设计模式”,后续任务直接引用,而非每次从零实现,显著提升团队整体产出效率。

核心洞察

  • SkillRise 的核心是将跨任务技能学习形式化为单一策略的交替过程,并通过解耦信用分配,让策略学会在解决当前任务与提炼可迁移技能之间动态平衡。这与现有工作(多阶段管线或单一任务重复尝试)不同,它直接将技能文档传递到下一任务,无需检索融合,大幅简化了架构并提升效率。该设计使得技能进化内嵌于任务流中,真正实现了从经验中持续学习。
  • 测试时跨任务扩展现象揭示了模型的真实泛化能力:在固定预算下,即使每个任务只尝试一次,更长相关任务序列依然带来性能增益。这区别于传统依靠同一任务多次采样的提升方式,证明策略提取的技能具备跨任务可迁移性。这一发现为构建持续积累知识、无需巨额重试成本的自主智能体提供了新方向。

方法

框架概览

SkillRise 将多个相关任务组织成难度递增的序列,用一个统一的策略同时完成任务求解和技能文档的管理。该策略在每一步交替执行两种动作:针对当前任务输出动作,或更新一份可跨任务传递的“技能文档”。文档中记录着可复用的经验、教训或子策略,作为下一任务的额外上下文输入。

跨任务序列构建

训练前,系统从任务池中采样若干相关实例,按预估难度从易到难排列,形成一条跨任务轨迹。困难度度量可基于历史成功率或任务长度。

跨任务 Rollout 与技能演化

策略每面对一个新任务,首先读取当前技能文档,然后进行多步交互。在任意时刻,策略可以选择专攻当前任务(产生环境动作)或停下整理技能(生成/更新文档片段)。文档更新后立即用于同一任务的后续步骤,并在任务切换时完整传递到下一任务。这种在线演化避免了传统流水线方法中提取、检索与执行的纠缠。

解耦信用分配与优化

奖励信号被拆分为两部分:

  • 当前任务奖励:仅用于评估任务求解动作的优劣;
  • 跨任务折扣奖励:将下游任务的成功信号折现回传,用于评价文档管理动作的长期价值。

优化采用 role-aware group-relative optimization,即为求解动作和管理动作构建独立的优势估计组,分别归一化后计算策略梯度,避免跨角色方差干扰。

与同类方法的差异

与传统的多阶段技能流水线(先提取、再检索、后执行)不同,SkillRise 用单一强化学习策略端到端地学会何时写文档、写什么、以及如何利用文档,大幅降低工程复杂度并提升跨任务泛化。

实验

实验设计

SkillRise 在三个具身智能体 benchmark 上评估:ALFWorld(文字环境中的家用机器人任务)、WebShop(在线购物导航)与 ScienceWorld(科学推理与操作)。训练将相关任务实例组织为难度递增的序列,使用单一策略在任务求解与技能文档维护间交替。解耦信用分配:当前任务奖励监督求解行为,折扣的后继任务奖励监督技能提取。对比基线包括标准强化学习、多阶段技能 pipeline 及重复尝试方法。

关键发现

  • 在 Pass@1 指标上,SkillRise 在所有 benchmark 上均超过最强基线,提升幅度为 2.3 至 8.5 个百分点。
  • 跨任务 test-time scaling 现象:即使每个任务仅尝试一次,性能仍随序列长度增加而提升,证明模型学会了可转移技能而非依赖多次采样。
  • 跨任务学得的技能管理策略可直接泛化至同一任务的重复尝试场景,保持有效。
  • SkillRise 在消除多阶段技能学习 pipeline 的额外推理开销的同时,维持了强性能,大幅提升效率。

与基线的深度对比

SkillRise 统一了跨任务技能的学习流程,与将技能提取、检索、执行纠缠的多阶段 pipeline 根本不同。后者虽然在单一任务上有效,但跨任务时难以动态进化技能文档,且推理开销大。SkillRise 通过单一策略和跨任务折扣信用分配,促使模型主动提取可复用的失败教训与成功模式,并持续优化技能文档,从而获得比重复尝试法(仅利用同一任务历史)或独立学习法更强的泛化能力,验证了任务间技能进化的收益。

行业影响

落地场景

SkillRise 使 LLM agent 能在跨任务序列中持续提炼可复用技能,尤其适用于需要高频处理相关但不同任务的自动化场景。典型落地包括:

  • 电商售后:退货、换货、退款、物流查询等流程相似但细节各异,agent 可在不同工单间逐步积累通用处理模式。
  • 内容审核:涉黄、涉暴、垃圾广告等多类违规内容共享审核逻辑,可以从一个类别泛化到另一类。
  • 智能客服:跨产品线的问答 bot,面对不同领域但结构相似的意图分类、槽位抽取任务。
  • 金融合规:反洗钱、反欺诈、KYC 核实等合规流程环节众多,但均需遵循查证–判断–上报的类似范式。

商业价值

  • 降本:传统多阶段 skill pipeline(抽取、检索、执行)开发维护成本高,SkillRise 以单策略交替进行任务求解与技能文档策展,大幅减少工程链路,运行时开销更低。
  • 提效:实验显示 Pass@1 相较最强基线提升 2.3–8.5 个百分点,且测试时跨任务扩展(test-time scaling)现象表明,只需顺序处理多个关联任务,无需重复采样同一任务,即可持续提升性能,直接提高吞吐率。
  • 体验提升:积累的技能可快速适应新变体,减少用户等待与错误率,例如电商场景中更快解决复杂售后问题,提升满意度。

集成方式

SkillRise 作为松耦合的训练范式,可嵌入现有 LLM agent 技术栈:

  1. 在 RLHF / PPO 等强化学习框架之上,加入跨任务序列构建器与技能文档状态,无需改动底层模型架构。
  2. 与 RAG 内存模块(如 MemGPT)互补:RAG 负责外部知识检索,SkillRise 负责从经验中归纳过程性技能,两者可共享同一文档缓冲区。
  3. 部署时,可将训练好的策展 policy 作为中间件,与现有的 LangChain、AutoGPT 等工作流引擎结合,动态维护 skill_doc,供下游任务调用。

具体 Use Case:电商售后全流程自动化

在一个售后 agent 工作流中,订单类型涵盖缺货退款、质量问题换货、错发补发等。传统方案为每种问题单独编写固定流程或训练独立模型。使用 SkillRise,agent 按时间顺序处理不同工单,每完成一单即调用策展策略,将成功经验或失败教训写入 skill_doc(例如“当用户提供破损照片时,可直接触发补发流程,无需人工审核”)。后续工单参照该文档,迭代优化决策。这样既无需针对每种问题单独训练,又能快速适应新出现的售后类型,将平均处理时间降低约 30%,且 Agent 的一次性 pass 率显著提升,减少人工兜底。另一应用场景是金融 KYC 联动审核,不同地区或产品线的 KYC 要求虽有差异,但都涉及证件识别、风险标签、终审决策,SkillRise 可使 Agent 在审核广东账户和海外账户的过程中自动抽象出证件真伪鉴别、高风险要素排查等共享技能,避免重复开发。

局限

  • **跨任务序列构建依赖预定义的难度或分组启发式,泛化受限**。SkillRise 要求将场景实例组织成渐进式挑战序列,但论文未阐明如何自动化地生成这种序列。当前实现可能依赖手工设计的任务划分或利用环境预定义的难度阶,这限制了方法在新领域中的推广。在实际应用中,不同任务集合可能缺乏天然的顺序结构,若随机排序或注入不相关知识,技能文档的演化可能引入噪声,甚至负迁移。如何自适应地构建最优任务课程顺序仍是一个开放问题。
  • **长上下文策略训练与序列长度扩展的稳定性待验证**。SkillRise 在 rollout 中需要维护一个不断增长的技能文档,随着任务序列加长,上下文急剧膨胀。尽管实验显示了跨任务测试时性能提升,但训练时可采用截断或固定长度,然而这种方式可能丢失长期技能积累。在大规模场景或无限长度流式任务中,当前框架可能受限于 LLM 的上下文窗口和注意力机制开销。此外,统一的策略要同时优化解题与策展,训练时的梯度冲突可能影响收敛,尤其在复杂环境中。
  • **环境仅限于基于文本的具身或对话任务,未触及多模态或开源世界**。实验在 ALFWorld、WebShop 和 ScienceWorld 上进行,这些环境均为离散的文本动作空间,与真实世界代理的感知输入和连续控制存在较大差距。SkillRise 的技能文档基于自然语言总结,对于需要视觉理解或物理交互的任务,如何表征和传递跨模态的可复用技能尚无验证。另外,实验仅对比了基于 LLM 的基线,未与近期结合外部记忆或检索增强的层次化强化学习方案进行公平比较,实际提升可能在高基线面前有所收缩。
论文Zhiyuan Yao2026-07-29原文

相关内容