论文

基于强化学习的渐进式智能体技能生成

基于强化学习的渐进式智能体技能生成

现有技能生成方法大多依赖启发式规则或流水线式整合,必须针对不同证据来源专门设计。相比之下,基于学习的方法提供了一种更统一的方式来对异构来源的技能生成进行建模。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;其价值在很大程度上只能通过技能是否能改善智能体在下游任务中的行为来判断。 为应对这一挑战,我们提出了 Skill-α,一种用于渐进式生成高质量智能体技能的强化学习方法。具体而言,我们将技能生成公式化为一个顺序编辑过程,将技能构建分解为可独立评估的编辑步骤,并引入一种新颖的回滚奖励,通过比较锚定查询下原始技能与编辑后技能的下游执行结果来评估每次编辑。 大量实验表明,在文档到技能和经验到技能两种设置中,Skill-α 比基于启发式或流水线的方法能生成更有效的技能。在主要的 GPT-4o worker 下,Skill-α 在 CL-Bench 和 tau2-bench 上分别将平均下游成功率比最强的技能生成基线提高了 3.3 个百分点和 6.7 个百分点。进一步的消融实验验证了回滚奖励和渐进式生成的重要性。

论文精读

TL;DR Skill-α 将技能生成本身建模为可逐步编辑的序列,并用回滚奖励从下游任务效果中学习,无需人工设计规则,在文档和体验两种证据源上均显著超越启发式与管线方法。

问题

问题背景

LLM Agent 在复杂任务中逐渐依赖**外部技能(skills)**作为模块化过程单元来提升推理与执行效果。自动从文档或经验中生成高质量技能已成为关键研究问题。

现有方法局限

现有技能生成方法大多基于启发式规则(heuristics)或管道式整合(pipeline-style consolidation),针对不同证据源(如文档、经验日志)需要专门设计流程,缺乏统一的建模手段。

基于学习的方法虽然更通用,但面临一个根本困难:技能本身缺少天然的监督信号(如相关性标注、正确性判断),其价值只能通过下游任务执行结果间接衡量。这导致传统监督学习难以直接应用,而强化学习在稀疏且延迟的奖励下训练不稳定,生成技能的质量波动较大。

为什么这个问题难且重要

  • 反馈信号极度稀疏:单个技能的优劣无法直接评估,必须通过完整任务回路的“黑盒”执行结果才能获得微弱信号。
  • 技能粒度与组合性:过粗的技能容易过拟合特定场景,过细的技能又会在组合时累积误差。如何在序列化编辑过程中平衡可组合性与独立性缺乏有效原则。
  • 业界关注度高:如客服、数据分析、自动化测试等场景中,快速从领域文档或历史交互中抽象出可复用的技能,直接决定 Agent 的落地效率与维护成本,是下一代 Agent 系统走向自适应学习的瓶颈之一。

行业类比

类似自动驾驶中从路测数据自动生成驾驶策略模块——如果无法从碎片化的行驶片段中提炼出可泛化的决策技能,系统就只能靠人工编写 if-else 规则,无法规模化应对长尾场景。

核心洞察

  • 将 skill 生成转化为**序列编辑过程**并通过强化学习优化,让原本缺乏自然监督信号的技能构建问题得以用统一的学习框架解决。不同于启发式或流水线方法需要针对不同证据源设计特定规则,Skill-α 把 skill 构建分解为一系列可单独评估的编辑步骤,直接利用下游任务执行结果作为反馈,使生成过程能够自我纠正并逐步提升质量,对异构数据源具有更好的泛化性。
  • 提出 **rollback reward** 机制,通过比较同一锚定查询在原始 skill 与编辑后 skill 下的执行差异,为每一个编辑动作提供细粒度的即时奖励。这解决了传统学习式方法中奖励稀疏、难以定位有效编辑的痛点,使渐进式生成中的每一步都能获得可解释的改进信号,显著提升了最终 skill 的有效性和训练稳定性。

方法

输入与整体框架

Skill-α 接收两类证据源:结构化文档(如操作手册)或 agent 执行经验轨迹(交互历史)。将技能生成形式化为一个 顺序编辑过程,从初始技能集合(可为空)出发,通过多步编辑逐步构建出能提升下游任务表现的技能。

关键模块:渐进式编辑与 Rollback Reward

整个流程由两个核心机制驱动:

  • 渐进式技能生成(Progressive Skill Generation):每一步编辑动作由策略模型(基于 LLM)根据当前技能状态和证据源生成,编辑操作包括添加、修改、删除技能步骤等。这种分解将复杂的技能构建转化为一系列可独立评估的原子修改。
  • Rollback Reward(回滚奖励):技能本身没有直接的 ground-truth 标签,因此无法用监督信号训练。Skill-α 采用 离线 RL 思想,为每一编辑步设计即时奖励:固定一个 锚定查询(anchored query)(即代表性的下游任务输入),分别执行编辑前与编辑后的技能在该查询上的任务表现,以 执行成功率差异 作为该编辑的奖励。若编辑使性能提升则获正奖励,否则受惩罚。这解决了技能生成过程中奖励稀疏和延迟的问题,让每个编辑的质量都能被独立评估。

训练与输出

策略模型通过强化学习(如 PPO)训练,最大化累积 rollback reward。训练收敛后,模型输出的是一组经过优化、可直接部署的 agent 技能模块,它们在下游任务中带来可验证的成功率提升。

与同类方法的差异

与依赖启发式规则或流水线式合并的方法相比,Skill-α 不需要为不同证据源设计专门生成逻辑,而是通过 统一的 RL 学习框架 和 rollback reward 直接将技能价值与下游任务表现对齐,实现了端到端的技能效用优化。

实验

实验设计

实验在两个多任务 Agent 基准 CL-Bench 和 tau2-bench 上进行,覆盖 文档→技能(document-to-skill) 与 经验→技能(experience-to-skill) 两种生成场景。主 Agent worker 采用 GPT‑4o,比较 Skill‑α 与多种基于启发式或流水线的技能生成基线。消融实验分别移除 rollback reward 与 渐进式生成(progressive generation),以验证核心组件贡献。

关键发现

  • Skill‑α 在所有设置中均优于基线:在 CL‑Bench 上平均下游成功率比最强基线高出 3.3 个百分点,在 tau2‑bench 上高出 6.7 个百分点。
  • Rollback reward 是核心驱动力:消融实验表明,去掉 rollback reward 后性能显著下降,验证了基于锚定查询的对比评估能有效捕捉技能质量。
  • 渐进式生成增强稳定性:将技能构建分解为可独立评估的编辑步骤,不仅提升最终技能质量,还让训练过程更平滑、更易收敛。

与基线方法的深度对比

传统技能生成依赖针对不同证据源专门设计的启发式规则或流水线整合,通用性差且难以端到端优化。Skill‑α 将技能生成形式化为 顺序编辑过程,并通过 rollback reward 提供细粒度监督信号,使得同一框架能统一处理文档、经验等异构来源。实验结果表明,这种学习驱动的渐进式构建方法在跨基准、跨场景下一致优于静态流水线方法,体现了 RL 范式在 Agent 技能生成任务上的强泛化能力和工程可行性。

行业影响

落地场景

Skill-α 将技能生成形式化为顺序编辑过程,通过强化学习直接从文档或经验中提取可执行的代理技能。主要应用场景包括:

  • LLM Agent 自动化平台:如客户服务机器人、IT 运维代理,需从知识库或历史日志中学习标准化操作流程。Skill-α 可以自动生成高质量技能模块,避免人工硬编码。
  • 智能知识管理系统:将企业文档、最佳实践转化为代理可直接调用的技能,实现“知识→行动”的闭环。

商业价值

  • 降低人工成本:传统技能设计依赖启发式规则或流水线整合,工程师需针对不同证据源反复调整。Skill-α 提供统一的学习范式,大幅减少人工迭代与维护开销。
  • 提升服务质量与收入:在 CL-Bench 和 tau2-bench 上,下游成功率分别提升 3.3 和 6.7 个百分点,意味着代理能更可靠地完成复杂任务,直接减少人工介入,提高客户满意度与转化率。
  • 加速跨领域迁移:学习型方法无需领域专家重新设计,可快速部署到新业务线。

集成方式

  • 嵌入主流 Agent 框架:Skill-α 可作为 LangGraph、AutoGen 或 CrewAI 的技能生成器。输入历史交互日志或产品文档,输出可插拔的技能函数,供代理调用。
  • 与 RAG 流水线协同:检索到的文档片段可直接被精炼为结构化技能,而不仅仅是上下文片段,使代理行为更一致、可解释。
  • 持续改进:利用 rollback reward 机制,可在生产环境中收集代理执行反馈,触发技能增量更新,形成持续学习环路。

具体用例:

  1. 电商智能客服:从海量售后对话记录和退货政策文档中生成处理退款、换货等流程的技能,代理自主解决率提升,显著降低转人工率。
  2. 金融投资报告助手:从历史研报和数据结构化模板中抽取多步分析逻辑,编译为可执行技能,辅助分析师快速生成合规报告,节省数小时人工编写时间。

局限

  • **计算与采样效率**:Skill-α 基于 RL 训练,每个 skill 编辑都需要通过下游任务执行并计算 rollback reward,这带来较高的交互成本。论文仅在 CL-Bench 和 tau2-bench 两个相对小规模的基准上验证,且训练过程中对每个 anchored query 进行多次 rollout 和对比,实际部署时可能需要大量 LLM API 调用,在资源受限环境下难以直接套用。此外,训练与评估均以 GPT-4o 为 worker,未验证不同 LLM 骨干下的泛化能力。
  • **对初始 skill 库和证据质量的依赖**:方法仍需要从已有文档或经验中构建初始 skill 种子,然后通过 RL 进行渐进式编辑。若初始 evidence 质量很低或覆盖率不足,RL 的改善空间会受限。同时,rollback reward 依赖单一 anchored query 和与之绑定的下游执行轨迹,当任务类型多样时,单个 anchor 可能无法全面衡量 skill 的泛用价值,可能导致过拟合到特定类型的查询分布上。
  • **技能表达与任务范围**:当前 skill 以自然语言描述的形式存在,其编辑空间限于文本增删改,尚不涉及代码、工具调用或多模态感知等更复杂的 agent 技能形式。论文在文档到技能和经验到技能两种设定下评估,但均未涉及跨领域或持续学习的场景;未来还需验证该方法能否扩展到多模态 agent 或更复杂的长期规划任务中。
论文Junhao Shen2026-08-03原文

相关内容