论文

SkillForge: 通过动态技能生命周期实现技能与智能体协同演化

SkillForge: 通过动态技能生命周期实现技能与智能体协同演化

记忆增强的强化学习 提升了 LLM 智能体解决复杂长程任务的能力。技能(skills)是这类记忆的一种形式,它将指令与针对任务类型的适用条件配对。然而,随着策略不断改进却无差别地保留每一项技能,会让过时或有害的条目持续累积,进而误导智能体。 我们提出 SkillForge,一种智能体式 RL 方法,它通过由适应度驱动的技能生命周期(trial、active、stable、retired 四种状态)来编译并演化技能库,使技能与模型在训练全程协同演化。 - RL 前的评估阶段 首先利用基座模型自身的 rollout 预淘汰低适应度技能,得到经过滤的技能库,再用其播种监督微调; - 强化学习 从该检查点接手,在每次迭代中通过选择性淘汰、稳定化与 LLM 引导的变异,在优化策略的同时持续锻造技能库。 在多个交互式智能体基准上,SkillForge 取得最高的总体成功率,相较最强基线最多实现 7.8% 的相对提升,同时训练全程技能库保持紧凑。我们发布 SkillFurnace 数据集,包含 5k+ 条标注记录,汇集了经淘汰过滤的 SFT 轨迹、带有适应度标注的演化技能库,以及附有人工标注失败类别的淘汰事件,以支持技能质量与生命周期管理的研究。

论文精读

TL;DR SkillForge 用适应度驱动的技能生命周期(试用/活跃/稳定/退休)让技能库与智能体在 RL 训练中协同进化,避免过时技能干扰,在多个交互基准上最高总成功率,相对最强基线提升 7.8%。

问题

问题背景:LLM agent 在长时程交互任务中依赖记忆增强强化学习,技能库作为一种结构化记忆存储 (指令, 适用条件) 对,可帮助模型复用成功经验。

现有方法局限:

  • 无差别保留所有技能:随着策略更新,早期技能可能过时甚至有害,会误导 agent 决策。
  • 缺少技能质量评估与生命周期管理,技能库持续膨胀,推理噪声增加。
  • 技能与策略存在耦合:技能帮助探索,但策略提升后技能需同步进化,现有方法多为一次性过滤或静态维护,无法适应训练动态。

为什么难/重要:

  • 技能适用性评估需要与环境交互,成本高;而技能质量又直接影响策略学习,形成循环依赖。
  • LLM 生成技能可能存在冗余或冲突,需引入进化机制在 RL 过程中筛选与突变,同时保持库的紧凑性。
  • 业界关注自主 agent 的长期稳定性和样本效率,动态管理技能库是提升 RL 训练效果的关键技术点。

行业类比:类似智能客服中的 FAQ 知识库,需要随模型版本迭代自动淘汰过时答案,否则会持续误导用户决策;SkillForge 将这一维护过程自动化并嵌入 RL 训练循环。

核心洞察

  • 技能库不应是静态积累的记忆,而是一个与策略共同进化的种群;SkillForge 用 fitness 驱动的四级生命周期(trial/active/stable/retired)管理技能的引入、保留与淘汰。与之前技能增强 RL 方法只增不减或固定检索相比,动态生命周期能避免过时技能干扰策略,这是从“记忆容量”到“记忆质量”的转变。
  • SkillForge 将“先过滤后微调,再在 RL 中持续锻造”分成两阶段,预 RL 阶段利用 base model 自身的 rollouts 评估技能 fitness,提前淘汰低质量技能,再以此初始化 SFT;RL 阶段继续退休、稳定化和 LLM 引导变异。这解决了 RL 早期 policy 太差、无法可靠评估技能价值的问题,也避免在 SFT 阶段注入有害技能,使技能库和策略从冷启动到收敛都有质量控制。

方法

SkillForge 以基础 LLM agent 和初始技能库为输入,通过技能 fitness 驱动的生命周期管理与策略优化协同演化,输出紧凑且高质量的技能库和提升后的 agent 策略。

输入与预过滤

初始技能库来自预定义或现有积累,每条技能由指令和适用条件组成。在 RL 之前,SkillForge 首先运行一个 预评估阶段:使用基础模型自身 rollout 收集每个技能的任务表现,计算 fitness 指标(如成功率、回报),并对低 fitness 技能执行预退休,得到过滤后的技能库。

关键模块:动态技能生命周期

技能生命周期包含四个状态:trial(试用)、active(有效)、stable(稳定)、retired(退休)。fitness 持续追踪每个技能在 agent 策略下的实际效用。根据 fitness 阈值和趋势,技能在不同状态间迁移:

  • 新技能初始为 trial,在多个任务上验证后转为 active;
  • 长期表现优异的技能升为 stable,减少再次评估开销;
  • 性能衰退或被新策略覆盖的技能进入 retired 并从库中移除。

RL 训练集成

过滤后的技能库用于 监督微调(SFT) 初始化策略。之后进入 RL 循环,采用 GRPO(Group Relative Policy Optimization) 进行策略优化。每个 RL 迭代中,除了常规策略更新外,还执行:

  1. 选择性退休:根据最新 fitness 移除有害或过时技能;
  2. 稳定化:将高 fitness 技能标记为 stable 以冻结其更新;
  3. LLM 引导变异:利用 LLM 生成新技能候选或对现有技能进行变异,注入库中并进入 trial 状态。

该过程使技能库与 agent 策略共同进化,避免技能污染。

输出与差异

输出为优化后的策略和精简技能库。与固定技能库或简单记忆增强 RL 相比,SkillForge 引入全生命周期管理和预过滤 SFT 初始化,使技能库能随策略提升而主动淘汰有害项,而非被动累积。

实验

实验设计

  • 评估环境覆盖 WebShop、ALFWorld、Search-Augmented QA 等多个交互式 agent benchmark。
  • 流程:先用 base model rollout 评估技能 fitness,预淘汰低分技能,过滤后的库用于 SFT 初始化;随后 RL 迭代中执行选择性退休、稳定化与 LLM 引导变异,使技能库与策略协同演化。
  • 基线:与较强 skill-augmented RL 方法对比,并统计总体成功率与技能库规模。

关键发现

  • SkillForge 在多个 benchmark 上获得最高总体成功率,相对最强基线提升 +7.8%。
  • 技能库在训练全程保持紧凑,未因持续积累而过载。
  • 发布的 SkillFurnace 数据集包含 5k+ 条标注记录,涵盖 SFT 轨迹、技能库演化及人工标注的退休失败类别。

与基线对比解读

  • 相比无生命周期管理的技能库 RL,trial/active/stable/retired 状态机有效阻止过时或有害技能误导策略,降低上下文噪声。
  • 预 RL 评估利用 base model 自身 rollout 预先过滤低质量技能,减少 SFT 阶段被污染样本干扰,改善 RL 起点。
  • LLM 引导变异持续注入新技能,使技能库随策略 distribution shift 更新,避免静态库在 long-horizon 任务中失效。

行业影响

落地场景:SkillForge 的技能生命周期管理适用于长程交互式 LLM agent 场景,如电商智能导购(多轮商品对比、比价、下单)、企业 IT 服务自动化(工单处理、故障排查)或代码助手(跨文件重构、调试)。这些业务中 agent 需要一边执行一边积累可复用技能,但现有方法容易积累过时或不匹配的技能导致误导。SkillForge 通过 fitness 跟踪和 retired 机制保持技能库紧凑有效。

商业价值:主要降低 agent 运营成本并提高任务成功率。紧凑技能库直接减少上下文长度和检索开销,降低 token 消耗;减少因错误技能导致的失败重试,进而降低人工审核成本;提升用户满意度与转化率。论文显示相对最强基线提升 7.8% 成功率,在长程任务上可转化为显著业务指标改善。同时 SkillFurnace 数据集可支撑技能质量管理工具的开发。

与现有工作流接口:SkillForge 可作为记忆增强模块集成到现有 RLHF/RLVR 训练管线,或作为 Agent 框架(如 LangChain、AutoGen)的记忆层插件。其技能以“指令+适用条件”形式存储,可映射到向量数据库或知识图谱;生命周期状态可由监控系统驱动,在部署后持续更新。SkillFurnace 数据集提供标注的 SFT 轨迹、技能库快照和退休事件,可用于评估技能演化质量或微调分类器。

局限

  • **计算与交互开销较高**。SkillForge 在预 RL 评估阶段需要利用 base model 的 rollouts 对每个技能进行 fitness 评估,这对于大规模技能库或长 horizon 任务会带来显著的采样成本;在 RL 迭代中,每个 iteration 的 selective retirement、stabilization 与 LLM-guided mutation 也增加了额外的推理与训练负担。论文未充分讨论这些步骤的复杂度与可扩展性,实际部署时可能需要限制技能库规模或采用近似评估策略。
  • **依赖 LLM 判断的鲁棒性存疑**。技能 mutation 由 LLM 引导,生成的候选技能质量受基座模型能力影响,可能引入低质量或冗余技能;同时 fitness 跟踪基于有限数量的 rollouts,估计噪声可能导致技能误淘汰或保留不稳定技能。生命周期状态转换条件(如 trial→active→stable→retired)涉及多个超参数(阈值、窗口大小等),论文虽进行了阈值敏感性分析,但未深入探讨在分布漂移或新任务类型出现时状态管理是否依然可靠。
  • **实验验证范围有限**。尽管在多个交互式 agent benchmarks 上取得了最高 aggregate success rate,但实验所用任务类型与模型规模相对固定,未验证在不同基座模型、不同任务难度或真实环境中的泛化性。与 recent memory-augmented RL 方法(如 ETC、Reflexion、Voyager 等)的对比多集中在成功率指标,缺少对技能质量、内存维护成本或学习曲线的深入分析。此外,SkillFurnace 数据集规模为 5k+ 条,覆盖的任务种类和失败模式可能不足以支撑全面的技能质量管理研究。
论文Yuyao Ge2026-10-07原文

相关内容