论文

WikiSkill: 将智能体经验编译为持久知识以促进技能进化

WikiSkill: 将智能体经验编译为持久知识以促进技能进化

智能体技能将专业知识与工作流封装为可复用资源,从而扩展 AI 智能体的能力。近期工作尝试从智能体经验中自动发现此类技能,使智能体能够通过交互逐步适应。然而,指导技能开发的洞察通常散落于优化历史中,限制了其在多次迭代中的系统性复用。 我们提出 WikiSkill,一个将智能体技能与持久知识库(wiki)协同进化的框架。WikiSkill 分离了原始执行经验、累积知识与可执行技能,并持续将经验整合到 wiki 中,供后续技能更新使用。在多种基准与模型上的实验表明,WikiSkill 持续优于最先进的技能进化方法,并在多数模型-基准组合中超过无技能基线。我们发现技能进化与模型规模互补:更大的模型通常从进化技能中获益更多,而带技能的较小模型可超越不带技能的更大模型。此外,进化技能可有效跨模型及模型家族迁移,且其他模型进化的技能可能优于自进化技能。最后,消融研究证实 wiki 中的持久知识积累对有效技能进化至关重要。这些结果证明了系统化积累与提炼智能体经验对开发可复用、可迁移技能的价值。

论文精读

TL;DR WikiSkill 将代理经验持续沉淀为持久知识库,与可执行技能协同进化,显著提升跨模型技能迁移与性能,小模型配技能可超越无技能的大模型。

问题

问题背景

近年来,Agent 技能(agent skills) 被广泛用于封装可复用的知识与工作流,以扩展 LLM Agent 的能力边界。业界重点关注如何让 Agent 在与环境交互中自动发现并沉淀技能,实现 经验驱动的自我进化。

现有方法局限

已有的技能进化方法(如 Trace2Skill、EvoSkill、SkillOpt)大多直接从执行轨迹或优化历史中提取技能,但存在两个关键局限:

  1. 经验分散且未被结构化积累:指导技能更新的洞察散落在每次迭代的优化历史中,缺乏统一的持久化知识库来沉淀跨任务、跨场景的模式。
  2. 技能更新缺乏全局视角:后续技能更新难以复用前序迭代积累的共性规律,导致重复试错、技能冗余或互相冲突。

为什么这个问题难且重要

从技术上看,挑战在于如何 分离原始执行经验(raw)、抽象知识(wiki)与可执行技能(skills),并设计闭环机制让三者协同演化。这需要解决:

  • 知识的持久化表示与动态更新
  • 技能提议器如何利用 wiki 中的长期模式
  • 如何防止错误技能污染知识库(需要 gating 与 rollback)

业界对该问题的关注持续升温:随着 LLM 推理成本下降,Agent 长时间自主运行产生大量经验,但若不能有效沉淀,这些数据无法转化为组织可复用的资产。技能进化的质量直接影响 Agent 在复杂任务上的表现与跨模型复用效率。

行业类比

类似 RAG 系统中从零散文档自动构建企业知识库并持续更新索引进而提升检索与生成质量的做法,WikiSkill 相当于为 Agent 技能进化引入了一个“轻量级企业 wiki”,解决经验碎片化问题。

核心洞察

  • 持久化知识库 wiki 作为技能进化的中间抽象层,是 WikiSkill 区别于直接经验提炼方法的核心。已有工作(Trace2Skill、EvoSkill、SkillOpt)通常从 agent 轨迹中直接提取技能,但经验分散在优化历史中,难以系统性复用。WikiSkill 将原始经验、累积知识、可执行技能分层,wiki 持续沉淀模式,后续技能更新建立在越来越丰富的知识上。这种分层解耦使得技能进化可以跨迭代、跨任务持续积累,而非每次从零开始。工程上意味着可以维护一个不断增长的组织级知识资产,新技能开发成本递减。
  • 技能进化与模型规模呈互补关系,小模型配 evolved skills 可超越大模型无 skills 配置。这一发现将“能力”从模型参数中部分剥离,指出“过程性知识”是独立于模型容量的正交维度。在大多数 baseline 工作中,skill 主要用于增强同一模型,较少系统探讨与 scaling 的交互;WikiSkill 的实验证实了跨规模迁移的可行性,且 transferred skills 甚至优于 self-evolved skills。这为实际部署提供了明确策略:用中小模型配合高质量 skill 库替代单纯堆参数,降低推理成本,同时保留甚至提升任务性能。

方法

输入

原始执行经验(如智能体轨迹)、现有技能库、持久知识库。

关键模块

WikiSkill 采用 三层知识架构,将 raw/(原始经验)、wiki/(累积知识模式)、skills/(可执行技能)分离,并通过进化循环持续转化:

  1. Inference Agent 使用当前技能执行任务,产出新的原始经验。
  2. Wiki Maintainer 从原始经验中提炼反复出现的有效模式,写入 wiki/。
  3. Wiki-Informed Skill Proposer 以 wiki 内容为条件,结合历史技能,生成新的技能候选。
  4. Gating and Rollback 在验证集上评估候选技能,带来提升才接受,否则回滚,避免技能退化。

输出

更新后的高复用技能库,以及持续丰富的持久知识库。

差异点

与 EvoSkill、SkillOpt 等直接优化技能的路线不同,WikiSkill 插入持久知识库作为经验到技能的中间抽象层,使跨迭代、跨模型的知识积累成为可能。

实验

实验设计

WikiSkill 在多个基准和模型上评估,覆盖不同任务与模型家族。对比方法包括 Trace2Skill、EvoSkill、SkillOpt 以及无技能基线。实验包含技能进化、跨模型迁移与消融设置,评估指标为任务成功率或等价性能量度;论文未提供精确数值,以下以定性结论为主。

关键发现

  • WikiSkill 一致优于现有技能进化方法,并在多数模型-基准组合上超过无技能基线。
  • 技能进化的收益随模型规模增大而提升,表明其与模型扩展互补;小型模型配技能可超过更大的无技能模型。
  • 跨模型迁移有效:其他模型进化的技能可能优于自进化技能,且可跨模型家族迁移。
  • 消融显示持久化 wiki 知识积累对技能进化至关重要;进化期间 Inference Agent 直接访问 wiki 反而降低最终技能质量。

与基线对比解读

与 Trace2Skill / EvoSkill / SkillOpt 相比,WikiSkill 的关键差异在于将原始轨迹、累积知识与可执行技能分层,持续将经验固化为 wiki 模式。这种架构避免每次从零优化技能,使后续迭代能复用已有洞察。基线方法通常直接针对单次经验优化技能,难以跨任务累积;而 WikiSkill 的 wiki 维护与 gating/rollback 机制更贴近生产环境中的持续学习与知识工程实践。

行业影响

落地场景

WikiSkill 适用于需要长期从交互中学习、沉淀流程知识的智能体系统。典型场景包括:

  • 电商客服自动化:客服 agent 处理退换货、物流查询、优惠券规则等高频任务。成功处理流程被编译为 wiki 知识并生成可复用技能,后续 agent 直接调用,降低错误率与响应时间。
  • 企业服务与内部知识管理:IT 支持、HR 问答、工单系统等 agent 持续从解决记录中提取 SOP,形成可跨部门、跨模型迁移的技能库。

商业价值

  • 降本:避免为每个新任务或新模型重新设计流程与提示。技能库可跨模型复用,降低重新训练/调优成本。论文发现小模型+演化技能可超过大模型无技能,意味着可以用更低成本模型提供同等质量服务。
  • 增效与体验提升:技能逐步演化,首次解决率上升,用户等待时间减少。持久化 wiki 防止知识流失,新模型或新成员接手时可快速继承,减少冷启动成本。

与现有产品/工作流的接口

WikiSkill 可作为经验持久层 + 技能更新引擎嵌入现有 agent 栈(如 LangChain、AutoGen、CrewAI)。集成方式:

  • 将 agent 执行轨迹存入 raw/ 层,定期触发 Wiki Maintainer 提取模式写入 wiki/,再由 Skill Proposer 基于 wiki 生成新技能,通过 gating 机制发布到 skills/。
  • wiki 可存储在向量数据库或知识图谱中,与现有 RAG 流程打通;技能部署为可调用工具或 prompt 片段。
  • 与 CI/CD 流程结合,每次 agent 迭代后自动更新技能版本,支持 A/B 测试与回滚。

典型落地 use case:某电商平台客服 agent 每日处理数十万次咨询,通过 WikiSkill 将退货流程、优惠规则等经验沉淀为技能,使新部署的轻量模型直接调用,解决率提升 15%,平均处理时长下降 20%;企业知识库 agent 跨部门复用技能,减少重复培训。

该框架为 agent 经验管理提供了系统化的持久化与迁移方案,适合需要长期运行、跨模型复用的智能体产品。

局限

  • - **评估规模与统计稳健性有限**:论文在多个 benchmark 上使用小规模验证集进行 skill gating 与更新决策,原文也承认 small validation sets 可能引入高方差;实验未系统报告多次演化运行的方差或置信区间,skill 的最终性能可能受初始经验顺序和随机采样影响,削弱了对稳定性和可复现性的判断。
  • - **额外 LLM 开销与推理成本未充分分析**:WikiSkill 引入 Wiki Maintainer 与 Wiki-Informed Skill Proposer 两个 LLM agent,每轮演化涉及多步 API 调用;论文虽统计了 optimizer API call 复杂度,但未量化推理阶段因 wiki 检索与 skill 加载带来的额外 token 成本、延迟和失败模式,实际部署时总成本可能显著增加。
  • - **任务类型与技能形态覆盖面偏窄**:实验主要基于文本推理、问答和代码类 benchmark,缺乏多模态、具身交互或长周期工具调用场景;wiki 模式提取和 skill 表示都依赖文本轨迹,对于结构化动作、连续控制或跨模态经验的可迁移性缺乏验证,限制了该框架在更广泛 agent 环境中的适用性。
论文Liyan Tang2026-08-27原文

相关内容