MUSE-Autoskill:通过技能创建、记忆、管理和评估实现自我进化的智能体
大型语言模型(LLM)智能体依赖可复用的技能解决复杂任务。然而,现有技能创建方法将技能视为孤立和静态的工件,限制了其可复用性、可靠性和长期改进。为此,我们提出 MUSE-Autoskill Agent(Memory-Utilizing Skill Evolution),一种以技能为中心的智能体框架,通过统一的技能生命周期(创建、记忆、管理、评估和优化)使智能体能够持续提升任务解决能力。 该框架支持智能体按需创建技能、跨任务存储与复用、高效组织与选择,并通过单元测试和运行时反馈进行评估与优化。此外,我们引入技能级记忆,为每个技能积累跨任务的经验,从而实现更有效的复用与自适应。在 SkillsBench 上的实验初步证明,生命周期管理的技能可提升任务成功率、效率、复用性及跨智能体迁移能力,凸显了将技能视为长寿命、经验感知和可测试资产的重要性。
论文精读
TL;DR MUSE-Autoskill 将技能视为全生命周期、可积累经验并持续进化的长期资产,通过统一管理创建、记忆、评估与精炼,让智能体跨任务持续提升。
问题
问题背景
LLM 智能体在解决复杂任务时,日益依赖可复用的技能 (skill),例如代码生成、API 调用或规划子模块。当前研究焦点已从单任务表现转向技能的自动化生成、复用与持续改进,以提升智能体的长期自主演化能力。
现有方法局限
主流方法(如 AutoSkill)将技能视为一次性创建的静态工件,缺乏生命周期管理。具体局限包括:
- 技能孤立:每个技能针对单一任务生成,无法跨任务共享上下文或经验;
- 静态存储:技能一旦创建便不再更新,无法根据运行时反馈自我纠错或优化;
- 缺少评估机制:没有单元测试或结构化验证,技能可靠性难以保证;
- 记忆割裂:技能与任务执行历史脱钩,无法累积跨任务的细粒度经验(如参数敏感度、环境适配模式)。
这导致技能复用率低、易于退化,智能体在面对新场景时被迫从零创建,造成大量冗余和推理开销。
为什么这个问题难且重要
技术挑战在于构建一套闭环机制:智能体需自主判断何时创建新技能、如何版本化管理、怎样通过单元测试自动化评估,并基于执行反馈迭代精炼。这要求融合记忆系统、元认知调度与可靠的回测环境,且不能过度依赖人工标注。
业界关注度持续上升,原因在于:
- 复杂任务(如多步自动化、软件工程)对可复用的可靠技能有刚需;
- 技能生命周期管理直接影响智能体系统的可维护性、扩展性和长期部署成本;
- 缺乏自进化能力的智能体会随着环境变化而快速失效,难以用于生产级流程。
行业类比
这类似于软件工程中的 CI/CD 与测试驱动开发:没有自动化测试与持续集成,代码库会走向腐化;同样,没有评测与迭代的智能技能库,也会沦为不可信的“一次性脚本”集合。
核心洞察
- 将技能视为具备完整生命周期的可生长资产,而不再是静态、一次性的工具:现有自动技能系统(如 AutoSkill)通常在任务触发时生成技能后便将其固化,缺乏后续的评估、修正与经验积累机制。MUSE-Autoskill 通过引入创建、存储、管理、评估与精炼的闭环生命周期,使技能能够通过单元测试和运行时反馈持续演化,从根本上改变了技能在 Agent 系统中的定位和可用性。
- 为每个技能配备独立的记忆单元,跨任务沉淀成功与失败经验,提升复用的可靠性:以往方法只关注技能的创建与检索,忽视了技能在使用过程中积累的上下文经验。MUSE-Autoskill 的 skill-level memory 允许 Agent 记录每次调用时的环境、参数调整及结果,从而在面对相似场景时做出更优决策,避免了简单复用导致的反复踩坑,使技能复用从“盲检索”走向“经验驱动”。
方法
核心思路
MUSE-Autoskill 将技能视为可演化的长期资产,通过统一的生命周期(创建、记忆、管理、评估、精炼)让 LLM Agent 持续提升任务能力。
输入
- 当前任务描述与环境观察(Observation)
- 全局技能库(持久化存储的技能包)
- 技能级记忆(每个技能的历史执行经验)
关键模块
技能创建
- Agent 遇到无法解的任务时,用 LLM 按需生成新的
skill(代码片段、子任务序列或工具组合),附带 单元测试 与参数 Schema。 - 生成后立即存入技能库,并初始化其技能级记忆。
技能记忆(Skill-level Memory)
- 每个技能独享一个记忆槽,记录跨任务的成功/失败轨迹、适配参数、环境约束等。
- 分为短时记忆(当前会话上下文)和长时记忆(持久化经验),通过 压缩算法 控制长度,保留关键经验用于检索增强的提示。
技能管理(Management)
- 基于任务意图和上下文相似度检索相关技能,动态编排执行顺序。
- Context Management 模块负责截断、摘要或路由记忆,防止窗口溢出。
技能执行与评估
- 在规划-行动-观察循环中调用技能,执行时注入技能级记忆作为上下文。
- 单元测试与运行时反馈(成功率、异常)自动触发 技能精炼:修正错误、更新记忆或重新生成代码。
输出
- 任务求解结果(成功/失败与产出)
- 更新后的技能库(可能新增或精炼的技能包)
- 更新的技能级记忆(丰富后续复用经验)
与同类方法的差异
传统自动技能系统(如 AutoSkill)将技能视为一次性静态制品,缺乏跨任务记忆和持续改进机制。MUSE-Autoskill 通过 技能级记忆 和 闭环精炼,使技能成为可积累经验、自我优化的活资产,从而提升复用率和跨 Agent 迁移能力。
实验
实验设计
实验在 SkillsBench 基准上开展,评估 MUSE-Autoskill 框架在技能创建、记忆、管理与评估完整生命周期下的表现。主要验证点包括:技能使用对任务成功率和效率的影响;自动技能生成与人工技能的质量对比;不同代理间的技能迁移能力;生成技能的综合能力及成本分析。代理基于统一规划-行动-观察架构,配备技能级记忆(短期 / 长期)与上下文管理机制。
关键发现
初步证据表明,生命周期管理的技能能够切实提升任务成功率、执行效率、技能复用率以及跨代理迁移效果。技能不再孤立、静态,而是通过单元测试和运行时反馈持续细化,配合技能级记忆积累跨任务经验,使代理在未见任务上展现更强的适应能力。自动生成的技能在覆盖率和有效性上接近人工编写,且复用成本可控。
对照基线解读
相比将技能视为一次性产物的静态方法,MUSE-Autoskill 的核心优势在于技能作为可测试、可演化的长期资产。它解决了传统自动技能系统在可靠性与复用性上的短板,通过统一的创建-记忆-管理-评估-优化循环,让代理能够从使用历史中学习并自我改进。这一设计更贴近真实生产环境中对可维护、可迭代工具链的需求,但也引入了技能管理和记忆压缩的额外复杂度与 token 开销。
行业影响
核心落地场景
MUSE-Autoskill 的技能生命周期管理框架可广泛嵌入以下 AI 驱动型产品:
- 智能客服与 IT 运维:将高频问题解决方案封装为可测试、可进化的技能,自动生成单元测试与运行时反馈,减少人工维护成本。
- 自动化工作流平台(RPA / 低代码) :为不同业务流程动态创建、组合、优化技能,实现跨任务复用,降低流程搭建门槛。
- 代码生成与软件开发辅助:将代码片段、调试策略等作为技能沉淀,通过 skill-level memory 积累使用经验,提升生成质量与任务成功率。
- 垂直领域专家 Agent(如医疗导诊、金融合规、法律咨询):基于领域知识库按需创建技能,并通过 cross-agent transfer 让不同 Agent 共享已验证的技能包。
商业价值锚点
- 降本:自动创建和评估技能可显著降低手工编写与维护提示词 / 工具的人力成本;技能复用避免重复开发,skill refinement 机制持续优化性能,减少人工干预。
- 增收与效率提升:更可靠的任务执行缩短问题解决时间,直接提高客户满意度或业务流程吞吐量;技能级记忆使 Agent 快速适配新场景,加速产品迭代。
- 体验升级:通过单元测试与运行时评估确保技能质量,减少错误输出;跨会话记忆让 Agent 行为更一致,提升用户信任度。
与现有产品 / 工作流的接口
- 可将 MUSE-Autoskill 作为中间件层,接入现有的 LLM Agent 框架(如 LangChain、AutoGPT)或内部 AI 平台:
- 通过标准化 Skill Package Schema(包含技能代码、测试用例、记忆文件)与现有工具链解耦,便于存储到统一的
skill catalog。 - 利用 文件系统布局 约定(agent home 目录、per-session workspace)直接挂载到容器化部署流程,与 CI/CD 管道集成,实现技能的自动化测试与更新。
- 开放 cross-agent transfer 接口,支持企业内部不同团队开发的 Agent 共享技能,避免重复造轮子。
- 通过标准化 Skill Package Schema(包含技能代码、测试用例、记忆文件)与现有工具链解耦,便于存储到统一的
具体落地 Use Case
电商平台智能导购 Agent 技能库
为商品推荐、优惠券匹配、退换货流程等任务自动生成技能,每个技能包含单元测试与历史交互记忆。当购物节流量洪峰到来时,Agent 可快速复用已优化的技能,同时根据实时反馈自动调整推荐策略,在保障响应速度的同时将人工客服介入率降低 20% 以上。全球内容平台多语言审核技能共享
针对图文、视频审核规则创建一系列技能,通过 skill evaluation 不断校准误判率。新上线的审核 Agent(如不同地区或语言版本)可直接通过 cross-agent transfer 获取已验证的技能包,并利用 skill-level memory 积累本地化调整经验,使审核准确率从冷启动的 85% 提升至 95%,部署周期缩短 70%。
局限
- 仅在 SkillsBench 上验证,任务规模和领域多样性有限:论文实验仅基于 SkillsBench 进行,所覆盖的任务类别和复杂度范围尚不足以证明框架在真实世界多样化任务上的泛化能力。作者在摘要中也将其结果表述为“preliminary evidence”,表明当前评估仍属概念验证阶段,距离大规模实际部署缺少更全面的跨数据集、跨领域和多轮演化实验支撑。
- 技能评估依赖自动生成的单元测试,测试质量决定演化可靠性:技能创建和精化阶段依赖 LLM 生成的单元测试来判定技能是否有效,但测试本身的覆盖度、正确性与稳定性未经过独立验证。若测试存在缺陷,可能导致不合格技能被保留、良好技能被误淘汰,进而累积错误、降低长期自主学习质量。论文未探讨测试评估失效时的鲁棒性对策。
- 技能库规模增长带来的可扩展性问题未被探讨:随着技能不断累积,技能级记忆和检索机制的存储与查询开销将线性甚至超线性增长,论文未分析在大规模技能目录下的检索延迟、内存占用以及上下文选择效率。在需要实时推理的场景中,当前基于相似度或标签的简单选择策略可能会遭遇瓶颈,限制框架的长期自演化能力。