论文

OpenSkill: 面向开放世界的LLM智能体自进化

OpenSkill: 面向开放世界的LLM智能体自进化

现有自进化智能体在部署后需要适应,但通常假设存在可用的学习循环(如 curated skills、successful trajectories 或 verifier signals)。真实开放世界部署可能不提供这些,仅给出任务提示。本文研究开放世界自进化(open-world self-evolution),要求智能体从零构建技能和验证信号,仅使用开放世界资源而无目标任务监督。 提出 OpenSkill 框架,引导这一自举循环:从文档、代码仓库和网页获取接地知识(grounded knowledge)与验证锚点(verification anchors),将其综合为可迁移技能(transferable skills),并基于锚点而非目标答案构建的自建虚拟任务(self-built virtual tasks)中优化技能。开放世界同时提供需学习的知识和无监督的练习环境,目标任务监督仅用于最终评估。 在三个基准和两个目标智能体上,OpenSkill 在满足无监督约束下取得最佳自动化通过率(automated pass rate)。分析表明其技能可跨模型迁移,无需模型特定适配;自建验证器从未访问真实结果,但能与地面真实结果对齐。

论文精读

TL;DR OpenSkill 让智能体在无目标任务监督的开放世界中,通过自检索知识与自建虚拟任务进化技能,性能超越有监督方法且技能可跨模型迁移。

问题

问题背景

大语言模型(LLM)驱动的智能体在部署后需要持续适应新任务与环境,自我进化(self-evolution) 成为提升智能体长期自主能力的关键方向。当前研究焦点在于如何让智能体从经验中自动获取可复用的技能,而非依赖一次性微调。

现有方法局限

现有自进化方法普遍假设存在一个可用学习循环,例如:

  • 一个预先准备的技能库或示范轨迹(如 AgentInstruct、AutoAct)
  • 可获取的成功轨迹作为监督信号(如 Reflexion、RISE)
  • 基于任务答案的验证器或奖励模型(如 ETO、AdaRefiner)

在真实开放世界部署中,这些假设可能均不成立——智能体往往只接收到一个任务提示,既无技能片段,也无正确示范,更没有预先准备好的验证信号。因此,现有方案陷入两难:要么依赖人工整理数据而难以泛化,要么在无监督场景下因缺乏评估而随机游走,甚至会因直接或间接暴露目标答案导致验证泄露,使自进化退化为死记硬背。

为什么这个问题难且重要

挑战在于智能体必须从零构建技能和验证信号:它需要从开放世界资源(文档、代码仓库、网页)中提取知识,将其转化为可迁移的技能,同时构造与目标任务同分布但不含答案的虚拟测试来进行迭代改进。整个过程须严格隔离目标任务监督,防止信息泄露。这在工程上要求一体化设计检索、合成、自检、迭代流水线,且要保证自建验证器与真实结果对齐。

该问题的解决对行业意义重大:若智能体能在不被任务答案污染的前提下,利用公开可用的知识自驱进化,则可在软件工程、数据分析、科学研究等众多实际部署中实现少干预、低成本的持续能力扩展,大幅降低对封闭式训练流程的依赖。

行业类比

这类似自动驾驶系统在无真值标注的新区域,仅凭地图、手册和模拟器自主学习驾驶策略——环境提供知识原料和安全的试错空间,但不直接给正确答案。

核心洞察

  • **无监督自举式技能演化**:OpenSkill 实现了一种独特的学习范式,仅依赖开放世界中的文档、代码库和 Web 资源,即可同时构建技能与验证信号,完全不使用目标任务的任何监督(如策划好的技能、成功轨迹或验证器)。这打破了现有自我演化方法对环境假设过强的问题,使得代理能真正在“裸”任务提示下自我提升,为开放世界部署提供了更现实的自我进化路径。
  • **基于锚点的无泄漏自验证**:OpenSkill 通过检索“验证锚点”(如代码约束、配置模板)生成虚拟测试,并在该虚拟环境中迭代优化技能,从而在不接触目标任务真值的前提下实现可靠的自验证。实验表明,自建的虚拟验证器与真实评估结果高度一致,但从未观测过真实答案,从根本上防止了数据泄漏和对目标任务的过度适应,保证了技能的可迁移性和泛化能力。

方法

输入

仅给定一个目标任务的提示(task prompt)和开放世界资源访问权(互联网、文档、代码仓库等),不提供任何目标任务的标注数据、成功轨迹或预训练验证器。

关键模块

Stage 1: 开放世界知识获取

从开放世界检索与任务相关的基础知识和验证锚点。通过查询合成(query synthesis)将任务提示转化为多个子查询,经泄漏过滤(leakage filtering)防止混入目标标签,再进行检索与规划(retrieval and planning)收集高质量文档片段。同时,专门获取验证知识集合 \mathcal{D}^v,从中提取可执行的验证规则、参考示例或环境约束,作为后续虚拟测试的“锚点”。

Stage 2: 无泄漏技能进化

这是自举循环的核心。首先基于获取的知识合成可迁移技能草稿(如代码函数、操作序列等)。然后,利用验证锚点生成虚拟任务 g(virtual-test generation),这些任务模拟目标环境但绝不包含目标答案,仅用于练习。技能在虚拟任务上执行,通过自建的虚拟验证器(基于 \mathcal{D}^v 构建)进行评判。若失败,系统进行 gap-vs-bug 诊断:区分是能力缺口(缺少某些知识)还是技能错误(逻辑或实现漏洞),针对性地触发定向检索弥补缺口,或修正技能。迭代多轮后,根据虚拟测试通过率选择最佳技能。整个过程完全脱离目标标签,形成监督独立的实践环境

Stage 3: 零样本目标评估

进化得到的技能直接应用于目标任务,仅作一次零样本评估,不使用任何目标数据调优。评估指标为自动化通过率(automated pass rate),在同等工作量下与需要监督的方法对比。

输出

一套可跨模型迁移的技能和一个与真实结果对齐的自建验证器,两者均从开放世界资源中自举产出,无需任何目标任务监督。

与同类方法的差异

传统自进化方案依赖精心收集的成功轨迹、固定验证器或部分标签,OpenSkill 完全从零构建技能和验证信号,利用开放世界本身既提供要学习的知识又构建无泄漏的练习环境,真正实现了开放世界部署下的自主进化

实验

实验设计

  • 评估基准:在 SkillsBenchSocialMaze 等三个基准上测试。
  • 目标智能体:与两个目标智能体结合(具体名称未提供)。
  • 基线方法:包括使用监督信号、精选技能或验证器的传统自进化方法。
  • 评估指标:自动化通过率(automated pass rate),满足无目标监督约束。
  • 额外分析:技能泛化性、虚拟验证器质量、消融实验。

关键发现

  • 零监督最优:OpenSkill 在所有基准上达到最佳 自动化通过率,无需任何目标任务监督。
  • 验证器一致性:自建虚拟验证器与真实结果高度一致,从未接触真实标签却能评估任务成败。
  • 跨模型迁移:获得的技能可在不同模型间直接迁移,无需模型特定适配。
  • 虚拟任务有效性:基于文档锚点生成的虚拟任务能构建无泄漏的实践环境,避免直接窥探目标答案。

与基线的深度对比

  • 传统自进化方法依赖于 成功轨迹人工验证信号,在开放世界部署中往往不可获得;OpenSkill 仅利用公开文档和代码库,彻底移除了对目标监督的依赖。
  • 相较于使用真实任务轨迹进行技能提炼的方法,OpenSkill 的 虚拟任务 完全自生成,消除了因任务泄漏导致的评估失真。
  • 消融研究表明,开放世界知识获取泄漏过滤 组件对性能起关键作用,缺少任一项都会导致通过率大幅下降。

行业影响

落地场景

OpenSkill 适用于开放域自适应智能体,尤其在没有标注数据、任务环境持续变化的业务中。

  • 电商智能客服:产品目录、促销政策实时更新,智能体可从商品页面、FAQ 和用户评论中自动抽取可迁移技能(如退货流程、价格匹配),并在自建的虚拟对话中迭代优化,无需人工编写对话模板或标注回复。
  • 内容平台审核与推荐:社区规则、热点话题动态变化,智能体能够从政策文档、判例库中学习审核技能,并自我生成违规样例进行验证,降低对人工审核线索的依赖。

商业价值

核心价值在于降本提升自动化可扩展性

  • 规避了传统智能体监督学习中高昂的人工标注成本(示例、轨迹、验证器),利用开放网络资源自举学习,初始部署和持续维护的人力开销显著降低。
  • 技能具备模型无关迁移能力(实验中跨不同 LLM 仍保持高效),意味着在模型升级或切换厂商时无需重新适配,节省大量工程投入。
  • 自建验证器(virtual verifier)在无真实答案的情况下仍与人工评判高对齐,使得自动化测试和迭代闭环成为可能,加速迭代节奏,最终提升业务响应速度。

与现有产品/工作流的接口

OpenSkill 可作为现有 LLM Agent 框架(如 LangChain、AutoGPT)的一个技能自举与持续进化模块

  1. 输入任务描述 prompt 及开放数据源(文档、仓库、网页)。
  2. 模块内部执行知识获取→虚拟任务合成→技能迭代精炼,输出无监督优化的技能库和验证器。
  3. 输出技能以 functiontool 形式嵌入 Agent 工作记忆,可直接用于零样本任务调用。 集成方式通常为无状态微服务,通过 API 定期接收新的任务描述,返回更新后的技能集合,无缝嵌入 CI/CD 管线,使智能体具备“自我进化”能力。

具体案例

  • 金融服务:智能投研助手每天处理海量新闻与财报。OpenSkill 可从彭博、路透等公开源自动挖掘分析模式,生成虚拟走势预测任务自我训练,最终给出无监督的个股展望,解放初级分析师的重复性工作。
  • 医疗问答:面向最新诊疗指南与药物说明,智能体从 PubMed、药监局公告中抽取知识,合成虚拟问诊案例优化问询技能,部署在患者门户中,提供实时、无监督更新的健康咨询。

局限

  • **虚拟验证器** 与真实结果之间仍存在 **假阳性** 和 **假阴性** 问题。论文附录 C 明确指出,虚拟验证器可能给未正确执行的轨迹打出高分(假阳性),或给正确轨迹打出低分(假阴性)。这种不一致意味着自我进化过程中学到的技能可能并非真正有效,最终评估时会出现性能损失。尤其当虚拟任务的分布与真实任务存在系统性偏差时,验证器偏差会被放大,导致优化目标偏离实际需求。
  • **开放世界资源** 的质量和覆盖度直接影响整个管道。OpenSkill 依赖从文档、代码仓库和网络检索到的知识来构建锚点和虚拟任务。若目标领域资源稀疏、过时或包含错误信息,获取到的知识将不完整或有噪声,进而降低虚拟任务的真实性和技能的可迁移性。在高度专业化或非公开领域中,该方法可能面临根本性困难,限制了其无监督能力的适用范围。
  • **计算开销** 较高,包含多轮检索、规划、虚拟任务生成和迭代优化。论文附录 E 给出了成本估算,但未与简单提示工程或一次性自我改进方法进行系统对比。在实际工程中,频繁调用大语言模型(LLM)和运行检索会增加延迟与费用,对于需要快速部署或低成本运维的场景不够经济。如何在保持进化质量的同时降低推理与检索成本,是方法走向实际应用需要解决的关键问题。
论文Zhiling Yan2026-06-04原文

相关内容