论文

ExpVoyager: 面向动态 Agent 技能合成的直接经验导航

ExpVoyager: 面向动态 Agent 技能合成的直接经验导航

LLM agent 从经验中学习已成为构建自我进化 agent 的关键范式,使其能够持续学习并扩展能力。在这一范式下,agent 技能合成 被视为将积累经验转化为可复用程序性知识的重要方案,也是运行时为 agent 提供支持的 harness 系统 中的关键一层。然而现有方法大多在下游需求未知之前,就把过往经验抽象为固定的程序性知识,因而可能丢弃后续变得关键的知识,同时保留与未来任务无关的实例细节。 本文将 agent 技能合成 重新表述为在历史经验上的 动态导航问题:agent 针对当前任务按需主动探索累积轨迹,并对经验知识进行有针对性、细粒度的访问。为此我们提出 ExpVoyager,该框架中的 skill curator 在不同视图与分辨率下导航原始经验,在观察过程中持续识别可复用的程序性知识,同时追踪剩余的知识需求,以指导下一步导航方向。 大量实验表明 ExpVoyager 兼具有效性与通用性:在 下游任务性能 上取得一致提升,随经验空间扩展获得持续增益,并在高效经验访问下与现有技能保持实用兼容。

论文精读

TL;DR ExpVoyager 把 LLM Agent 技能合成从一次性静态抽象改为按需导航原始经验:面对当前任务主动检索细粒度轨迹、持续提炼可复用程序性知识,避免丢失未来关键信息,提升下游任务表现。

问题

问题背景:LLM 智能体通过经验学习实现自我进化,技能合成(skill synthesis)将历史经验转化为可复用程序性知识,成为运行时 harness 系统的关键层。

现有方法局限:主流方案在明确下游任务前,将累积轨迹抽象为固定技能库(如 AWM、Trace2Skill)。论文的初步分析显示,这类预构建技能丢失了大部分未来任务可用的程序性知识;同时保留了大量与未来任务无关的实例细节,造成干扰。此外,现有经验检索方法对目标相关知识的访问粒度有限,难以按需获取细粒度程序性知识。

为什么难/重要:任务需求动态变化,经验空间持续增长,固定技能库无法适配。核心挑战在于:运行时如何从原始经验中高效定位并提取与当前任务相关的程序性知识,同时不丢失关键步骤和条件依赖。这对自进化智能体的长期扩展性和实用性至关重要,业界对运行时知识供给系统(harness)的关注度持续上升。

行业类比:类似推荐系统从静态用户画像转向实时序列检索,以动态适配当前上下文需求。

核心洞察

  • ExpVoyager 将技能合成重构为对原始经验的按需导航,改变了“先抽象后使用”的固定范式。 传统方法(如 AWM、Trace2Skill)在任务未知前就把轨迹压缩成固定技能,导致下游需求变化时丢失关键程序性知识。ExpVoyager 保留原始经验为可导航存储,技能策展者根据当前任务实时探索,跨不同视图和分辨率检索知识片段,既减少无关细节保留,又避免提前丢弃潜在有用信息,更接近人类在解决问题时按需查阅记忆的方式。
  • 核心机制在于将“导航状态”显式建模,使经验访问成为多轮、目标驱动的搜索过程。 与简单的经验检索(如 top-k 相似轨迹)或一次性 agentic search 不同,ExpVoyager 在每一步导航中跟踪剩余知识需求,指导下一轮查看哪些轨迹片段,从而动态补全技能合成所需的条件、动作顺序和结果关联。这种状态管理让经验访问的粒度更细,且能适配长尾任务,实验显示随经验空间扩大性能持续提升,表明可扩展性。

方法

输入

ExpVoyager 接收两类输入:过去积累的原始经验轨迹(包含动作、状态、结果、推理记录)以及当前目标任务 t。

关键模块

框架由三个核心模块构成:

  1. 可导航经验接口(Navigable Interface):根据 3.2 描述,将原始经验组织为多视图、多分辨率的索引结构。技能策展人(skill curator)可按需从不同视角(如动作序列、观察结果、目标条件)和不同粒度(单步、跨步、轨迹级)访问经验片段,避免一次性全局检索带来的噪声。
  2. 导航状态管理(Navigation State):对应 3.3,维护一个动态状态,记录已提取的知识与剩余知识需求。每轮观察后,状态模块评估当前覆盖情况,并决定下一步导航方向(例如定位关键动作-结果对、检查目标条件),实现 closed-loop 探索。
  3. 技能合成器(Skill Synthesizer for Frozen Executor):根据 3.4,将导航过程中确认的可复用程序性知识固化为面向冻结执行器的可执行技能(如指令、规则或提示),不改变下游模型参数,保证即插即用。

输出

输出为针对当前任务定制合成的技能,可直接被下游冻结的执行器调用,提升任务成功率。

与同类方法的关键差异:现有工作(如 Trace2Skill / AWM)在需求未知时提前将经验抽象为固定技能,丢弃后续可能关键的知识;ExpVoyager 改为按需动态导航,以定向、细粒度方式访问经验,保留必要上下文同时避免无关细节。

实验

实验设计

  • 在 ALFWorld / WebShop / ScienceWorld 三个交互式决策任务上评测。
  • 基线包括 AWM、ReasoningBank、Trace2Skill、SkillTTA,覆盖记忆管理、经验检索与技能合成方法。

关键发现

  • ExpVoyager 在下游任务性能上获得一致提升(具体数值见原论文,摘要未提供)。
  • 随着经验空间扩大,ExpVoyager 表现出持续增益,说明动态导航能有效利用新增经验。
  • 与现有技能兼容,支持高效经验访问,验证了框架的可插拔性。

对比解读

与传统预构建技能的方法不同,ExpVoyager 将技能合成视为对过往经验的按需导航问题。

  • 前期分析显示,固定技能会丢失大量对后续任务有用的过程性知识,而经验检索范式访问目标相关知识的能力有限。
  • ExpVoyager 通过多视角、多分辨率导航 + 状态管理,精准定位可复用知识,从而在动态任务中取得优势。

行业影响

落地场景

ExpVoyager 适用于需要 持续从历史执行轨迹中提取可复用技能 的 LLM Agent 系统。具体场景:

  • 企业级 IT 运维 / DevOps:处理告警或故障时,动态导航相似运维案例,合成排查步骤与修复脚本。
  • 客服与知识管理:面对新问题类型,按需遍历历史对话,生成针对性的回复策略,而非固定的 FAQ。
  • 代码助手 / 软件工程 Agent:修复 bug 或实现新功能时,从过往代码交互轨迹中检索相关片段,生成针对当前代码库的修改步骤。

商业价值

  • 降低人工整理成本:避免手动抽象固定流程,skill curator 自主导航原始经验生成技能,减少专家系统维护开销。
  • 提升任务成功率和用户体验:实验显示经验空间扩大时 ExpVoyager 带来持续增益,Agent 越用越准,降低重复劳动。
  • 高效经验访问的降本:通过定向、细粒度访问而非全量检索,减少 token 消耗和延迟,降低每次调用的成本。

现有产品 / 工作流接口

ExpVoyager 可作为 技能合成中间层 集成进 LangChain、AutoGen 等框架:

  • 连接企业的经验存储(向量数据库 / 对象存储),作为 navigable interface 的数据源。
  • 暴露 navigation state 的 API,允许上层调度器控制导航;合成技能注册到 frozen executor。
  • 与现有技能库兼容,补充人工技能,不改变下游执行器调用接口,降低改造风险。

具体 use case:

  1. 在 电商客服平台,Agent 收到物流延误导致的退货咨询,从历史工单导航到“物流异常处理”和“退款流程”轨迹,合成包含条件判断(如“若物流状态为已签收但用户未收到”)的新技能,嵌入现有工单自动回复流水线。
  2. 在 金融机构的合规审查 中,合规 Agent 需对新监管条款生成 checklist,ExpVoyager 从历史合规报告轨迹中按需定位审查步骤与风险点,合成动态审查程序,避免预先固化过时的 checklist。

局限

  • ExpVoyager 依赖 LLM 作为 skill curator 进行多步导航和技能合成,整个过程涉及多次推理与经验访问,计算成本与延迟显著高于一次性预构建技能或简单检索方法。在需要快速响应或资源受限的场景(如移动端、高并发服务)中,这种动态合成机制可能难以直接部署,论文未提供成本或延迟的量化分析。
  • 论文实验仅覆盖 ALFWorld、WebShop、ScienceWorld 三个合成模拟环境,任务类型集中在文本交互、网页操作和简单科学推理,缺乏对真实世界、多模态、长期规划或开放领域任务的验证。经验数据的格式和导航接口的设计可能高度依赖这些特定环境的特性,泛化能力存疑。
  • 论文中构建的可导航经验接口需要预定义视图和分辨率,这意味着经验表示仍然需要人工设计或领域知识,难以完全自动化。当经验数据高度异构或噪声较大时,导航和知识识别的效果可能下降。此外,与现有技能的兼容性仅在部分场景验证,实际系统集成时可能面临接口适配和技能冲突问题。
论文Kwangwook Seo2026-09-26原文

相关内容