论文

FlowEvo: 通过工作流与可执行技能协同进化实现自进化智能体

FlowEvo: 通过工作流与可执行技能协同进化实现自进化智能体

大型语言模型智能体可以通过在推理时构建工作流来适应复杂任务,但单一回合中发现的流程通常在执行后被丢弃。现有技能库提供了可复用的执行例程,但通常是离线组装,且不会从智能体自身的工作流中成长。我们提出 FlowEvo,一个无需训练、工作流与技能在推理时协同进化的框架。 FlowEvo 将成功的工作流编译为可调用的技能,存入持久化技能库,并通过直接执行或作为构建新工作流的上下文来检索使用。它还会追踪每项技能的下游效用,并抑制导致负迁移的技能。 在共享 GPT-4o-mini 骨干下,FlowEvo 在 ALFWorld、HumanEval、MBPP、GSM8K 和 MATH-500 标准全量划分的 8 个基线中取得最高准确率。在 ALFWorld 上,FlowEvo 达到 85.6%,比最强基线高出 26.4 个百分点,同时只用约三分之一的 token。在跨越 7B 到 671B 参数的 10 个基础模型上,FlowEvo 在 50 个模型-数据集组合中,有 49 个优于 ExpeL。代码已开源:https://github.com/DEFENSE-SEU/FlowEvo。

论文精读

TL;DR FlowEvo 让 agent 在推理时将成功工作流编译为可执行 skill,持续积累、检索与淘汰,实现工作流与技能的协同进化;无需训练,在 ALFWorld 上精度 +26.4 点且 token 消耗约降至 1/3。

问题

LLM agent 在推理时动态构建工作流以适应复杂任务是当前热点,但如何沉淀和复用这些临时过程成为关键问题。

现有方法存在明显局限:

  • 一次性工作流:成功过程在 episode 结束后被丢弃,无法跨任务复用;
  • 离线技能库:预先组装的技能库不随 agent 自身经验增长,缺乏针对性;
  • 无负迁移控制:盲目复用技能可能带来干扰,缺少效用评估机制。

这些问题导致 agent 无法有效积累经验,难以在长尾任务中持续提升。

该问题之所以难,是因为需要在推理时同时解决技能提取、检索增强和效用评估的闭环,且必须保持训练无关、计算高效。业界对自进化 agent 和持续学习高度关注,但多数方案依赖微调或额外标注。FlowEvo 提出工作流与技能共同进化的推理时框架,通过编译成功工作流为可调用技能、跟踪下游效用并抑制负迁移,在不训练模型的前提下显著提升跨任务性能。

类似场景:在 AutoML 中,把每次搜索得到的有效 pipeline 沉淀为可复用组件,并动态淘汰劣质组件,从而加速后续任务的设计空间探索。

核心洞察

  • FlowEvo 的核心洞察是工作流与可执行技能在推理时形成共演化闭环:成功的工作流被编译为可调用技能存入持久化技能库,后续任务既可检索技能直接执行,也可将其作为上下文辅助构造新工作流。相比现有技能库通常离线构建且不随智能体自身经验增长,或工作流一经执行即被丢弃,FlowEvo 首次让二者在推理阶段相互增强,实现训练无关的自我进化。
  • FlowEvo 通过追踪每个技能的下游效用并抑制造成负迁移的技能,解决了技能库持续扩张后质量下降的问题。多数检索式技能库方法仅关注正向检索收益,缺乏对无效或有害技能的动态管理;FlowEvo 引入效用追踪与技能策展机制,在 ALFWorld 上以约三分之一 token 消耗高出最强基线 26.4 个百分点,证明了负迁移抑制对推理效率和准确率的双重价值。

方法

输入:给定任务 prompt 与当前持久技能库(persistent skill bank)中检索到的相关技能。

关键模块

  1. 工作流生成:LLM 基于任务和技能上下文生成工作流(如 ALFWorld 动作序列、代码或数学推理步骤)。检索到的技能可被直接执行,或作为上下文辅助构造新工作流。
  2. 技能编译:对成功执行的工作流进行 trace-to-skill 编译,提取可复用的 guideline 与动作序列,封装为可调用技能。
  3. 技能库与效用追踪:编译后的技能经 admission gate 存入持久库;每次使用后追踪其下游效用(如准确率、token 效率),对造成负迁移的技能进行抑制或移除。
  4. 技能检索与路由:新任务到达时,按语义相似度检索技能,并决定直接执行或作为上下文,形成工作流 → 技能 → 工作流的循环。

输出:任务执行结果(动作、答案或代码),同时更新技能库内容与效用统计。

与 ExpeL 等离线组装技能库或一次性工作流方法不同,FlowEvo 在推理过程中让工作流与技能在线相互促进、持续增长,并通过效用追踪主动抑制负迁移,而非仅静态复用。

实验

实验设计

在 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 五个标准切分上评估。使用统一骨干 GPT-4o-mini,与 8 个基线对比,并跨 10 个基座模型(7B–671B)与 ExpeL 做鲁棒性对比。

关键发现

  • ALFWorld 准确率 85.6%,比最强基线高 26.4 点;token 消耗约为其 1/3。
  • 在全部五个基准上获得最高准确率。
  • 50 个模型-数据集对比中,49 个优于 ExpeL。
  • 训练-free,仅推理期通过工作流与技能共演化提升。

基线对比解读

现有技能库多为离线组装,不随 agent 自身工作流增长;一次性工作流执行后即丢弃。FlowEvo 将成功工作流编译为可调用技能,持久化存储并检索复用。其 utility tracking 抑制负迁移技能,避免跨任务干扰。相比 ExpeL,在多数模型-数据组合上稳定领先,说明该闭环机制不依赖单一基座能力。token 效率优势表明直接执行检索技能可避免重复规划成本,对工程实践具有直接参考意义。

行业影响

落地场景

FlowEvo 适合需要长期执行多步骤任务的 agent 产品:

  • 企业服务 / RPA:将重复出现的工作流自动编译为可调用 skill,例如客服工单处理、数据清洗流水线,减少重复生成 prompt 和推理开销。
  • 教育 / 代码生成:在 HumanEval、MBPP 等编程任务中,将成功解题过程沉淀为 skill,后续遇到相似题型可直接复用执行或作为 few-shot 上下文,提升生成质量。
  • 内容平台 / 电商:多步骤商品信息抽取、内容审核流程中,skill bank 可随业务数据分布漂移持续更新,无需离线重新训练。

商业价值

  • 降本:在 ALFWorld 上用约 1/3 token 达到更高准确率,直接降低 API 调用成本;推理时自进化避免昂贵微调。
  • 提效:训练免框架允许任何基座模型接入,跨 7B 到 671B 模型验证,减少模型迭代周期。
  • 体验提升:通过抑制 negative transfer 的 skill 管理机制,避免错误技能污染,保持输出稳定性。

与现有 stack 集成

FlowEvo 可嵌入已有 agent 框架:

  • 接口:作为 skill library 模块接入 LangChain / AutoGen 等框架,将成功 workflow 输出为可调用 tool / function。
  • 存储:bank 使用 JSON 或矢量数据库,skill 检索可直接接现有 embedding 检索服务。
  • 迭代:追踪每个 skill 的 utility score,按阈值准入/淘汰,兼容现有监控与 feedback loop。

具体用例:

  1. 电商客服 agent:将“退货退款流程”从成功对话中编译为 skill,后续相同诉求直接执行,降低平均处理时长与 token 消耗。
  2. 自动化测试生成:在 CI 中让 agent 维护测试用例生成 skill,新功能需求到来时优先执行已有 skill 快速产出基线测试,再补充新用例。

局限

  • **冷启动与成功轨迹依赖**:FlowEvo 的技能编译完全依赖于成功工作流,在初始阶段或面对全新任务分布时,技能库可能长期为空或缺乏针对性,导致早期探索成本高、提升缓慢。虽然可通过检索上下文辅助工作流构建,但尚未提供有效的 warm-start 机制(如从离线语料预填技能库),也未讨论在稀疏奖励环境下如何加速积累可复用技能。此外,方法在 ALFWorld 等环境中的显著增益部分来自其确定性动作空间与可验证成功判定,对于更开放、长程、多模态的任务是否同样有效缺乏实验支撑。
  • **技能库维护与超参数敏感性**:框架引入 admission gate、效用追踪与负迁移抑制等机制,需设置多个阈值与配置常数(如最低使用次数、效用衰减因子),这些超参数在论文附录中给出但未系统分析其敏感性。随着技能数量增长,检索质量和存储开销成为潜在瓶颈;若效用估计受任务采样噪声影响,可能误删有用技能或保留退化技能。论文未展示长周期(数千 episode)下的技能库稳定性与计算成本,也未对比更轻量的经验回放或固定记忆库方法。
  • **基准范围与基线选择局限**:实验主要覆盖 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 等离散、短程且大多有明确答案的任务,未包含需要长期规划、工具使用或多智能体协作的复杂环境(如 WebShop、ScienceWorld、AgentBench)。在跨模型实验中仅与 ExpeL 对比,缺乏与更多同类推理时工作流/技能方法(如 ADAS、Voyager)的直接比较。训练无关的设计虽然灵活,但在具有大规模标注数据的场景下可能不如微调技能模块的精度上限,该 trade-off 未被量化讨论。
论文Zeyu Ren2026-08-20原文

相关内容