论文

GraphSkillEvo:图结构 Agent 技能的进化优化

GraphSkillEvo:图结构 Agent 技能的进化优化

技能可通过提供任务特定的过程性指导来提升 Large Language Model (LLM) Agent 的表现,而技能优化则通过迭代精炼进一步增强其效果。然而,现有技能优化方法通常将技能表示为非结构化的自然语言指令,由此带来两大挑战: 1. 非结构化技能往往缺乏显式的工作流级指导,并包含大量冗余,使 LLM 难以执行; 2. 无约束的自然语言技能搜索空间极其庞大,导致技能优化效果不佳。 为应对这些挑战,我们提出将技能表示为 图结构 的自然语言产物。在图结构技能中,每个节点代表一个执行步骤及其操作指导,有向边则编码步骤之间依赖上下文的转移关系。与非结构化技能相比,图结构技能能够提供清晰的工作流级指导,同时也更利于技能优化。 基于这一结构化表示,我们提出 GraphSkillEvo,一个基于种群的进化优化框架,并为图结构技能设计了变异与交叉算子。通过维护多个候选技能并组合其中的有效组件,GraphSkillEvo 能够比纯 LLM 的迭代自我精炼更广泛、更全面地探索结构化技能空间。 在五个 Agent 基准上的大量实验表明,GraphSkillEvo 始终优于强技能优化基线 SkillOpt,在 GPT-5.4-nano 上平均准确率提升 4.01%,在 GPT-5.4 上提升 1.76%。代码已开源。

论文精读

TL;DR 将 LLM 智能体技能表示为图结构(节点=步骤+操作指引,边=上下文转移),并引入种群进化优化框架 **GraphSkillEvo**,相比非结构化技能,可提供明确工作流指引并缩小搜索空间,在多个基准上平均准确率提升 4.01%(GPT-5.4-nano)。

问题

LLM 代理技能优化 是提升代理任务执行效率的关键方向。当前主流做法是将技能表示为非结构化自然语言指令,并通过迭代自我精炼(self-refinement)进行优化。

现有方法的局限主要体现在两方面:

  1. 执行层面:非结构化技能缺乏显式的工作流级指导,且存在大量冗余描述,导致 LLM 在执行时难以准确遵循步骤逻辑,容易遗漏或错误跳转。
  2. 优化层面:自然语言技能的搜索空间几乎不受约束,基于 LLM 的变异和选择只能进行局部探索,难以有效组合来自不同技能的有益片段,优化收敛缓慢且容易陷入次优解。

这个问题之所以重要,是因为代理技能质量直接影响 LLM 在复杂多步任务中的表现。在企业级代理部署中,技能的可解释性、可复用性和跨模型迁移能力都是关键需求。非结构化表示不仅让优化低效,还使技能难以模块化维护和组合,阻碍了自动化持续改进(AutoML for skills)的落地。

行业类比:类似于将单块脚本重构为有向无环图(DAG)流水线,通过定义清晰的步骤节点和条件边,能够显著提升可调试性与自动调优效率。

核心洞察

  • **图结构技能表示** 通过节点和边显式编码执行步骤与上下文依赖,将非结构化指令转化为可执行工作流,同时缩小搜索空间,是提升技能优化效率的关键。与 **SkillOpt** 等基于迭代自我改进的方法不同,后者在非结构化自然语言空间中搜索,冗余高且缺乏工作流约束,难以有效探索。图结构将技能分解为原子步骤和转换关系,既便于 LLM 执行,也允许进化算子对局部组件进行重组,实现更细粒度的优化。
  • **基于群体的进化优化框架** 引入变异和交叉算子,突破单一候选技能迭代改进的局限,通过维护多个候选并组合有效组件,实现更全面的结构化技能空间探索。与仅依赖 LLM 进行逐次修改的 self-refinement 相比,**GraphSkillEvo** 模拟进化算法,在群体中保留多样性,通过交叉组合不同技能的优势节点,能跳出局部最优。实验显示在 GPT-5.4-nano 上平均提升 4.01%,在 GPT-5.4 上提升 1.76%,验证了进化策略在图结构技能上的有效性。

方法

输入

初始输入为任务描述与一组候选自然语言技能(或从任务示例中归纳得到的初始指令)。GraphSkillEvo 首先将非结构化技能转换为 图结构技能:每个节点对应一个执行步骤及其操作指导,有向边表示步骤间的上下文依赖转移。

关键模块

  1. 图结构表示:相比纯文本指令,图结构显式编码工作流,减少冗余并提升 LLM 执行时的步骤清晰度。
  2. 种群进化框架:维护多个候选图技能作为种群。每一代通过 变异算子 和 交叉算子 生成新个体。变异算子修改单个技能内的节点文本、边连接或局部结构;交叉算子组合两个父代技能的有效子图/节点序列,产生融合后代。算子可由 LLM 执行,但搜索空间受图结构约束,避免盲目文本探索。
  3. 适应度评估与选择:在验证任务上运行每个候选技能,以任务准确率等指标作为适应度,选择精英进入下一代,迭代直到收敛或预算耗尽。

输出

输出在验证集上表现最优的图结构技能,可迁移到同任务新实例或其他 LLM(实验显示跨模型迁移有效)。在五个 agent 基准上,GraphSkillEvo 比强基线 SkillOpt 平均准确率提升 4.01%(GPT-5.4-nano)和 1.76%(GPT-5.4)。

与同类方法的差异:不同于 SkillOpt 等依赖 LLM 单点迭代自改进的方法,GraphSkillEvo 通过图结构约束搜索空间,并用种群进化实现更广的探索与组件重组。

实验

实验设计

论文在五个 agent benchmarks 上评估 GraphSkillEvo:SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench (LiveMath)、ALFWorld。基线为 SkillOpt,一种基于 LLM 迭代自我优化的非结构化技能优化方法;评估模型包括 GPT-5.4-nano 与 GPT-5.4。GraphSkillEvo 使用种群式进化框架,对图结构技能执行变异与交叉算子。

关键发现

  • 在 GPT-5.4-nano 上,GraphSkillEvo 平均准确率较 SkillOpt 提升 4.01%;在 GPT-5.4 上提升 1.76%。
  • 图结构技能通过节点表示执行步骤、边表示上下文转移,为 LLM 提供了显式工作流指导,减少了自然语言冗余。
  • 种群进化维持多个候选技能并组合有效组件,比单纯 LLM 自我优化探索更广。

与基线对比解读

SkillOpt 处理非结构化指令,因搜索空间过大且缺乏工作流约束,优化效率受限。GraphSkillEvo 的图表示先验地压缩了有效技能空间,变异/交叉操作可在步骤与转移粒度上重组技能,避免完全依赖 LLM 自由生成。较弱模型 (GPT-5.4-nano) 获益更大,说明结构化技能对执行能力受限的 agent 更有帮助。

行业影响

落地场景

GraphSkillEvo 适用于需要多步骤、条件分支的 LLM agent 工作流,例如电商售后、金融合规、企业 RPA 等。将任务步骤建模为图节点,节点内自然语言 prompt 给出操作指导,有向边编码状态转移,可显著降低 LLM 执行时的歧义和冗余。

商业价值

  • 降本:进化优化自动搜索更好的技能图结构和指令,减少人工 prompt 工程与流程调试成本;图结构降低冗余,推理 token 消耗下降。
  • 增收/体验:论文在五个 benchmark 上平均准确率提升 4.01%(GPT-5.4-nano),直接对应更高的任务完成率、更少人工介入,改善用户满意度。
  • 跨模型鲁棒性:结构化技能可在不同 LLM 间复用,降低模型升级或供应商切换时的重训成本。

与现有产品/工作流接口

生成图结构可导出为 LangGraph 的 StateGraph、Dify 工作流 JSON 或 Coze 流定义;节点对应 tool/LLM 调用,边对应条件路由。进化优化作为离线训练管线:给定任务集和评估指标,输出最优技能图,线上部署时直接将图节点 prompt 与边逻辑注入编排框架。

具体 use case

  1. 电商售后自动化:节点包含“获取订单信息”“判断退款原因”“检查物流状态”“生成补偿方案”,边处理不同退款类型。GraphSkillEvo 优化提示词和分支顺序,减少错误退款与漏处理。
  2. 金融合规报告生成:节点包括“抽取监管要求”“匹配内部政策”“生成合规摘要”“标记人工复核”,边表示信息缺失反馈路径。进化优化选出最有效的步骤衔接和指令措辞,提升报告准确率与合规通过率。

局限

  • **计算开销与初始化成本**:GraphSkillEvo 需要先将非结构化技能转换为图结构,可能依赖额外的人工标注或 LLM 自生成,增加初始化成本;进化优化维护多个候选技能,每轮迭代需对每个候选执行任务评估,计算开销显著高于单一技能迭代优化方法(如 SkillOpt)。论文虽在 Token Consumption 部分展示消耗,但未与其他方法做严格的效率对比,可能限制其在资源受限场景的部署。
  • **图结构的刚性限制**:图结构技能依赖预定义的节点和有向边,要求任务流程可被分解为固定步骤和确定性转移。对于需要动态规划、复杂条件分支或开放域探索的任务,图结构可能过度约束搜索空间,反而降低技能泛化性。论文在五个基准上的实验任务(SearchQA、SpreadsheetBench、DocVQA、LiveMath、ALFWorld)相对结构化,未覆盖更开放、过程不确定的任务场景。
  • **LLM 作为进化算子的固有噪声**:变异和交叉算子均由 LLM 生成,可能引入语义漂移、幻觉或低质量修改,需要额外的验证或过滤机制。论文虽在附录中提及图结构验证(B.3),但未深入讨论 LLM 生成质量对优化稳定性的影响,以及如何避免种群退化。与基于规则或梯度的优化方法相比,可解释性和可控性较弱。
论文Rui Sun2026-09-18原文

相关内容