LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
大语言模型正越来越多地被用于执行复杂工作流,其成功取决于维护相互依赖的约束,并生成满足严格端到端验证的产物。然而,成功的执行经验通常在单次运行后即丢失,迫使后续模型从头重新发现策略和失败模式。本文研究能否通过 EvoMap 将这类经验外部化并复用:它将验证器确认的执行轨迹整合为结构化 Gene。为评估该设定,我们提出 LongWoF-Bench(长工作流基准),包含 778 个可机器验证的任务,覆盖代码生成、智能体-环境合成、数学推理和规则遵循。 在 252 个具有验证器确认 Opus 轨迹的任务上,进化得到的 EvoMap Gene 在全部 7 个评估模型上比 Skill 高出 8.7–15.5 个百分点,优势还扩展到不同模型家族的消费级模型。相比之下,参考蒸馏的 Gene 未表现出同等优势,说明仅靠紧凑表示并不足够,Gene 的效用与验证经验来源密切相关。对于 Claude Opus,复用 Gene 比 Skill 多完成 39 个任务,同时将求解期 token 消耗降低 9.9%。 综上,验证过的执行经验可以被保留并作为可复用外部资源共享,使模型无需反复支付经验发现的全部成本,即可提升长工作流完成能力。
论文精读
TL;DR EvoMap 将验证成功的执行轨迹封装为可复用 Gene,在 LongWoF-Bench 上跨 7 个模型提升长工作流完成率 8.7–15.5 个百分点,并降低 9.9% token 消耗。
问题
问题背景
LLM 正从单轮问答走向端到端复杂工作流执行,成功取决于所有步骤联合满足端到端验证器,而单次成功经验在运行后即消失。
现有方法局限
- 常规做法依赖模型自身泛化或 few-shot 示例,但示例通常为未经验证的参考轨迹,未与验证器确认的成功经验绑定。
- 即使对轨迹进行压缩蒸馏,得到的紧凑表示若不保留 verified provenance(验证来源),就无法传递执行中的关键约束与失败规避策略。
- 此外,每次遇到相似任务都重新探索,重复消耗大量 token,且模型间经验无法共享。
为什么难且重要
长工作流中步骤间存在 相互依赖约束,局部合理不等于全局可验证;任何一处隐含失败都会导致端到端验证失败。经验发现成本高且易丢失,而业界对 workflow automation 与 agent 可靠性的要求不断提升,需要一种可外部化、可跨模型复用的经验表示,以降低重复探索成本。
行业类比
如同 CI/CD 中缓存测试报告与构建产物以避免每次全量重建,这类经验复用机制有望成为长工作流智能体的标准基础设施。
核心洞察
- EvoMap 将经验证器确认的执行轨迹压缩为 Gene,使成功经验可跨任务与模型复用,而不依赖模型内部隐式记忆。与常规知识蒸馏或静态技能库不同,Gene 的构建包含可执行验证器对端到端约束的确认,因而捕获的是可验证的成功路径而非表面模式。实验显示参考蒸馏得到的 Gene 没有同样优势,说明紧凑表示本身不足,经验来源的可靠性才是核心。
- LongWoF-Bench 的评估表明,工作流经验复用必须以 verifiable provenance 为前提,且这种经验可迁移至不同模型家族并降低 solve-time token 消耗。传统 few-shot 或 memory 多缺乏对复合约束的显式验证;而 EvoMap Gene 不仅在所有七个评测模型上超越 Skill 8.7–15.5 个百分点,还在 Claude Opus 上多完成 39 个任务并减少 9.9% token 开销,为长工作流改进提供了区别于参数微调与 prompt 工程的第三条路径。
方法
方法概述
EvoMap 将验证通过的长工作流执行经验外化为可复用的结构化 Gene。整体流程为:验证通过的执行轨迹 → Evolver 提炼 → EvoMap 经验库 → Gene 注入新任务。
- 输入:从 LongWoF-Bench 收集verifier-confirmed execution trajectories。这些轨迹经过机器验证器确认成功,包含任务描述、推理步骤、工具调用与最终产出,并通过了端到端验证(如代码测试、数学答案核对、规则合规检查)。
- 关键模块 1:Evolver 将原始轨迹压缩为 Gene。Gene 是可复用的结构化经验片段,封装了执行关键步骤、约束依赖关系与失败模式规避策略。Evolver 仅从验证通过的轨迹中提取经验,确保来源可靠。
- 关键模块 2:EvoMap 作为经验库,对 Gene 进行索引与检索。当模型面对新任务时,从 EvoMap 中检索相关 Gene,注入提示上下文,使模型无需重新探索即可复用已验证策略。
- 输出:面向新任务的执行指导。相比通用 Skill 基线(通常为一般性提示技巧),Gene 提供任务特定的、经过验证的约束满足方案。
与同类方法的差异
与 reference-distilled Gene(直接从参考数据蒸馏得到的紧凑表示)不同,EvoMap Gene 的优势并非来自表示紧凑性,而来自 verified experience provenance——只有验证通过的轨迹产生的 Gene 才能显著提升任务完成率。这表明在长工作流场景中,经验的真实性与可验证性比单纯压缩知识更为关键。
实验
实验设计
LongWoF-Bench 包含 778 个机器可验证的长工作流任务,覆盖代码生成、智能体环境合成、数学推理与规则遵循。实验选取其中 252 个具有 verifier-confirmed Opus trajectories 的任务,比较 EvoMap Gene 与 Skill 基线。评估在 7 个不同模型上进行,并设置 reference-distilled Gene 作为对照,以区分“紧凑表示”与“经验溯源”的作用。
关键发现
- Evolved EvoMap Gene 在全部 7 个模型上均优于 Skill,完成率提升 8.7–15.5 个百分点,且跨模型家族泛化。
- 对 Claude Opus,Gene 复用相较 Skill 额外完成 39 个任务,同时推理 token 消耗降低 9.9%。
- Reference-distilled Gene 未表现出同等优势,说明仅靠表示紧凑性不足以捕获成功经验,verified experience provenance 是效用的核心。
与基线对比解读
Skill 基线依赖模型自身重新探索,每次运行都从零发现策略和失败模式。Evolved Gene 将验证器确认的执行轨迹固化下来,在复用阶段直接注入,从而避免重复试错,既提升完成率又降低 token 成本。Reference-distilled Gene 来源于参考输出蒸馏,缺乏真实执行中的隐性约束与失败反馈,故无法达到相同效果。这印证了:长工作流经验的外部化必须保留验证轨迹的溯源信息,而非仅做表示压缩。
行业影响
落地场景
- 可验证工作流自动化平台:企业级 Agent 编排(如客服工单处理、合同条款校验、数据 ETL 流水线)可复用 Gene 避免重复试错。
- 代码生成与重构:将已验证的代码修改轨迹固化为 Gene,IDE 插件或 CI/CD 中直接注入,提升复杂重构任务首次成功率。
- 规则密集型业务:金融合规报告生成、保险理赔审批、电商促销规则引擎等场景,Gene 封装规则间的依赖约束,减少逻辑冲突与返工。
商业价值
- 降本:Claude Opus 复用 Gene 后解决 token 消耗降低 9.9%,同时多完成 39 个任务,推理成本直接下降。
- 增效:任务完成率提高 8.7–15.5 个百分点,减少人工兜底与重试,加速长流程任务交付周期。
- 跨模型成本优化:Gene 对 consumer models 同样有效,企业可用更便宜的模型替换高价模型而不损失工作流完成质量。
与现有产品/工作流的接口
- 经验库即服务:Gene 封装为独立 API 或插件,挂载到现有 Agent 框架(LangGraph、AutoGen、CrewAI)的 memory 或 tool 层。
- 与向量数据库互补:Gene 不是简单检索片段,而是可执行约束的压缩表示,需在推理前通过专用检索器注入 system prompt 或 tool schema。
- 生产集成路径:将 Gene 存储于版本化仓库,CI 中通过 verifier 持续验证有效性;运行时由工作流引擎按任务类型动态加载。
关键差异:Gene 的效用依赖 verified experience provenance,仅蒸馏参考轨迹无法获得同等收益,因此企业需要保留 verifier 确认的执行日志,而非简单压缩历史输出。
局限
- - 论文依赖 Claude Opus 的 verifier-confirmed trajectories 来构造 EvoMap Gene,仅在 252 个 Opus 可解任务上评估;对于 Opus 无法完成的长工作流任务,Gene 无法生成或覆盖,因此改进可能被高估且难以泛化到更困难或分布外任务。
- - 实验对比 reference-distilled Gene 表明紧凑表示本身不足,但未深入分析 Gene 的结构设计对泛化的影响(如基因大小、进化代数、变异策略);此外,经验来源仅限 Opus,缺少多模型来源 Gene 的交叉验证,难以说明经验可持续扩展到不同架构与训练范式。
- - LongWoF-Bench 虽覆盖四类任务,但机器验证主要关注端到端可检查的约束,可能忽略需要人工判断的模糊成功标准;且工作流长度、依赖结构的多样性有限,benchmark 是否充分代表真实生产环境中的复杂工作流仍待验证。