DAEDALUS: 从自生成任务中自举 Agent 记忆
LLM agents 在新环境中常缺乏可靠行动所需的操作知识,需自行摸索工具行为与环境约定;若没有过往尝试的记忆,就会在任务间重复犯错,导致失败更多、轨迹更长。现有系统多依赖人工指南,或依赖由训练任务与 oracle verifier 构建的过程记忆,二者都需要环境先验知识。 我们提出 DAEDALUS,无需已有任务或 oracle verifier,即可从自生成练习中自举可复用的 agent 记忆。它配对两个 agent:explorer 与环境交互并生成有挑战但可解的任务;solver 尝试求解。每次失败被归纳为一条 heuristic,仅当 solver 在上下文中反复成功后才被接受,这些结果又反馈给 explorer 调整任务难度。被接受的 heuristics 最终整合成记忆库供测试时使用。 在 AppWorld、τ^2-bench 与 AutomationBench 上,DAEDALUS 相比无记忆基线平均成功率提升最多 15.9 个百分点,pass^5 提升最多 2.2x,与使用训练任务的方法相当,推理成本却低于多数方法。小探索预算下即可见增益,其 heuristics 也能惠及其他模型家族的 agent;消融表明 solver traces 是推导有效 heuristics 的关键,early discoveries 的分解使探索更省成本。生成任务还可作为 benchmark 的代理来排序模型。
论文精读
TL;DR DAEDALUS 通过探索智能体自生成可解任务、从失败中提炼启发式记忆,无需人工指南或 oracle 验证器,在多个基准上显著提升智能体成功率。
问题
问题背景
LLM agent 在新环境执行任务时,往往缺乏对工具行为 和环境惯例 的操作知识,导致每次尝试都从零开始,重复犯同样错误。
现有方法的局限
现有 agentic 系统通常依赖人工编写的指南 或基于训练任务 + oracle verifier 构建程序性记忆。前者需要专家持续维护,难以覆盖所有边界场景;后者则需要预先定义可验证的成功标准,在开放环境中往往不可行。两者都隐含了对环境的先验知识,无法直接迁移到全新环境,也不支持 agent 自主扩展记忆。
为什么这个问题难/重要
核心难点在于:如何在无监督、无奖励信号 的情况下,自动生成难度适中、能暴露 agent 缺陷的任务,并从求解失败的 trace 中提取可靠且可复用的启发式。任务太简单无法触发失败,太难则浪费探索预算;同时还需验证每条启发式的有效性,避免错误记忆污染后续推理。业界对 LLM agent 的可靠性要求不断提升,自举式记忆构建可大幅降低人工介入成本,并增强跨环境泛化。
行业类比
类似软件测试中的 fuzzing:通过自动生成大量输入来触发程序异常,DAEDALUS 则为 agent 自动生成练习任务,从失败中提炼操作经验并固化为长期记忆。
核心洞察
- DAEDALUS 的核心创新在于通过失败到成功的轨迹提取启发式规则,并在上下文中多次验证成功后才接受,实现了无需人工指南或 oracle verifier 的记忆自举构建。传统记忆构建要么依赖人工编写环境操作指南,要么利用训练任务和 oracle 验证器,两者都需要环境先验知识。DAEDALUS 的闭环验证机制从 solver 的失败中自动归纳操作知识,并通过重复成功来过滤噪声,保证了启发式的可靠性,同时完全摆脱外部监督信号,大幅降低了在新环境中部署 agent 的前期成本。
- 双智能体分工与课程式任务生成让探索更高效:explorer 根据 solver 表现动态校准任务难度,并分解早期发现以提升生成效率。与随机探索或固定任务集不同,该机制确保生成的任务既具有挑战性又可解,从而持续暴露 solver 的边界并产生有效失败,为启发式提取提供高质量原料。实验显示,较小的探索预算即可获得显著性能提升,且生成的启发式可跨模型家族迁移,表明该方法具有较好的通用性和成本效益。
- DAEDALUS 生成的任务本身可以作为 benchmark 的代理,用于模型性能排名。论文发现,在这些自生成任务上的表现与真实 benchmark 任务上的排名高度相关,说明生成任务的质量和区分度足够高。这一发现为缺乏标注任务或需要快速评估的环境提供了新思路,也侧面验证了 explorer 生成的任务与真实任务分布有足够重叠,进一步强化了该方法的实用价值。
方法
输入: 仅提供对目标交互环境(如 AppWorld / τ²-bench / AutomationBench)的访问权限,无需任何人工编写指南、预定义任务或 oracle 验证器。
关键模块:
- Explorer 代理: 与环境交互,自主生成“有挑战但可解”的任务。它根据 Solver 的反馈动态调整任务难度:若 Solver 频繁失败,则降低后续任务复杂度;若轻易成功,则提高难度,从而维持 Solver 处于学习区间。
- Solver 代理: 尝试完成 Explorer 生成的每一个任务,并记录完整交互轨迹(traces)。
- 启发式提取与验证: 从每次 Solver 失败的轨迹中提取一条候选启发式规则(heuristic)。该启发式必须通过严格验证:将其放入 Solver 的上下文中,让 Solver 在相同或相似任务上反复尝试,只有多次成功后才被接受。此过程称为“failure-to-success heuristic validation”。
- 记忆整合: 所有通过验证的启发式被合并到记忆库(memory bank),用于推理阶段的检索与注入。
输出: 一个可复用的代理记忆库,包含针对该环境的操作知识(如工具行为、环境约定),显著减少重复错误与轨迹长度。
与同类方法的差异: 现有方法要么依赖人工编写的指南,要么依赖由训练任务 + oracle 验证器构建的程序性记忆;DAEDALUS 首次在无任何环境先验知识的情况下,仅通过自生成任务与失败-成功验证闭环,引导出可迁移的代理记忆。
实验
实验设计
在三个基准 AppWorld、τ^2-bench、AutomationBench 上评估 DAEDALUS。对比基线包括 no-memory baseline 以及使用 training tasks 加 oracle 验证器的方法。主要指标为 mean success rate 与 pass^5,探索预算设置为较小值以检验记忆构建效率。
关键发现
- 相比
no-memory baseline,mean success rate 最高提升 15.9 个百分点,pass^5 最高提升 2.2 倍。 - DAEDALUS 在无训练任务的方法中表现最强,且与使用 curated tasks 的方法竞争,推理成本更低。
- 小探索预算即可产生性能增益,生成的启发式可跨模型家族迁移。
- 消融实验表明 solver traces 是推导有效启发式的关键信息源,对早期发现进行因子化处理可提高探索成本效率。
基线对比深度解读
传统 agent 记忆构建依赖人工指南或 training tasks + oracle verifier,需要环境先验知识。DAEDALUS 完全从自生成任务中自举,不依赖任何预定义任务或真实标签,这使其在开放环境中更具扩展性。虽然与 curated tasks 方法相比性能相当,但其推理成本优势显著,适合预算受限的工程场景。不过,该方法仍需环境可交互性,且记忆质量受生成任务分布影响。
行业影响
落地场景
DAEDALUS 适合任何 LLM agent 需要快速适配新环境但缺乏操作知识的场景。典型如:
- 企业自动化平台:Zapier / IFTTT 类产品新增集成工具时,可自动生成工具使用启发式,代替人工编写操作手册。
- 电商运营助手:面对不同店铺后台 API 和 SOP,agent 自动探索生成“发货后必须更新订单状态”“退款需在 24h 内处理”等规则。
- 客服 / IT 支持 agent:接入新工单系统或知识库时,无需人工梳理规范。
商业价值
- 降本:省去人工编写环境指南和调试提示词的人力;减少 agent 反复试错导致的 token 浪费(论文显示推理成本低于多数方法)。
- 增效:在 AppWorld、τ²-bench、AutomationBench 上提升成功率最高 15.9 个百分点,直接减少人工介入和工单升级。
- 加速上线:无需等待专家总结环境规则,小探索预算也能获得收益。
与现有工作流集成
- 作为 agent 部署前的“自举预热”阶段:在测试 / 沙盒环境运行 DAEDALUS,生成记忆库(向量索引或规则库)。
- 推理时复用现有 检索增强(RAG) 框架:根据任务描述检索相关启发式,注入系统提示或上下文窗口。
- 可离线运行,不干扰生产流量;生成的启发式还能跨模型家族迁移。
具体 use case
- 电商店铺运营 agent:自动发现新店铺后台的库存同步规则(如“上架商品需同时设置 SKU 映射”),提升多店铺管理自动化程度。
- 企业 IT 服务台 agent:接入新的工单系统(如 ServiceNow 新版本),自动探索“工单状态流转必须添加评论”等隐藏约定,避免误操作。
局限
- **记忆生命周期缺失**:论文在 Limitations 部分承认未解决记忆的长期维护问题。DAEDALUS 生成的启发式规则在构建后是静态的,随着环境演化或工具更新,旧规则可能失效或需要修订,但方法未提供动态更新机制。这在实际部署中需要额外设计记忆刷新或遗忘策略,否则记忆库会逐渐过时,反而拖累性能。
- **验证覆盖有限**:启发式提取依赖求解器失败后的成功轨迹反推,但验证仅通过多次重复成功来确认,缺乏对规则泛化性的系统评估。当环境状态空间庞大或反馈稀疏时,探索者生成的练习任务可能仅覆盖有限子集,导致学习到的启发式过度拟合特定场景,在未见任务上泛化不足。此外,论文未讨论规则之间的冲突处理,记忆库增大后可能产生冗余或矛盾条目。
- **与训练任务方法相比有分布偏移风险**:虽然 DAEDALUS 摆脱了对预先存在任务和 oracle verifier 的依赖,但自生成任务的分布由探索者决定,可能无法完全对齐真实用户指令的多样性。尤其是当环境具备隐藏状态或长程依赖时,自生成任务可能偏向简单或局部可解的问题,学习到的记忆在实际测试中可能无法覆盖关键边界情况,因此与使用 curated 任务的方法相比,其鲁棒性尚需更多验证。