论文

DAGent:面向深度研究智能体的 Evaluate-then-Grow 规划

DAGent:面向深度研究智能体的 Evaluate-then-Grow 规划

深度研究任务要求智能体在庞大的知识空间中导航、跨众多来源综合证据,并随着新发现不断调整规划。基于 DAG(有向无环图)的多智能体系统契合这一场景,因为它支持并行执行,并将每个子任务隔离在聚焦的依赖上下文中。然而现有 DAG 智能体在执行前就实例化任务级规划,仅在观察到失败或证据缺失后才修补图。这种 Plan-then-Patch 策略对深度研究十分脆弱:系统在证据最薄弱时承诺最强,后续修订还会在本不该规划的分支上浪费算力。 为此,作者提出 DAGent,一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划:Orchestrator 一次一批地生长任务图,每次扩展都以已完成节点的置信度与不确定性信号为条件。分层上下文层默认传播紧凑的 QueryDocs,同时保留完整执行轨迹以供按需召回。记录下的 DAG 拓扑可提供仅凭最终结果无法定义的结构化 RL 信号;DAGRPO 作为 GRPO 的改进版,在 Executor rollout 上注入拓扑条件信用,并对 Orchestrator 规划施加结构合规正则。 在 BrowseComp-Plus、GAIA 与 xbench-DeepSearch 上,DAGent 于 Qwen3-235B-A22B 规模超越最强开源基线 5.3 / 5.8 / 2.0 分,该优势在四个开源主干上均可复现,并延伸至 327K 上下文的 GPT-5。在 Qwen3-8B 规模上,DAGRPO 相较同等预算的 outcome-only GRPO 基线平均提升 3.0 个 Pass@1 分。同架构对比显示,证据条件规划比 Plan-then-Patch 对手以更低的每任务 token、工具调用与步数开销取得更高准确率。代码:https://github.com/hanwenliu6825/DAGent

论文精读

TL;DR DAGent 用 Evaluate-then-Grow 增量规划替代脆弱的 Plan-then-Patch,让深度研究智能体基于已完成节点的置信与不确定性逐步扩张 DAG,结合拓扑条件强化学习 DAGRPO,在多个基准上超越最强开源基线且显著降低推理开销。

问题

问题背景

深度研究智能体(deep research agents)需要处理开放式查询,在 Web 搜索、文档解析、证据综合间动态权衡,已成为 LLM agent 落地的主要赛道。

现有方法局限

当前基于 DAG 的多智能体系统普遍采用 Plan-then-Patch 模式:在执行前一次性生成完整任务图,仅在失败或缺失证据出现后修补。核心缺陷在于在最不确定的规划阶段做出最强承诺——初始计划基于最少的中间证据,却锁定了后续所有分支,导致大量 token 与工具调用浪费在无效或冗余路径上;修补机制无法回溯已浪费的计算,也难以适应深度研究中频繁出现的证据漂移。

为什么这个问题难/重要

深度研究本质是开放域、长程、多步推理,中间发现会显著改变后续搜索方向,静态计划无法应对。同时,业界基准(GAIA、BrowseComp 等)强调端到端准确率与资源效率并重,单纯堆算力或扩大上下文难以持续提升。如何让智能体在证据积累中逐步生长计划,并让 RL 信号利用 DAG 拓扑结构,是该方向亟待解决的核心工程问题。

行业类比

类似 ReAct 智能体用工具反馈逐步修正动作,但 DAGent 将这种“边执行边计划”的思想提升到多智能体图结构层面,对深度研究、自动化尽调等长任务场景有直接借鉴意义。

核心洞察

  • DAGent 的核心是 Evaluate-then-Grow 增量规划:Orchestrator 不是一次性生成完整任务 DAG,而是根据已完成节点的置信度与不确定性信号逐批扩展图。这与现有 DAG 多智能体的 Plan-then-Patch 策略形成对比——后者在证据最薄弱时就过早承诺完整计划,随后只能通过失败后修补来应对,浪费大量计算在不应规划的分支上。同架构对比显示,证据条件规划在更低 token、工具调用和步骤开销下达到更高准确率。
  • DAGRPO 将 DAG 拓扑结构本身转化为强化学习信号:对 Executor rollout 施加 topology-conditioned credit 分配,对 Orchestrator 计划施加结构合规正则化。这是纯结果奖励方法无法定义的。在 Qwen3-8B 规模上,DAGRPO 比同预算的 outcome-only GRPO 基线平均 Pass@1 提高 3.0 点,表明利用图结构进行信用分配能更高效地训练小模型规划能力。

方法

方法概述

DAGent 采用 Evaluate-then-Grow 增量规划范式,流程如下:

  1. 输入:初始任务描述与可用工具集。
  2. 核心模块:
    • Orchestrator 增量扩展 DAG:首先规划第一批子任务节点(通常基于问题分解),提交给 Executor 并行执行。每个节点完成后,Orchestrator 读取其 证据信号(置信度 + 不确定性),决定是否扩展子节点、终止该分支或补充依赖。扩展时只针对有信息增益的方向,而非全局修补。
    • 分层上下文传播:节点间默认传递紧凑的 QueryDocs(提炼过的证据摘要),而非完整执行轨迹。当 Executor 需要更多细节时,可调用 Recall 工具按需拉取依赖节点的完整 trace。这种设计在不丢失可追溯性的前提下控制 token 开销。
    • DAG 拓扑记录:每次扩展后的图结构(节点、依赖、分支)被完整保留,作为后续强化学习的结构化信号。
  3. 输出:满足终止条件的 DAG,其叶子节点答案被汇总为最终响应。

强化学习组件(DAGRPO)

在 GRPO 基础上引入两类结构感知信号:

  • 拓扑条件信用分配:计算 Executor rollout 的优势时,根据节点在 DAG 中的位置(如是否作为关键依赖、是否被多个下游节点引用)进行加权,而非仅用最终结果统一奖励。
  • 结构合规正则化:对 Orchestrator 生成的计划施加惩罚,约束其避免无效依赖、循环(尽管 DAG 本身无环,但需防止不合理边)或过度分支,鼓励生成更“有用”的拓扑。

与同类方法差异

与 Plan-then-Patch 相比,DAGent 不在执行前一次性固化完整计划,而是将规划与证据获取交替进行,使系统在最不确定的阶段保持灵活,避免在初期证据薄弱时过早承诺错误分支。

实验

实验设计

DAGent 在三个深度研究基准 BrowseComp-Plus、GAIA、xbench-DeepSearch 上评估,对比现有 DAG-based 多智能体系统的 Plan-then-Patch 策略。基线采用最强开源模型 Qwen3-235B-A22B 的零样本设定,以及 Qwen3-8B 规模下的 RL 微调(DAGRPO vs outcome-only GRPO)。工具栈与预算保持一致,评估指标为 Pass@1。

关键发现

  • DAGent 在三个基准上分别超越最强开源基线 +5.3 / +5.8 / +2.0 分。
  • 在 Qwen3-8B 规模,DAGRPO 相比同预算 outcome-only GRPO 平均提升 +3.0 Pass@1。
  • 效率分析显示,evidence-conditioned 规划在更低 token、tool-call 和 step 足迹下达到更高准确率,优于 Plan-then-Patch。

基线对比解读

Evaluate-then-Grow 增量规划避免了 Plan-then-Patch 在证据最弱时过早全局承诺的脆弱性,并利用 DAG 拓扑结构引入 DAGRPO 的拓扑条件信用分配与结构合规正则,弥补了仅依赖结果信号的传统 GRPO 不足。同架构对比表明,按需生长图比事后修补更高效。

行业影响

落地场景

深度研究 agent 产品 可直接复用 DAGent 的 Evaluate-then-Grow 规划机制,适用于需要跨多源证据合成、动态调整查询路径的任务:

  • 电商选品与市场情报:自动调研竞品信息、用户评价、价格波动,边收集证据边扩展分析分支,生成结构化选品报告。
  • 金融投研报告自动化:从财报、新闻、监管文件提取关键数据,动态组织分析树,支持假设验证与反方证据追踪。

商业价值

  • 降本:与 Plan-then-Patch 基线相比,DAGent 在同等准确率下 per-task token、tool-call、step 足迹更低,直接减少推理与工具调用成本;开源模型即可部署,降低算力门槛。
  • 增收 / 体验提升:更高 Pass@1 准确率减少人工复核与返工,缩短交付周期;DAGRPO 允许小模型通过结构化信用分配获得增益,提升产品响应质量与用户留存。

与现有产品 / 工作流接口

  • 规划模块替换:现有 ReAct / Plan-and-Execute 流水线可保留执行器与工具栈,仅将规划层替换为 Orchestrator + DAG 增量扩展,集成成本低。
  • 上下文衔接:QueryDocs 压缩机制兼容主流向量库与 RAG 框架,直接对接已有检索组件。
  • 训练侧:DAGRPO 基于 GRPO 变体,可集成到现有 RLHF/GRPO 训练栈,无需额外基础设施。

具体 use case:电商平台内部调研工具(如选品策略、差评归因)与券商研究所的自动研报生成系统,均可在现有 Agent 框架上以 DAGent 替换静态规划,获得更低成本与更高准确率。

局限

  • **评估依赖 LLM judge**:论文使用 LLM judge 评估答案正确性,虽然附录 C.5 报告了人类一致性研究,但开放域深度研究任务的评判标准存在主观性,LLM judge 的偏好可能影响 benchmark 分数的客观性。此外,自动评估协议与真实用户需求之间可能存在偏差,限制了该方法在实际产品中的可信度。
  • **训练与推理开销**:DAGent 的增量规划和 DAGRPO 训练需要维护 DAG 拓扑、角色分离的 credit assignment 以及结构正则化,其计算成本显著高于 outcome-only GRPO。论文仅在 8B 参数规模验证了 RL 收益,对于 235B 等更大规模模型的 RL 训练可行性和成本未作讨论,可能阻碍该方法的实际部署。
  • **对 Orchestrator 能力的强依赖**:Evaluate-then-Grow 策略高度依赖 Orchestrator 的规划与评估能力,如果上游 LLM 能力不足,可能导致 DAG 扩展质量下降、遗漏关键分支或产生错误依赖。此外,实验仅在三个特定基准(BrowseComp-Plus、GAIA、xbench-DeepSearch)上验证,在代码仓库级搜索、长文档 QA 等不同任务形态上的泛化性仍有待检验。
论文Hanwen Liu2026-09-30原文

相关内容