DuMate-DeepResearch:一个具有递归搜索和基于评分推理的可审计多智能体系统
深度研究(Deep Research, DR)已成为一种新的智能体范式,用于处理复杂、开放的研究任务,要求系统能够迭代地构建问题、获取证据、验证来源并合成长篇报告。然而,当前的DR系统存在四个相互关联的局限:长期规划范围不明确、单个智能体分解和调度此类任务的瓶颈、长文合成中的幻觉风险以及有限的过程可审计性。 本文提出 DuMate-DeepResearch,一种基于 Qianfan Agent Foundry 构建的多智能体DR框架。该框架将负责任务理解、规划和调度的 Agent Core 与可扩展的 工具生态系统(用于检索、证据获取和报告渲染)解耦,使每个中间决策和工具调用都明确可追踪。在此基础上,DuMate-DeepResearch 引入了三种机制:① 基于图的动态规划策略,从粗到细扩展研究路线图,并通过反思、重新规划、回溯和并行分支不断修正;② 递归两级执行设计,将每个复杂搜索子任务委托给一个内部 Search Agent(运行其自身的规划循环),隔离噪声检索并稳定长期执行;③ 基于评分卡的测试时优化机制,动态生成任务特定的质量标准,并作为实时推理支架用于基于证据的综合和自适应停止。 在两个深度研究基准上,DuMate-DeepResearch 取得了新的最优结果:在 DeepResearch Bench 上获得最佳总体得分(58.03%),在 DeepResearch Bench II 上获得最佳总体得分(61.95%),并在信息召回和分析维度排名第一。
论文精读
TL;DR DuMate-DeepResearch 是一个可审计的多智能体深度研究框架,通过基于图的动态规划、递归两级执行与准则驱动推理,在长程研究任务上达到新 SOTA。
问题
问题背景
Deep Research (DR) 作为一种新兴的 agent 范式,旨在自动完成复杂、开放式的信息检索、证据验证与长文报告合成,已成为 AI 研究的热点方向。
现有方法局限
当前 DR 系统普遍存在四项技术瓶颈:
- 长程规划范围模糊:任务初始范围不明确,导致 agent 在大量无关信息中迷失,难以聚焦核心子问题。
- 单 agent 调度瓶颈:单一 agent 需同时负责分解、调度与执行,缺乏并行扩展能力,且检索噪声易导致执行链条断裂。
- 长文合成幻觉风险:生成报告时缺乏结构化质量准则,仅依赖模型内部知识,容易产生事实性错误和逻辑不一致。
- 过程可审计性低:大多数系统为黑箱运行,中间决策与工具调用不可追溯,难以用于高风险领域(如医疗、法律)。
为什么该问题重要且困难
研究任务具有高度开放性和多步依赖性,需要动态调整搜索策略、回溯错误路径并交叉验证信息。上述挑战相互交织:长程规划失败会加剧幻觉,而不可审计又使得错误难以定位。业界对可信、可解释的自动化研究工具需求强烈,但现有方案(如基于 ReAct 的单 agent、LangChain 搜寻器)难以兼顾自主性与可靠性。因此,设计能精细解耦规划、执行与质量控制的架构,成为突破 DR 实用性的关键。
行业类比
类似于金融分析师需要自动收集并交叉分析海量数据生成投资报告——如果系统无法提供可追溯的证据链和动态质量检查,其输出就无法被实际决策采纳,这正是 DR 系统必须兼顾自主性与审计性的写照。
核心洞察
- **多智能体解耦架构结合可审计工具链**:DuMate-DeepResearch 将 Agent Core(任务理解、规划与调度)与 Tool Ecosystem(检索、证据获取、报告渲染)显式分离,所有中间决策和工具调用均可追踪。这不同于大多数单智能体 Deep Research 系统将规划与工具调用耦合在一起的做法,后者往往难以排查长程任务中的错误来源。该解耦设计使系统行为更透明,便于调试与优化,同时通过千帆 Agent Foundry 为复杂研究任务提供了可扩展的工程基座。
- **图动态规划与递归两级执行的深度结合**:框架引入的 coarse-to-fine 图规划策略,能在执行中通过反思、重规划、回溯和并行分支持续修正研究路线图,有效应对范围模糊的长程任务。更进一步,它将复杂子任务委托给内部搜索智能体,由后者运行独立的规划循环,从而隔离检索噪声、稳定执行。这种将全局动态规划与局部递归执行耦合的设计,优于以往依靠静态分解或单智能体顺序执行的方案,显著提升了信息召回率,并在 DeepResearch Bench II 上取得最佳成绩(61.95%),其中信息召回与分析均排名第一。
方法
输入与问题建模
给定一个开放式的深度研究任务(如“分析XX行业趋势”),系统首先将用户请求解析为结构化的研究问题。输入形式上是一个自然语言查询,框架内部会通过 Core Router 将其转化为可执行的任务图谱,包含需要探索的子问题、查询计划和预期的证据结构。
核心架构:解耦的 Agent Core 与 Tool Ecosystem
DuMate-DeepResearch 将控制逻辑与工具能力解耦:
- Agent Core 包含 Router(任务理解与分解)、Planner(规划与动态调度)、Execution Module(按规划调度子任务);
- Tool Ecosystem 提供搜索引擎集成、报告渲染等可插拔能力,所有中间决策和工具调用均被显式记录,支持审计。
这种解耦使得系统在多步推理中保持可追溯性,同时便于扩展新的检索或报告工具。
关键机制一:基于图的动态规划
规划器首先生成一个粗粒度的研究路线图,然后通过 图扩展 逐步细化:
- 将每个子问题作为一个节点,定义其间的依赖与分支关系;
- 在搜索过程中,通过反思、重规划、回溯与并行分支持续修订图结构;
- 动态调整搜索边界,避免在无关方向上过度消耗 token,实现远视规划。
关键机制二:递归两级执行
每个复杂的搜索子任务被委派给一个独立的 Search Agent,该 Agent 内部运行自己的规划循环(多轮检索、评估与重试)。这种递归设计将嘈杂的检索过程隔离在内层,稳定了长周期执行,并缓解单智体上下文窗口膨胀问题。
关键机制三:基于评价量规的测试时优化
系统动态生成任务专属的质量评价量规(rubric),并将其作为实时推理支架:
- 在证据收集阶段,rubric 用于指导检索方向,确保覆盖关键维度;
- 在报告合成阶段,rubric 作为检查清单,驱动自适应停止条件,减少幻觉。 量规的生成由 Planner 在任务初期完成,并在多智体协作中共享,保证不同子任务输出的一致性。
输出与差异点
系统最终输出一份结构化的长报告,包含引用溯源。与同类单智能体 DR 系统相比,DuMate-DeepResearch 通过解耦架构 + 图动态规划 + 递归搜索 + 量规驱动的组合,实现了更高的过程可审计性和任务完成度,在 DeepResearch Bench 和 DeepResearch Bench II 上均达到 SOTA 分数。
实验
实验在两个深度研究基准上进行:DeepResearch Bench 和 DeepResearch Bench II。评估采用标准化协议,包含整体表现、消融研究和定性案例分析。
关键发现
在 DeepResearch Bench 上,DuMate-DeepResearch 取得 58.03% 总分,成为新的最佳结果;在 DeepResearch Bench II 上以 61.95% 总分登顶,并在信息召回和分析子项排名第一。消融实验表明:
- rubric 引导(rubric-grounded reasoning)对长文合成质量有显著正向影响
- 报告阶段模型选择直接影响最终报告得分 定性案例验证了粗到细扩展、图动态规划、递归检索和 rubric 推理支架在复杂研究任务中的有效性。
与基线对比
虽然未给出具体基线名称,但论文宣称超越了先前所有系统。相比单智能体方案,多智能体解耦架构(Agent Core + Tool Ecosystem)使得规划、检索、合成各自优化;图动态规划和递归两级执行缓解了长期规划的视角漂移和噪声累积;rubric 测试时优化将质量评估转化为实时推理支架,显著降低幻觉风险。这些机制共同提升了深度研究的深度、准确性和过程可审计性。
行业影响
落地场景
DuMate-DeepResearch 的多智能体架构与可审计特性,适合需要自动完成长周期信息检索、证据验证与报告合成的场景。典型应用包括:
- 企业知识管理系统:自动聚合内外部数据,生成技术趋势分析、竞品动态监测报告。
- 金融与投资分析:基于多源信息(财报、新闻、研报)进行自动化基本面分析或事件驱动型研报撰写。
- 科研辅助:系统性地进行文献检索、信息提取与综述生成,加速科研工作者的前期调研。
- 内容平台深度专题:从互联网抓取多角度素材,自动生成结构化的长文快讯或行业解读。
商业价值
框架通过解耦智能体核心与工具生态,以及图动态规划和量规引导合成,在三个维度上创造价值:
- 降低成本:将原本由人工分析师或研究员完成的多步骤信息搜集、整理、验证与文案撰写工作自动化,大幅减少人时消耗。递归两级执行设计隔离了噪声检索,提升了长任务执行的稳定性,降低因中间步骤失败而返工的成本。
- 提升收入/转化:对于内容平台或信息产品,更快的高质量报告产出意味着更及时的付费内容供给;在金融场景中,更早更精准的研究分析可辅助投资决策,间接提升收益。
- 体验与信任:全链路可审计(每一步工具调用、规划决策均可追溯)解决了黑盒生成式报告的信任问题;量规机制为报告质量提供了显式评估维度,使最终产出更符合专业机构的标准,提升用户对AI生成内容的采纳率。
与现有产品/工作流的接口
系统设计天然面向集成:
- 工具生态扩展:通过Qianfan Agent Foundry 可轻松接入企业内部数据库、搜索引擎、API服务,将其作为检索工具插入现有工作流。
- 微服务化集成:将框架的Agent Core(任务理解、规划、调度)部署为独立服务,通过API供上层应用(如办公套件、BI系统、聊天机器人)调用,输入自然语言研究任务,直接返回结构化报告与过程审计日志。
- 报告渲染管道:内置的报告渲染工具可将中间产物转换为Markdown、PDF或嵌入前端组件,与已有的内容管理系统(CMS)或文档平台无缝衔接。
具体落地 Use Case
1. 电商平台竞品分析自动化
某全球电商企业的战略部门需要定期监测数十个竞品的定价、营销活动与用户评价。传统上需多人多天完成。引入 DuMate-DeepResearch:
- 输入任务:“分析过去一周主要竞品在社交媒体上的促销策略变化,并评估其对新品发布的影响”。
- 系统通过图动态规划先粗粒度划分任务为“数据采集”“策略分类”“影响分析”,再细粒度展开搜索子任务。
- 递归两级执行:内层搜索智能体独立处理多源检索与去噪,外层规划器监控进度并动态调整路线。
- 量规机制根据任务自动生成评估指标(如“是否覆盖至少3个平台”“分析是否结合历史对比”),驱动合成阶段输出结构化策略报告,并附带每一条数据的信源链接与审计轨迹。
- 结果:一份原本需40人时的报告,可缩短至数小时的自动生成+人工复核,直接提升决策效率。
2. 在线教育平台的个性化学习路径生成
大型在线教育平台希望根据每个用户的学习背景与目标,自动生成包含文献阅读、案例分析和实验项目的综合学习计划。传统规则或单一模型难以保证计划的深度与信源质量。
- 将 DuMate-DeepResearch 集成到平台后端:接收“为具有Python基础、希望入门强化学习的学习者,设计一个为期四周、包含10个实操项目的学习路径”。
- 框架的任务理解与规划模块将任务分解为:列出RL核心概念→搜索优质教程/论文→匹配开源项目→编排顺序与依赖关系。
- 利用递归搜索获取每个概念的多种教学资源,并通过量规(如“资源必须包含可运行代码”“项目难度呈递进”)筛选与合成。
- 最终输出一份带外部链接、难度标签和预计学习时间的动态学习计划,支持随时回溯任意决策依据(为什么选择该文献/项目)。
- 平台借此提供高价值的定制化服务,降低课程设计的人力投入,同时因过程可审计而增强了内容的公信力。
局限
- 尽管 **图动态规划** 通过粗到细扩展与反思回溯提升规划鲁棒性,但其对开放式研究边界的定义仍高度依赖初始任务分解提示。当问题涉及跨学科或高度抽象的查询时,早期粗略阶段生成的子问题图可能引入系统性偏差,后续精细扩展难以完全纠正,导致遗漏关键证据线索。此外,规划器自身的幻觉风险可能影响图结构合理性,论文未讨论相应的故障检测与回退机制。
- 论文引入 **递归二级执行** 将复杂搜索子任务委托给内部搜索智能体,隔离噪声检索并稳定长程执行,但该设计可能带来递归深度失控与智能体间通信迟滞。在极端长程任务(如多轮信息综合、细粒度事实核查)中,内层搜索智能体自主规划循环可能产生冗余搜索或偏离主任务目标,而报告合成阶段若缺少对递归路径的全局一致性校验,可能引入累积错误。目前仅在两个学术基准上验证,缺乏真实世界开放性任务的泛化证据和效率评估。
- **评分标准驱动的测试时优化** 将质量准则作为推理支架,有助于证据接地合成和自适应停止,但其评分标准生成完全依赖大模型,可能隐含模型偏好与训练数据偏差,使得某些类型的研究报告(如争议性话题)的合成不自觉地倾斜。可审计性虽在框架层面强调全程可追溯,但未提供审计指标或用户界面来定量评估追踪链路的质量与完整性,实际落地时审计价值有限。