论文

Struct-Searcher: Agentic结构思维推动多模态深度信息搜索

Struct-Searcher: Agentic结构思维推动多模态深度信息搜索

深度搜索智能体因自动收集大规模在线信息以获取目标知识而备受关注,近期研究正从纯文本搜索向多模态场景拓展。然而,现有智能体工作流多遵循证据累积模型,以线性方式聚合信息,缺乏处理异构模态间矛盾信息的有效机制。 针对这一问题,本文提出 Struct-Searcher,一种基于信念修正理论的结构化智能体工作流。该方法在推理过程中显式维护一个动态演化的多模态结构图,实现冲突感知的多模态深度信息搜索。 在多个基准数据集和骨干模型上的实验表明,Struct-Searcher 具有即插即用和模型无关特性:基于五种不同骨干模型,在 BrowseComp-VL 上平均相对准确率提升 17.2% ;同时达到顶尖性能,在 MM-BrowseComp、HLE-VL 和 BrowseComp-VL 上分别比次优方法提高 3.7%、1.5% 和 0.7% 。

论文精读

TL;DR Struct-Searcher 将信念修正理论引入多模态信息搜索,通过动态结构图维护证据一致性,在冲突感知的深度搜索中表现出显著的即插即用提升,相对 Accuracy 平均提高 17.2%。

问题

问题背景

当前,深度研究代理(Deep Research Agents)已成为多模态信息搜索的核心范式,它们能自主浏览网页、图像、视频等多源数据,提取并整合目标知识。随着视觉-语言模型(VLMs)能力的提升,此类代理的工作模式正从纯文本向多模态深度信息搜索(Multimodal Deep Information Seeking)快速演进。

现有方法局限

现有代理工作流大多遵循证据累积模型(Evidence Accumulation Models),采用线性串联、逐步叠加证据的方式形成结论。这类方法缺乏对跨模态、多来源冲突信息的系统性处理机制:

  • 当文本描述与图像内容矛盾时,模型因缺乏结构性表征而无法准确溯源和消解冲突;
  • 证据聚合过程没有显式的信念修正步骤,错误信息可能沿推理链累积;
  • 异构模态间的语义对齐与可信度评估高度依赖隐式偏好,缺乏可解释的修正框架。

为什么这个问题难/重要

多模态信息来源多样,其内在的矛盾性是常态而非例外。例如,同一事件的新闻文本与现场图片可能传递截然不同的信息。若代理无法有效辨识、权衡并修正冲突,输出不仅可能不准确,更可能在关键应用中引发误导。业界对可靠多模态推理的需求日益紧迫,而传统证据累积模型在鲁棒性上已触及瓶颈。信念修正理论(Belief Revision Theory)提供了形式化的冲突消解范式,但如何将其融入端到端的代理工作流,并在大规模多模态数据上保持高效,仍面临表征构建与动态更新的工程挑战。

行业类比

这一挑战可类比于多模态知识图谱问答系统:当用户提问“某产品的实际体验如何”,系统需从评测视频、用户评论文本、官方参数页面等多模态源中提取信息,既能识别营销文案与真实反馈的差异,又能据此调整综合结论,而非简单罗列来源。

核心洞察

  • 信念修正理论实现冲突感知的多模态深度信息搜寻。传统的深度研究代理依赖于证据累积模型,将多模态证据线性聚合,无法有效处理来自不同模态的矛盾信息,导致推理不可靠。Struct-Searcher 首次将信念修正理论引入代理工作流,通过维护一个动态演化的多模态结构图,在推理过程中显式建模并解决信息冲突,而非简单地叠加证据。这一范式转变使得代理在面临不一致信息时能够进行更合理的知识融合,显著提升了多模态信息寻求的准确性和鲁棒性。
  • 可插拔的结构化代理图优于线性证据链。现有方法将信息寻求视为顺序证据收集,缺乏对证据间结构关系的表示。Struct-Searcher 提出构建并实时更新一个多模态结构图,将离散的证据组织为连接的知识网络,使代理的推理过程更贴近人类的结构化思维。该方法不仅在所有测试基准上取得了最优结果,在不同视觉语言模型骨干上平均相对准确率提升 17.2%,还展示了优越的模型无关即插即用能力,为构建更强大的多模态研究代理提供了通用框架。

方法

输入与任务定义

Struct-Searcher 接收一个多模态查询(文本+图像),目标是从大规模在线资源中深度搜寻并整合信息,给出准确回答。与传统搜索不同,它需要处理来自异质模态的证据冲突。

核心模块与工作流

  1. 多模态证据检索:利用 VLMs 或搜索引擎 API 获取与查询相关的文本片段、图像及结构化数据片段,作为初始证据池。
  2. 结构化图构建:将每条证据抽象为图节点,节点包含语义类型(如实体、主张、视觉证据)、置信度及模态标识;边表示支持、反驳或语义关联。该图在推理过程中动态演化,初始时基于检索结果构建骨架,后续随新证据插入而更新。
  3. 信念修正引擎:这是方法的核心创新。当新证据加入时,引擎检测图中是否存在矛盾(如同一实体属性值冲突或视觉-文本结论互斥)。依据信念修正理论(如 AGM 公理体系),优先保留信息量更大、来源更可靠的信念,并调整受影响的部分图结构以恢复全局一致性。该过程采用最小变更原则,避免抛弃有价值信息。
  4. 多步推理控制器:协调上述模块循环运行——持续检索、更新图、执行修正,直到信息覆盖充分且图状态稳定,最终从图中读出答案。

输出与差异点

输出为基于最终图状态的整合答案,可附带引证路径。相比现有方法,Struct-Searcher 摒弃了线性证据累积的范式,通过结构化图与信念修正实现了对多模态冲突信息的原理性处理,这是其准确率提升的关键。

实验

实验设计

实验在三个多模态深度信息检索基准上评估 Struct-Searcher:BrowseComp-VLMM-BrowseCompHLE-VL。为验证模型无关性与即插即用性,作者将 Struct-Searcher 的工作流接入五种不同的视觉语言模型 (VLM) 主干,并在每个基准上对比现有的 SOTA VLM 与深度研究智能体。评测指标为最终答案的准确率,重点关注多模态证据冲突场景下的性能。

关键发现

  • Struct-Searcher 在所有基准和主干上均取得一致提升,在 BrowseComp-VL 上跨主干平均相对精度提高 17.2%,展现出极强的泛化性。
  • 与当前最强基线相比,Struct-SearcherMM-BrowseComp 上相对提升 3.7%,在 HLE-VL 上提升 1.5%,在 BrowseComp-VL 上提升 0.7%,尤其在需要消解异模态矛盾的查询中优势显著。
  • 基于信念修正的结构图能动态维护推理过程中的多模态信息一致性,有效避免线性证据累积模型中的错误传播。

与基线对比的深度解读

传统深度研究智能体多采用线性证据累积,缺乏对冲突信息的建模手段,因此在多模态混合证据下容易输出不可靠结论。Struct-Searcher信念修正机制使其能够在推理过程中显式检测并解决矛盾:当新证据与已有结构图冲突时,不是简单拼接,而是触发更新或删除,这使得最终答案更鲁棒。与纯文本智能体相比,该工作流利用视觉信号本身的结构化特征,构建了跨模态的语义对齐,从而在视觉密集型信息检索任务中取得了显著增益。

行业影响

落地场景

Struct-Searcher 的多模态深度信息搜索能力可直接嵌入需要跨模态冲突消解结构化线索追踪的产品,尤其适合:

  • 电商与内容平台: 智能搜索/客服需同时理解用户上传的图片、文本描述和商品数据库中的不一致信息,给出准确答案。
  • 医疗与金融分析: 整合影像报告、文本病历、市场情报等多源异构证据,在信息矛盾时输出可解释的结论链,提升高风险决策质量。
  • 企业级知识库: 涉及产品手册、故障截图、维修日志等多种模态,Struct-Searcher 能以结构图形式维护推理路径,确保复杂查询不遗漏关键冲突。

商业价值

  • 降本: 其即插即用、模型无关特性避免对底层 VLM 二次训练,快速接入现有 Agent 框架(如 LangChain、AutoGen),降低多模态搜索系统的开发与维护成本。
  • 增收: 显著提升信息搜寻准确率(平均相对提升 17.2%),直接改善用户体验与转化率;例如客服场景中,减少因矛盾信息导致的误回复,提高订单成交。
  • 体验提升: 通过信念修正理论确保回答可追溯、可解释,在医疗、法律等专业领域建立信任,降低因信息过时或冲突引发的合规风险。

与现有产品/工作流的接口

Struct-Searcher 作为 structural agentic workflow 可以轻量集成:

  • 上游多模态检索/抓取 → 提供原始文本、图片、视频片段作为证据节点;
  • Struct-Searcher 冲突消解模块 → 维护动态结构图,基于信念修正更新知识状态;
  • 下游 LLM/VLM 生成器 → 接收已消歧的结构化证据链,合成精准回答。

具体落地实例:

  1. 电商售后智能体: 用户上传商品划痕图片、文字投诉和订单截图,传统 RAG 可能因物流记录与图片描述冲突而给出模糊回复。Struct-Searcher 可构建包含图片特征、文本叙述、物流时间的结构图,自动识别冲突并给出“推测原因→证据支持→置信度”的回答,降低人工客服介入率。
  2. 在线教育研究助手: 学生搜索“光合作用机制”时,系统可能从论文、科普视频和实验图片中抽取相左描述。Struct-Searcher 通过结构图对比不同来源的论点,标注矛盾点并推荐权威解释,提升自主学习效率与可信度。

局限

  • **计算开销与可扩展性未充分讨论**:Struct-Searcher 在推理过程中需动态维护**多模态结构图**并执行**信念修正**,这引入了额外的计算和存储成本。论文未提供复杂度分析或与现有轻量级证据累积模型的具体效率对比,对于需要实时响应的大规模在线搜索场景,其实用性存疑。若节点数与证据量线性增长,图推理可能成为瓶颈,限制该方法在低延迟场景中的部署。
  • **冲突修正策略的领域依赖性**:方法基于**信念修正理论**设计冲突检测与协调规则,但这些规则的有效性可能依赖于任务或数据分布。论文在 **BrowseComp-VL** 等特定基准上评估,未示跨领域泛化能力。当面对高度异构、语义模糊的多模态噪声时,预定义的修正逻辑可能失效,需要额外的人工调参或领域适应,降低了**即插即用**特性的普适性。
  • **对底层 VLM 与源质量的依赖**:尽管宣称**模型无关**,性能仍严重受限于所选 VLM 的理解偏差和在线搜索源的信息质量。若 VLM 在多模态对齐上存在缺陷,或搜索返回的文本/图像包含误导内容,结构图与信念修正可能无法纠正错误链,甚至因冲突检测过敏感而丢弃正确证据,导致结果恶化。实验仅覆盖五类骨干模型,未充分测试极端噪声下的鲁棒性。
论文Fan Zhang2026-06-05原文

相关内容