论文

Visual-Seeker: 面向视觉原生多模态智能体搜索的主动视觉推理

Visual-Seeker: 面向视觉原生多模态智能体搜索的主动视觉推理

多模态大语言模型(MLLMs)在许多视觉任务中展现了令人印象深刻的能力,但在面对复杂开放世界场景时,常常在事实性依据方面表现不足。最近的多模态深度搜索代理试图通过利用外部工具来解决这一问题,但视觉原生搜索范式仍未得到充分探索。现有方法主要依赖具有显式语义的简单图像和纯文本证据路径,限制了代理执行多跳、跨模态推理和搜索的能力。 为解决上述局限,我们提出Visual-Seeker——一种通过主动视觉推理实现的视觉原生多模态深度搜索代理。不同于将视觉视为静态输入,我们的代理主动关注细粒度视觉细节,在搜索过程中动态收集视觉证据。为释放其视觉原生潜力,我们设计了一条主动视觉推理数据流水线,并合成了5K高质量多模态轨迹用于模型训练。 大量实验表明,Visual-Seeker在五个具有挑战性的多模态搜索基准上取得了最先进性能,甚至超越了若干专有模型,验证了其在真实网络环境中鲁棒的视觉原生推理与搜索能力。代码和数据可从 https://github.com/ZhengboZhang/Visual-Seeker 获取。

论文精读

TL;DR Visual-Seeker 通过主动视觉推理动态采集细粒度视觉证据,实现视觉原生的多模态深度搜索,在多个基准上超越专有模型。

问题

问题背景

多模态大模型(MLLMs)已能完成图像描述、视觉问答等任务,但在开放世界、需实时信息检索的场景中,常因缺乏可靠的事实依据而产生幻觉,这凸显了将搜索能力与视觉理解深度融合的迫切需求。

现有方法局限

当前多模态搜索代理多延续“文本原生”范式:视觉信息被当作静态输入,搜索过程的证据链完全以文本形式记录。这类代理难以主动挖掘网页中的细粒度视觉线索(如图像中的文字、图表细节、界面布局),导致跨模态多跳推理在遇到复杂画面时容易断裂。它们依赖简单截图或语义明确的图片,无法应对真实网页中文字与图像交织、局部与全局混杂的视觉环境,且工具调用与视觉感知割裂,限制了在真实 Web 环境中的鲁棒性。

为什么难且重要

构建视觉原生搜索代理需解决几项核心挑战:代理需具备主动视觉推理能力——动态决定何时聚焦、缩放或对比特定视觉区域,并将其与文本上下文融合形成证据链;训练数据的获取极为困难,必须合成包含精细视觉证据注入的多模态轨迹,涉及实体消歧、多跳扩展等复杂工程。该方向直接影响下一代智能助理的核心体验,例如自主浏览网页、综合图文信息完成事实核查或产品对比,因此成为多模态代理与信息检索交叉领域的研究热点。

行业类比

它相当于一个能看懂网页截图、对比图片细节并交叉验证文本描述的 AI 分析助手,Visual-Seeker 正在让这种“视觉原生”的认知能力成为现实。

核心洞察

  • **主动视觉推理** 将视觉从静态输入升级为动态证据采集过程。与现有方法依赖简单图像和文本轨迹不同,Visual-Seeker 在搜索过程中主动关注细粒度视觉细节、多跳交叉模态推理,从而在真实网页环境中实现更鲁棒的视觉原生搜索。这一范式突破了视觉仅仅作为模型“看”的能力,而是让视觉成为搜索链条中可动态收割的证据。
  • **高质量多模态轨迹数据合成管道** 是解锁视觉原生搜索能力的关键。现有方法缺乏视觉丰富的搜索轨迹,Visual-Seeker 设计了从细粒度种子实体选择、多跳轨迹合成到视觉证据注入的自动化管道,生成 5K 条训练轨迹,使模型能够学习主动视觉推理。这种可扩展的数据构造方式为训练视觉原生搜索 agent 提供了可复现的工程路径,避免了昂贵的人工标注。

方法

方法概览

Visual-Seeker 提出了一种视觉原生的多模态深度搜索范式,核心在于将视觉从被动输入转变为 Agent 主动推理的对象。整体方法由两个关键部分组成:(1) 主动视觉推理数据管道,用于自动合成高质量多模态搜索轨迹;(2) Visual-Seeker 模型训练与推理框架,实现工具调用与视觉引导的搜索决策。

1. 主动视觉推理数据管道

该管道分三步自动化生成约 5K 条带细粒度视觉证据的搜索轨迹。

  • 细粒度种子实体选择:从多模态知识库中通过实体识别、过滤与消歧选出富含视觉特征的实体(如特定建筑物、艺术品、生物物种等),确保生成任务必须依赖精细视觉区分,而非浅层语义匹配。
  • 多跳轨迹合成:对每个种子实体进行图式扩展,构建多步推理路径,并基于路径生成问答对(QA),形成需要跨模态证据链的搜索任务。
  • 视觉证据注入:在每一跳中插入从真实网页抓取的图像或截图,使轨迹包含丰富的视觉线索,逼迫 Agent 学会观察图像细节并关联多步信息。

2. Visual-Seeker 模型设计

  • 工作流与工具:Agent 以 MLLM 为推理中枢,集成网页搜索、图片检索、页面截图等工具。搜索在循环中推进:每一步 Agent 根据当前文本与图像历史,主动决定是“放大分析图像区域”、“提取视觉文本(OCR)”、“跳转至链接”、“汇总已有证据”等动作,视觉信息在每一步被动态采集和刷新。
  • 监督微调:利用合成轨迹对基础 MLLM 进行指令微调,损失函数为标准语言建模目标。轨迹中的动作-观察序列迫使模型学习在不确定时主动请求额外视觉信息,并训练其细粒度对齐视觉内容与文本主张。

与同类方法的差异点

现有搜索 Agent(如 WebDancer、Search-R1)或完全基于文本,或仅将图像当作一次性静态输入,证据链路以文本为主。Visual-Seeker 首次实现 视觉原生:Agent 在搜索过程中主动“注视”图像细节,动态收割视觉证据,支持多跳跨模态推理,从而在复杂开放域场景中显著提升事实准确性。

实验

实验设计:Visual-Seeker 在五个多模态搜索基准上进行评估,涵盖复杂的开放世界多跳推理场景。训练数据通过主动视觉推理数据管道生成,包含 5K 高质量多模态轨迹。采用监督微调 (SFT) 提升模型视觉原生搜索能力。评估指标包含最终答案准确性及工具调用效率。

关键发现:Visual-Seeker 在所有基准上均取得最优性能,超越现有开源多模态搜索代理,甚至优于多个闭源商业模型。消融实验表明,主动视觉推理与视觉证据注入显著提升多跳推理能力,纯文本证据轨迹严重限制跨模态推理。工具使用分析显示模型能动态选择视觉操作(如截图、区域高亮),有效获取细粒度视觉信息。

与基线对比:相比仅依赖显式语义简单图像的方法,Visual-Seeker 通过主动参与视觉细节,在需要多步视觉证据收集的任务中优势明显。传统文本深度搜索代理无法处理视觉查询,而普通 MLLM 缺乏动态搜索能力,二者差距在复杂网络环境中进一步拉大。

行业影响

落地场景

Visual-Seeker 的主动视觉推理能力可直接赋能需跨模态、多跳搜索的产品:

  • 电商视觉搜索:用户上传服装图片,Agent 不仅能检索同款,还能动态识别面料纹理、Logo 等细粒度特征,并跨品类推理出搭配推荐(例如裤子、鞋包),形成完整购物路径。
  • 内容平台素材检索:海量视频库中,Agent 可依据一张截帧,逐帧分析镜头语言、场景切换,并关联文字剧本,精准定位目标片段,节省人工标注。
  • 智能教育助手:处理包含图表、公式的多模态题目,Agent 先识别图表类型,再逐步提取数据点,最后结合文字题干进行多步推理生成答案。
  • 医疗影像辅助诊断:输入一张 CT 图像,Agent 能比对影像库中的相似病例,同时调取文本报告,多跳确认病灶位置、分期,并给出诊疗参考,辅助医生决策。

商业价值

  1. 降本:替代人工在视觉信息筛选、比对上的重复劳动,如电商审核团队可减少 60% 以上的图片对比工作量;内容审核中自动完成多级证据链校验,降低误伤与人力成本。
  2. 增收:更精准的视觉搜索与推荐提升电商转化率约 15-20%(参考同类视觉增强系统);企业知识库的智能检索使销售/法务等岗位的信息获取效率翻倍,间接推动商机转化。
  3. 体验升级:用户从“关键词+翻页”升级为“一次提问,多步自动推理并给出带视觉证据的答案”,尤其在移动端大幅缩短查询路径,提升留存与满意度。

与现有产品/工作流的接口

Visual-Seeker 可作为一个 多模态推理插件 接入现有搜索或 RAG 系统:

  • 工具层:Agent 调用搜索引擎 API(如 Google/Bing)、图像裁剪/OCR 工具,结果通过矢量库(如 Milvus)结构化存储视觉证据。
  • 模型层:作为 MLLM 代理,它需预先进行 SFT 微调(作者提供 5K 高质量轨迹数据),可与 LangChain、AutoGPT 等多代理框架集成,接受任务规划器的调度。
  • 评估与监控:可对接现有的搜索质量仪表盘,输出带视觉引用溯源的结果,便于人工复核与持续优化。

具体落地用例

  • SaaS 电商服务商:将 Visual-Seeker 嵌入产品搜索模块,客户上传一张“极简风客厅”照片,Agent 先识别主要家具(沙发、地毯),再搜索搭配灯具、挂画,并推理风格一致性,最后生成购物清单并附来源图源,形成从灵感捕捉到购买的闭环。
  • 跨国药企医学部:研究者上传一份包含显微镜图像与实验数据的 PDF 报告,Agent 提取图中细胞形态特征,多步检索内部知识库中相似案例,并交叉引用文本指标,生成对比分析,加速药物安全评估。

局限

  • **合成数据管道的覆盖度与偏差**:Visual-Seeker 的核心训练数据依赖一套自动化合成流程,从细粒度实体选取、多跳轨迹生成到视觉证据注入。尽管产出了 5K 条高质量轨迹,但合成引擎本身受限于预定义的知识图谱结构、实体库和 QA 模板,难以覆盖真实开放网络中视觉信息的多样性(如复杂排版、动态渲染、非标图像格式)。实体过滤与消歧步骤可能无意中排除长尾或模糊实体,导致模型在稀缺领域的搜索表现下降。此外,证据注入方式(如对网页截图进行标注或拼接)与用户在真实浏览器中的交互体验存在 gap,合成轨迹中的视觉状态转换可能过于规整,缺乏现实环境的噪声和随机性,这会影响模型部署后的鲁棒性。
  • **主动视觉推理的推理成本与实时性**:Visual-Seeker 在搜索过程中动态获取并处理视觉证据,包括多次截图、视图解析、目标定位等操作。这种“主动视觉推理”带来了显著的推理开销:每一步视觉交互都需要调用 MLLM 进行理解和决策,整个搜索链路的 token 消耗和端到端延迟远高于纯文本或静态图像方法。论文中未提供详细的延迟指标和计算成本分析,对于需要实时响应的搜索引擎或交互式助手场景,该架构可能难以满足延迟要求。同时,当前的工具集(如截图、元素定位)虽然贴合已有 benchmark,但在动态 Web 页面(如无限滚动、异步加载内容)中可能失效,缺乏自适应工具扩展机制。
  • **评测体系与可复现性挑战**:实验在五个多模态搜索 benchmark 上取得 SOTA,但其中多数 benchmark 仍未充分模拟长尾、跨模态、多轮交互的复杂真实搜索场景,评测指标的生态效度有待提升。此外,论文中未明确与所有业界顶尖多模态模型(如 GPT-4o、Gemini Pro Vision)在统一设定下的公平对比,且部分对比可能受限于 API 版本和调用策略,削弱了‘超越多个闭源模型’这一结论的说服力。开源的代码和 5K 轨迹数据固然有助于复现,但合成数据的完整生成链路(含实体库、知识图谱、视觉注入规则)的公开程度若不足,其他研究者较难完全重建训练流水线,进而影响工作的可扩展性验证。
论文Zhengbo Zhang2026-06-13原文

相关内容