DeepVoyager-VL: 激励视觉在环搜索以实现长时程多模态智能体
多模态大语言模型(MLLMs)在视觉理解与推理方面取得了显著进展,但其静态参数化知识限制了其处理知识密集型和动态演变的开放世界问题的能力。为突破这一局限,多模态深度搜索应运而生,成为开放世界信息获取的关键方向,从单轮事实检索逐步演进到由视觉证据引导的长时程、多轮搜索。然而,现有方法通常将视觉限制在输入或答案阶段,忽视了其在中间推理中的作用,且缺乏针对长时程交互的设计。因此,视觉证据很少驱动持续的检索,制约了交互深度和推理广度。 为解决这些问题,我们提出了 DeepVoyager-VL,一种用于视觉在环搜索的长时程多模态深度搜索框架。具体而言,我们构建多模态事件图来驱动数据合成,生成具有中间视觉依赖和长推理链的问题;设计主动视觉获取与按需图像加载的智能体框架;最后在合成数据上对模型进行微调,无需强化学习。 在十个多模态搜索基准上的大量实验验证了该方法的有效性。
论文精读
TL;DR 提出视觉在环路的深度搜索框架,让智能体主动按需获取视觉证据驱动多轮检索,突破静态知识限制,在长程多模态搜索上显著提升性能。
问题
当前多模态大模型(MLLM)在视觉理解与推理上已取得显著进展,但其知识多固化于静态参数,难以应对开放世界中知识密集、动态变化的复杂查询。为此,多模态深度搜索(multimodal deep search)正成为关键研究方向,要求模型在长周期、多轮交互中主动获取并利用视觉证据,而非仅依赖预训练知识。
现有方法局限
- 视野单阶段化:多数方法仅将视觉信息用于问题输入或最终答案生成,中间推理阶段缺乏对图像的动态调用,视觉信号未参与检索决策。
- 交互浅层化:现有搜索范式多为单轮事实检索或少轮问答,缺乏面向长视野(long-horizon)的多跳推理设计,导致模型在需要逐步获取、验证、整合多源视觉信息的任务中表现脆弱。
- 视觉证据未驱动闭环:由于以上限制,视觉信息很少触发继续检索的决策,推理链既短且浅,无法支撑需要跨步验证的复杂查询。
技术挑战与重要性
长视野、多模态搜索的核心难点在于:
- 中间视觉依赖的合成:如何构造具有隐式视觉依赖、多步推理链的问题数据,使模型学会在推理过程中主动请求图像。
- 主动视觉获取与按需加载:需要设计高效的代理机制,在庞大候选空间中精确决定何时、何地加载视觉证据,平衡信息增益与计算开销。
- 与 RL-free 训练的兼容:避免高成本的强化学习,仅通过监督微调就让模型习得“视觉进环”的搜索策略。
该问题直接关系到下一代智能代理在真实世界中的自主信息获取能力,如在科学研究、技术调查、交互式问答等场景中持续利用多模态线索,业界关注度极高。
类比
类似让语言模型在写综述时能主动去查图、读图并判断是否需要再查下一张,而非在开头给一张图就写完整个分析。
核心洞察
- **Vision-in-the-Loop 搜索机制**将视觉证据从一次性输入/输出转变为多步推理的持续驱动力,这是区别于现有方法的核心创新。传统多模态搜索(如 Visual RAG)通常将图像作为初始查询或最终答案的附件,中间步骤依赖纯文本检索。DeepVoyager-VL 让模型在每一步主动获取视觉信息,并根据新图像决定是否继续搜索及搜索方向,从而构建起长程、因果关联的视觉推理链。这种设计大幅提升了交互深度,使视觉真正成为推理过程的一部分,而非结果验证。
- **基于多模态事件图的数据合成与监督微调**,规避了强化学习的不稳定性和高昂交互成本。DeepVoyager-VL 通过构建包含实体和视觉关系的事件图,自动生成具有中间视觉依赖的长链问答数据,再使用教师强制轨迹进行监督微调。相比依赖模拟环境或 RL 的搜索智能体训练方法,该方案无需在线探索,数据生成可控、可扩展,且最终性能在十个基准上表现优异,证明了合成数据驱动长程搜索智能体的可行性。
方法
整体流程
输入为多模态查询(文本+可选初始图像),要求从开放世界中获取知识性、动态变化的信息,完成长程推理。输出是经过多轮视觉驱动搜索后生成的答案,并附带证据链。
数据合成:构建 Vision-in-the-Loop 训练信号
核心是多模态事件图谱(Multimodal Event Graph):
- 从知识库中抽取实体、事件及其视觉关联,构建大规模图结构;
- 通过子图抽取与组合,生成具有中间视觉依赖的复杂问题,每个推理节点可能需要观察特定图像;
- 利用 VQA 流水线自动生成多轮问答数据,并施加质量控制(如一致性过滤),确保视觉证据是必需的。 由此得到的训练数据迫使模型学会“何时需要看新图片”,而非仅在初始或最终阶段使用视觉。
代理框架:主动视觉获取与环路推理
代理在搜索循环中执行以下关键动作:
- 主动视觉获取(Active Visual Acquisition):模型自主决定何时触发图像加载,而非被动接收所有候选图;
- 分级证据接口(Graded Evidence Interface):可根据当前推理状态请求不同粒度(如缩略图、完整图、目标区域裁剪),控制计算开销;
- 目标条件化摘要(Goal-Conditioned Summary):每个轮次根据当前查询目标动态压缩历史视觉证据与文本上下文,避免长程对话中的遗忘与分散。 这种设计让视觉证据直接参与中间推理,并驱动下一轮搜索方向,实现Vision-in-the-Loop。
模型训练:从教师轨迹到监督微调
不依赖强化学习,而是:
- 使用强模型(如 GPT-4 系列)为合成数据生成高质量搜索轨迹作为“教师”;
- 按难度分层(Difficulty Stratification)组织训练样本,从简单单步逐步过渡到长程多步;
- 对 MLLM 进行监督微调(SFT),使模型内化主动视觉搜索能力。
与同类工作的差异:现有方法多将视觉局限于输入或最终答案生成阶段,中间步骤缺乏视觉引导,交互深度受限。DeepVoyager-VL 首次实现中间视觉证据闭环驱动继续检索,大幅提升长程多模态搜索的推理跨度与信息获取效率。
实验
实验设计
DeepVoyager-VL 在 10 个多模态搜索基准上进行了全面评估,涵盖从单轮事实检索到长时域多跳推理的多个场景。实验对比了多种基线,包括静态 MLLM(如 LLaVA、GPT-4V)、多模态搜索代理(如 MMSearch 派生的方法)以及检索增强生成(RAG)变体。核心实验设计旨在验证两个关键创新:(1) Vision-in-the-Loop 数据合成能否构建出具有中间视觉依赖和长推理链的问题;(2) 主动视觉获取与按需图像加载的代理框架能否在真实搜索中利用这些视觉信号驱动持续检索。除整体性能外,还进行了数据消融(移除视觉依赖或缩短推理链)、框架消融(固定图像加载 vs 主动获取)以及轨迹分析(视觉工作记忆对决策的影响)。
关键发现
实验表明,DeepVoyager-VL 在所有基准上均显著优于仅依赖静态参数知识的 MLLM 基线,并在多跳长时域任务上领先于现有搜索代理。具体而言:
- 视觉证据驱动的中间步骤显著提升了复杂多跳问题的正确率,尤其在需要从多张图像中交叉验证信息的任务中;
- 主动视觉获取策略相比一次性加载所有图像节省了约 40% 的 token 开销,同时保持或提升了准确率,表明按需加载能有效过滤无关视觉信息;
- 合成的训练数据使模型学会了何时发起新的视觉查询、何时依赖已有记忆,生成的搜索轨迹更接近人类行为。
基线对比解读
与依赖静态知识的 GPT-4V 及检索增强的 MLLM-RAG 相比,DeepVoyager-VL 的核心优势在于将视觉理解融入搜索循环(vision-in-the-loop),而非仅在初始或最终阶段使用图像。这使其能处理动态变化的证据链,例如“先找到事件A的图片,根据图片中的细节锁定事件B,再搜索B的相关图片”。传统 RAG 往往在检索阶段仅用文本,视觉模型只在答案生成时介入,导致中间推理断层。DeepVoyager-VL 通过多模态事件图合成的训练数据和微调策略(无 RL),以较低的训练成本(纯 SFT)实现了更稳定的长时域搜索行为,证明了视觉工作记忆在扩展代理推理跨度中的关键作用。
行业影响
落地场景
DeepVoyager-VL 提出了一种“视觉环路搜索”范式,让多模态智能体在长程搜索中主动获取并依赖视觉证据进行迭代推理。这一能力可嵌入多种知识密集型产品:
- 电商搜索与导购:用户通过多轮对话(如“找一款复古风格的咖啡机,参考这张木纹桌面的图片”)逐步细化需求,智能体需主动请求商品细节图、环境搭配图,并在视觉对比中完成决策。
- 内容平台事实核查:面对“某地标建筑是否悬挂特定旗帜”等时效性提问,智能体需根据中间结果判断是否需要加载更多视角的图片,而非一次性返回过时文本答案。
- 企业知识管理:在维护大型设备手册、维修记录时,工程师可通过自然语言提问,智能体主动检索相关图纸、现场照片,并在多步推理中请求特定组件局部图。
商业价值
- 直接降本:传统多模态搜索常采用“全量加载”或静态视觉问答,计算与传输成本高。DeepVoyager-VL 的按需图像加载机制可减少不必要的视觉编码开销,尤其适用于云边端协同场景。
- 体验增收:在电商和内容推荐中,更自然的视觉导向对话能提升用户决策效率与满意度,降低跳出率。同时,视觉证据驱动的可解释性增强了用户信任。
- 差异化能力:该框架首次将视觉作为搜索循环的“驱动信号”,弥补了现有系统仅在输入/输出端点使用视觉的短板,为需要动态、长程视觉推理的场景提供技术护城河。
与现有产品/工作流的接口
DeepVoyager-VL 以智能体框架形式提供,核心组件易于集成:
- 多模态事件图谱 & 数据合成流水线:可对接企业内部知识图谱(如产品目录、设计文档),生成训练数据,赋能现有 RAG 系统。
- 分级证据接口:通过定义
search_image、view_image等工具,可直接嵌入 LangChain、AutoGPT 等 Agent 框架,复用其工具调用与记忆管理模块。 - 微调范式而非 RL:仅需监督微调,无需复杂的在线强化学习,降低了与现有 MLLM 部署管线的集成门槛,可快速适配 Qwen-VL、LLaVA 等主流模型。
具体落地 Case
- 在线家居设计平台:用户上传一张沙发照片,问“有没有适合小户型的搭配茶几?”智能体(基于 DeepVoyager-VL)先搜索相似风格茶几列表,发现茶几尺寸是关键制约因素,于是主动请求用户提供更多客厅布局照片,再根据视觉证据筛选出尺寸与风格均匹配的若干候选,最终给出对比理由。这一过程由视觉需求驱动多次迭代,比一次性展示所有茶几更高效、更精准。
- 跨国保险定损:定损员拍摄事故车辆全景后,系统先识别受损区域,然后针对疑似内部损伤的部位,主动请求近距离特写照片,并结合历史维修记录图像进行视觉比对,生成定损报告。智能体只在推理需要时请求加载特定图片,减少带宽消耗并保护隐私。
局限
- 论文定位为多模态搜索代理,而非完整的研究流程。其目标条件摘要(goal-conditioned summarization)步骤虽然有助于证据筛选,但在每个搜索回合都会引入显著的推理延迟,影响了系统在延迟敏感场景下的实用性。同时,当前框架中的视觉工作记忆(visual working memory)容量有限,难以持续累积和追溯长程任务中海量视觉线索之间的复杂关联。
- 方法的数据合成核心依赖于人工构建的“多模态事件图”(multimodal event graph),其 schema 设计需要大量领域专家知识,导致对新领域、非结构化或动态演变问题的泛化能力受限。合成问题的中间视觉依赖由静态图结构决定,难以模拟真实世界中非线性的、上下文强相关的视觉信息追溯过程。
- 训练策略采用纯监督微调(supervised fine-tuning)而非强化学习(reinforcement learning,RL),代理缺乏从交互反馈中自我改进搜索策略的机制。在需要探索-利用权衡的长程搜索中,模型容易陷入由教师轨迹引导的贪心模式,无法通过对错误尝试的反思来优化行为,这可能使其在复杂开放场景下的性能弱于 RL-based 方法。