论文

Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch:迈向下一代多模态深度研究智能体

我们提出 Video-DeepResearch (Video-DR),将多模态智能体从静态图像扩展到连续视频流,这一设定要求密集的时空定位与开放网页探索相结合。初步评估揭示了当前模型的两个关键瓶颈:(1) 模态偏差——智能体绕过视觉工具,转而使用文本搜索;(2) 参数知识泄漏——模型依赖内部记忆而非真正的工具增强执行。 为解决这些问题,我们提出 Video-DR 框架,采用解耦的感知-探索流程,通过分阶段工具解锁,强制在网页检索之前进行彻底的跨帧视觉定位。训练范式包含两个阶段:监督微调 (SFT) 和 群组相对策略优化 (GRPO),从而实现自主探索,突破模仿学习的上限。 我们还构建了 Video-DR-Bench,一个包含 200 个复杂多跳 VQA 实例的人机协同基准。实验结果显示,Video-DeepResearch-35B-A3B 取得了 64.0% 的平均准确率,超越专有模型 Claude-4.5-Sonnet (59.0%) 5.0 个百分点,并显著优于 GPT-5 (52.5%) 和 Gemini 2.5 Pro (57.5%)。30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当,展示了我们训练范式的有效性。代码已开源。

论文精读

TL;DR Video-DeepResearch 通过解耦感知与探索、分阶段强制视觉定位后检索网页,解决模态偏差与参数知识泄露,在复杂视频多跳推理上以 64.0% 准确率超越闭源模型。

问题

问题背景

随着视觉语言模型(VLM)能力的跃升,多模态深度研究代理(Multimodal DeepResearch Agent)成为 AI 自主执行长期、多步推理任务的新前沿。这类代理需从连续视频流中提取复杂时空信息,并耦合开放网络搜索,以回答多跳视觉问答(VQA)。

现有方法局限

当前系统面临两个核心瓶颈:

  • 模态偏见(Modality Bias):代理倾向绕过视觉工具,直接使用文本搜索,使得视频中丰富的跨帧运动、细粒度动作等时空线索被忽略。
  • 参数化知识泄漏(Parametric Knowledge Leakage):模型过度依赖预训练内在记忆,而非真实的工具增强推理,导致对动态内容或未见场景的答案陈旧或错误。

此外,传统流水线将感知与探索混为一体,代理常在未充分理解视频时便启动搜索,造成视觉 grounding 不充分,答案可信度受限。

为什么这个问题难/重要

视频理解本身需对密集的时空关系建模,而与开放网络探索的耦合则引入了工具使用决策和多源信息融合的双重挑战。代理必须自主规划何时查看哪一帧、何时检索、如何结合外部知识,这远超静态图像问答的复杂度。解决该问题对构建能处理真实世界动态场景的通用 AI 助手(如事故重建、科研文献分析、监控事件溯源)至关重要。业界对这类主动视觉推理代理的需求急增,因为它直接填补了从静态感知到动态认知的鸿沟。

行业类比

类似高级驾驶辅助系统(ADAS) 需同时处理前向摄像头视频流与高精地图动态层,才能做出安全变道决策,多模态研究代理也必须协同深度视觉理解与外部知识检索,才能对复杂查询给出可靠回答。

核心洞察

  • 当前多模态代理普遍存在模态偏见和参数知识泄漏,Video-DR 通过阶段性工具解锁强制视觉先验,从根本上重塑了感知-探索流程,而非简单修补。对比现有方案仅依赖提示工程或增加视觉采样,该设计从系统架构层面确保跨帧定位先于文本检索,有效抑制了模型走捷径的行为。
  • SFT 后接 GRPO 的两阶段训练范式打破了模仿学习的天花板,使 30B 参数的紧凑模型达到与 Claude-4.5-Sonnet 可比的性能。这证明强化学习阶段的自主探索能显著提升工具使用的策略质量,而不必一味堆砌模型规模,为部署高效能代理提供了可复现的管线。

方法

输入与工具集

  • 输入:视频流 + 自然语言问题(通常为多跳推理, 要求密集时空定位与外部知识查证)。
  • 工具集:包括 帧采样与密集描述、目标检测与跟踪、视频问答 等视觉工具, 以及 文本/网页搜索引擎。

核心模块:解耦的感知-探索管道

  1. 第一阶段:强制视觉感知 (Perception Phase)
    • 智能体仅被允许调用视觉工具, 搜索引擎被锁定。
    • 通过逐帧密集时空定位生成结构化视觉记忆(如对象关系图、事件序列), 杜绝模态偏置。
  2. 第二阶段:开放域探索 (Exploration Phase)
    • 解锁搜索工具, 基于已提取的视觉线索进行多跳推理与事实校验。
    • 此时可交替使用视觉与搜索工具, 但初始强制顺序确保了视觉先验不被绕过。

训练策略

  • SFT (监督微调):
    使用 Video-DR-Bench 中的人机协作专家轨迹进行行为克隆, 让模型学会遵循解耦流程。
  • GRPO (组相对策略优化):
    以 SFT 模型为起点, 通过在线采样一组动作, 利用正确性与过程合规性(如是否先视觉后搜索)计算奖励, 再基于组内相对优势更新策略。GRPO 突破了纯模仿学习的天花板, 实现自主探索。

推理阶段

  • 模型接收视频与问题后, 按照训练习得的解耦顺序逐步调用工具, 最终生成自然语言答案。

与同类方法的差异:
现有视频代理(如基于 GPT-5/Claude 的 DeepResearch 变体)未强制解耦视觉与搜索, 常因参数知识泄露或模态偏置而绕过视觉推理;Video-DR 通过阶段式工具解锁与 GRPO 训练, 构建了以视觉定位为核心、工具增强不可绕过的自主探索范式。

实验

实验设计

在 VideoDR-Bench 上评测,该基准含 200 个复杂多跳 VQA 实例,要求密集时空定位与开放网络搜索。模型采用两阶段训练:监督微调(SFT)后接 Group Relative Policy Optimization(GRPO),并设计了感知-探索解耦管道与分阶段工具解锁机制。基线包括专有模型 Claude-4.5-Sonnet、GPT-5、Gemini 2.5 Pro,以及意图分析(工具使用统计)与消融实验。

关键发现

  • Video-DeepResearch-35B-A3B 平均准确率 64.0%,比 Claude-4.5-Sonnet (59.0%) 高 5.0 个百分点,比 GPT-5 (52.5%) 高 11.5 个百分点,比 Gemini 2.5 Pro (57.5%) 高 6.5 个百分点。
  • 30B-A3B 变体达 59.3%,与 Claude-4.5-Sonnet 持平,证明训练范式在小规模下亦有效。
  • 工具使用分析显示,该方法强制先视觉定位后网络探索,有效缓解了模态偏见与参数知识泄露问题;GRPO 强化学习使模型突破模仿学习天花板,实现自主探索。

与基线对比解读

专有模型普遍存在模态偏见——倾向于跳过视觉工具直接文本搜索,导致复杂视频问答中空间/时序信息缺失;且常因参数知识泄露直接调用内部记忆,而非真正执行工具增强推理。Video-DeepResearch 通过解耦流水线迫使模型在调用网页检索前完成跨帧视觉定位,结合 GRPO 训练使探索行为更灵活。结果证明,这种设计在需要长时间多步推理的任务中显著优于仅依赖预训练知识或单一模态的路线。值得注意的是,30B 的较小模型已与最大专有模型性能相当,暗示架构与训练策略比模型规模更关键。

行业影响

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像推进到连续视频流,解决了现有模型在视频理解中的 模态偏见(绕过视觉工具)和 参数化知识泄露(依赖内部记忆)两大瓶颈,为工业界视频智能应用开辟了新路径。

落地场景

该技术可赋能所有需要密集时空定位与外部知识检索的视频密集型业务:

  • 内容平台:对用户上传的长视频进行自动标记、片段摘要与多跳问答,支撑精准推荐与安全审核。
  • 电商:分析商品开箱、评测视频,自动提取属性、卖点与竞争对比,生成结构化产品信息。
  • 在线教育:对课程录像进行知识点索引、跨讲座内容关联与自动答疑,提升学习体验。
  • 安防与自动驾驶:从监控或行车记录仪视频中检索特定事件(如“红色轿车在雨天多次变道”),实现自然语言驱动的取证与分析。

商业价值

  • 降本增效:替代人工审查海量视频,将小时级人力工作压缩至分钟级,尤其适合 UGC 平台、安防监控等大规模处理场景。
  • 体验升级:通过更准确的视频问答与内容发现,提升用户粘性(如视频平台“查资料”功能、电商智能客服)。
  • 能力扩展:让中小规模模型(如 30B-A3B)达到与顶级闭源模型相当的性能,降低私有化部署的算力门槛,推动高价值场景(如医疗影像、金融合规)的本地化应用。

与现有产品/工作流的接口

Video-DR 采用解耦的感知–探索管道,可灵活集成至现有视频处理栈:

  • 作为微服务或者插件:通过 API 接收视频流与自然语言查询,返回证据片段与推理结果,直接嵌入内容管理系统或审核工作台。
  • 与 RAG 系统协同:其 阶段式工具解锁 强制先进行视频内视觉定位,再触发外部搜索,可与现有知识库检索增强生成(RAG)无缝对接,避免过早文本检索的偏差。
  • 训练范式可迁移:采用 SFT + GRPO 的两阶段训练,企业可在自有数据上微调,适配特定领域术语与工具集。

具体用例

  1. 电商直播分析:在直播带货过程中,Video-DR 可实时定位“主播讲解某件衣服材质”的片段,结合网页搜索该材质趋势与竞品价格,自动生成图文卖点总结,辅助场控与后期切片。
  2. 医疗手术教学:对于长达数小时的手术录像,智能体依据医师提问(如“分离胆总管时的关键解剖标志有哪些?”)定位关键帧,并检索最新临床指南,生成带证据标注的回答,加速规培与知识更新。

局限

  • 基准规模与覆盖范围有限:VideoDR-Bench 仅含 200 个实例,虽面向复杂多跳推理,但数量不足以充分评估深度研究代理在开放场景下的泛化性;其构建依赖人机协作,可能引入标注偏好与构造偏差,且视频来源、问题类型与认知复杂度的分布尚未大规模验证,给跨域性能推断带来不确定性。
  • 刚性感知-探索解耦可能损失灵活性:方法强制在 web 检索前完成所有帧的视觉定位,虽能缓解模态偏差,但在需要文本线索动态引导注意力或选择性跳帧的场景中,这种阶段式工具解锁会引入不必要的计算开销,并限制代理实时交错利用多模态信息的能力,与人类灵活切换感知与搜索的范式存在差距。
  • 训练数据依赖与高计算成本:两阶段训练(SFT+GRPO)依赖教师模型生成行为轨迹,其质量形成性能上界,即使 GRPO 带来探索增益,大规模轨迹采样与强化学习优化仍需要显著算力;同时,35B-A3B 的模型规模对端侧或实时部署不够友好,阻碍低资源场景下的复现与拓展。
论文Zhen Fang2026-08-04原文

相关内容