论文

VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理

VideoSearch-R1: 通过软查询细化实现迭代视频检索与推理

随着视频语料库在规模和任务复杂度上的不断扩展,亟需能够从大规模语料库中检索相关视频(视频间推理)并在检索内容中进行细粒度、查询条件化任务(视频内推理,如时间定位)的方法。然而,现有方法通常将检索视为预处理步骤,当初始检索失败时,缺乏优化搜索的机制,导致后续细粒度视频内推理失败。此外,虽然近期智能体框架在视频理解方面取得进展,但它们通常假设查询相关视频已给定,仅专注于视频内推理任务。 为解决上述局限,我们提出 VideoSearch-R1,一个通过与视频搜索引擎的多轮交互实现迭代视频检索与推理的智能体框架。具体而言,我们引入 软查询细化(Soft Query Refinement, SQR),在连续潜在空间中微调搜索查询标记,而非在离散文本空间中重写查询,从而支持更高效和细粒度的调整。SQR 及其推理过程通过 组相对策略优化(Group Relative Policy Optimization, GRPO) 训练,由来自检索和下游任务的任务级奖励信号引导。 基于此,VideoSearch-R1 在三个数据集上的 视频语料库时刻检索(Video Corpus Moment Retrieval, VCMR) 任务中达到了最先进性能,实现从大规模语料库中迭代检索视频、优化搜索查询,并在检索内容中进行精确的查询条件化时间定位。分析表明,SQR 有效优化原始查询,其生成标记数显著少于显式文本级查询细化。代码和模型检查点已公开在 mlvlab.github.io/VideoSearch-R1。

论文精读

TL;DR VideoSearch-R1 以连续潜在空间中的软查询优化(SQR)替代离散文本重写,结合 GRPO 强化学习,实现可迭代的视频检索与时刻定位,在 VCMR 任务上达到 SOTA。

问题

问题背景

随着视频数据规模指数增长,视频语料库时刻检索(Video Corpus Moment Retrieval, VCMR) 成为关键挑战:不仅需要从海量视频库中检索出少数相关视频(inter-video reasoning),还需在检索到的视频内定位精确的时间片段(intra-video reasoning)。此类任务在视频搜索、监控分析、智能问答等场景中需求迫切。

现有方法局限

传统方法将检索和推理视为两个孤立阶段:

  • 先通过文本-视频相似度匹配(如 CLIP 嵌入)从视频库中检索 top-k 视频;
  • 再在单个视频内进行时间定位(如 moment retrieval)。

这种一次性预处理范式存在显著缺陷:

  • 错误传播不可逆:若初始检索偏离用户意图,后续推理环节会基于错误视频产生无意义输出,系统没有机制修正搜索方向。
  • 查询僵化:检索使用固定的文本查询,无法根据检索到的视频内容动态调整,难以应对查询与视频之间的语义鸿沟。

近期基于 LLM/Agent 的视频理解框架虽然展现了多步推理能力,但它们假设相关视频已预先给定,只专注于视频内推理,缺乏主动检索和迭代修正的能力。

为什么这个问题难且重要

  • 耦合难度高:检索和推理需要闭环协同,但检索空间极大(视频库可达百万级),而时间定位需要细粒度视觉-时序理解,两者计算代价和表征粒度差异悬殊。
  • 反馈信号稀疏:从下游任务(如时间定位准确性)反哺检索决策,是一个长程信用分配问题,难以通过传统监督学习解决。
  • 业界关注度:视频理解正从“给定视频”走向“给定查询在视频库中找答案”,端到端的 VCMR 能力直接决定产品体验(如视频搜索引擎的深度链接、AI 视频剪辑等)。

行业类比

类似于 RAG(检索增强生成) 中通过生成结果反馈优化检索器的思路,视频领域的迭代检索-推理框架需要根据定位结果动态调整搜索查询,从而打破“检索-推理”的单向流水线,实现类似人类“边搜边想”的智能行为。

核心洞察

  • **Soft Query Refinement (SQR) 在连续潜空间中迭代优化查询**,而非在离散文本层重写 query。与 ReAct / Reflexion 等通过生成具体文本进行 query 改写的方法不同,SQR 直接调整连续 token 表示,既能捕捉细粒度的语义偏移,又避免了离散解码时的信息丢失和过度生成。实验表明,该方法生成 token 量远少于显式文本重写,同时检索精度更高,揭示出连续空间查询优化在多模态检索中的潜力。
  • **通过任务级奖励引导的 GRPO 训练,将跨视频检索与视频内时序定位统一为端到端的迭代推理链**。现有工作通常将检索视为独立的静态预处理,检索失败则后续推理必然失败。VideoSearch-R1 将检索与下游任务(如 temporal grounding)的奖励信号联合优化查询精炼策略,使模型学会在检索不充分时自动、多轮地调整搜索方向。这种基于反馈的闭环设计显著提升了 VCMR 任务上的 SOTA 表现,为构建真正协同的检索-推理系统提供了新范式。

方法

输入

用户提出自然语言查询(如“一段小孩在公园里踢球的视频”),系统需要从一个大规模视频语料库中检索出相关视频,并在检索到的视频内精确定位符合查询的时间片段(temporal grounding),即完成**视频语料库时刻检索(VCMR)**任务。

关键模块

VideoSearch-R1 是一个代理框架,通过多轮与视频搜索引擎的交互实现迭代式检索与推理,核心包含以下组件:

  • 视频搜索引擎:基于嵌入匹配的检索接口,接受查询嵌入并返回 top-k 相关视频。初始查询被编码为连续嵌入。
  • 软查询细化(Soft Query Refinement, SQR):区别于传统方法在离散文本空间重写查询(如“小孩公园踢球”可能被重写为“青少年户外运动”),SQR 直接在连续潜在空间中调整查询 token 的嵌入表示。它生成一个精细化的查询嵌入,作用于搜索引擎的嵌入空间,允许更细粒度和高效的优化,避免生成大量文本 token 的开销。
  • 多轮交互与推理:在每一轮,模型使用当前查询嵌入检索视频,并对检索到的视频执行下游时间定位模型,得到候选时刻。根据检索和定位结果产生任务级奖励(如检索召回率、时间交并比 IoU)。若性能未达预期,SQR 模块会结合历史信息和奖励再次调整查询嵌入,进入下一轮迭代。
  • 训练过程:SQR 及其推理策略通过 Group Relative Policy Optimization (GRPO) 强化学习算法训练,直接最大化由检索准确度和定位精度构成的复合奖励信号,实现检索与推理的端到端协同优化

输出

经过多轮迭代后,框架输出最终检索到的相关视频列表,以及每个视频中满足查询的精确起始和结束时间戳,直接完成 VCMR 任务。

与同类方法的差异点:现有工作要么将检索作为一次性预处理且无纠错机制,要么假设相关视频已给定而仅做视频内推理;VideoSearch-R1 首次引入闭环代理,以连续空间软查询细化替代离散文本重写,实现了可纠正检索失败的迭代式视频检索与推理。

实验

实验设计围绕 视频语料库时刻检索(VCMR)任务展开,该任务要求从大规模视频集合中检索出相关视频,并在检索到的视频内完成时间定位。评估在三个公开数据集上进行,每个数据集均包含复杂查询与大规模候选视频。

VideoSearch-R1 以多轮交互方式调用视频检索引擎,每轮利用 软查询精炼(SQR)在连续潜在空间中调整查询 token,再输入给下游 grounding 模块。训练采用 Group Relative Policy Optimization(GRPO),奖励信号来自检索与定位任务的联合指标。

关键发现

  • SQR 通过微小潜变量修改即可有效改善检索,所需生成的 token 数远少于基于文本的查询重写,验证了连续空间精炼的效率和细粒度控制能力。
  • VideoSearch-R1 在所有三个数据集上取得 当时最优 结果,证明迭代式 video-wise + moment-wise 推理架构的优势。
  • 消融实验确认:移除 SQR 或改为离散查询重写均会导致性能下降,且迭代轮数增加可进一步提升召回率与定位精度。

与基线对比解读: 现有方案将检索视为单步预处理,一旦初始检索失败便无法纠正;而 VideoSearch-R1 赋予模型主动精炼查询的能力,形成闭环反馈。相较于仅关注视频内推理的 agent 框架,该工作首次将视频间检索和视频内定位统一到同一个迭代优化过程中。与基于显式文本重写的方法(如用 LLM 生成新查询)相比,SQR 在更高维度的语义空间中操作,能捕捉文本难以表达的视觉细微差别,且推理开销更低,更适合工程部署。

行业影响

落地场景

VideoSearch-R1 通过迭代式视频检索与推理框架,直接赋能视频密集型业务:

  • 内容审核与安全:在海量视频库中根据灵活的自然语言描述快速定位违规片段,例如暴力、侵权内容的时间定位。
  • 视频推荐与搜索:电商平台可根据商品外观 + 动作描述(“展示口红上色效果的特写”)从商品视频库中检索并定位到相关时刻,提升搜索体验。
  • 智能监控:安防领域从跨摄像头的长时录像中,通过模糊查询(“戴红帽、穿黑衣的人进入大楼”)定位目标片段,无需逐帧回看。
  • 媒体资产管理:广播电视台或流媒体平台对历史节目库进行精准片段检索,用于二次创作或版权标注。

商业价值

  • 降本SQR(Soft Query Refinement)在连续隐空间优化查询,避免显式文本改写带来的 token 开销,推理时生成 token 数显著减少。大规模视频检索场景下,直接降低计算资源与 API 调用成本。
  • 增收与体验提升:迭代检索与定位能力可将“搜索到片段”的转化时间从分钟级降至秒级,改善视频平台用户粘性;在电商场景中,通过精准展示商品使用片段,可提高购买转化。
  • 风险控制:内容平台依赖人工审核的成本极高,自动化的 VCMR(Video Corpus Moment Retrieval)可实时预警,减少合规风险与人力投入。

与现有产品/工作流的接口

  • 集成方式:该框架以多轮对话与视频检索引擎交互,可封装为微服务,通过 REST/gRPC 接口接入现有视频处理管线。输入为自然语言查询,输出为视频 ID 与时间戳片段。
  • 与现有组件兼容
    • 视频检索引擎:可基于已有向量检索系统(如 Milvus、FAISS)构建,只需增加隐空间查询优化模块。
    • 预训练模型:SQR 模块可基于现有视觉-语言模型(如 CLIP、BLIP)的隐空间进行微调,使用 GRPO 强化训练,无需重新构建基础能力。
    • 下游任务:输出的视频片段可直接输送到视频理解 API(如图像识别、ASR)进行二次分析,形成端到端的自动化 pipeline。

具体落地 Use Case

  • 短视频电商检索:用户在商品库中搜索“用平底锅快速翻煎蛋的教程”,VideoSearch-R1 从数十万视频中迭代检索并定位到煎蛋动作发生的精确时间区间,前端直接跳转播放,提升选购体验。该过程仅需数秒,支持复杂动作和属性描述。
  • 企业培训内容管理:大型企业内部视频知识库中,员工用自然语言查询“如何在 Excel 中使用 VLOOKUP 进行跨表匹配”,系统在培训视频中定位到对应演示时刻,避免拖动进度条,提高学习效率。

局限

  • **训练依赖奖励信号质量**:SQR 与 GRPO 训练完全由下游任务奖励驱动,但当前奖励仅基于最终检索与定位的准确性。若奖励稀疏或存在噪声(如数据标注偏差),可能导致策略优化不稳定或学到捷径,论文未深入分析奖励设计的敏感性与替代方案。
  • **多轮交互的推理开销**:VideoSearch-R1 在推理时需与视频检索引擎进行多轮交互才能逐步细化查询,相比单轮检索显著增加了推理延迟与计算成本。虽然 SQR 比文本级重写生成更少 token,但实际系统中的延迟开销依然存在,论文未提供详细的效率对比或实际部署可行性分析。
  • **任务与数据多样性受限**:实验仅在 Video Corpus Moment Retrieval(VCMR)三个数据集上进行,且视频语料规模相对有限。方法能否拓展到更通用的视频检索、问答或摘要任务,以及更大规模、更开放的视频库,尚缺乏实证。此外,多语言查询与跨模态泛化也未涉及。
论文Seohyun Lee2026-07-01原文

相关内容