重新思考长视频中的 RAG:检索什么以及如何使用?
检索增强生成(RAG)正从文本扩展到长、自我中心视频,系统需要跨多个模态和时间粒度选择查询相关片段。然而,视频 RAG(VideoRAG)的进展受限于两个不足:现有基准允许不依赖视频回答问题,模糊了检索错误;先前方法对每个查询使用单一模态-粒度配置,忽略了片段级变异性。 为应对这些问题,我们引入 V-RAGBench 基准,包含【查询、证据片段、答案】三元组,支持忠实、解耦的检索和生成评估。以及 CARVE 方法,它并行运行多种配置的检索器,并采用 片段自适应重排序 为每个片段确定最优配置。每个片段在其检索时选定的优胜配置下进入生成器,形成交织的证据形式,其中片段级决策贯穿两个阶段。 实验表明,CARVE 优于八个最新的 VideoRAG 基线,提供给生成器的片段交织了多种配置而非共享单一配置,这是查询级方法无法实现的行为。
论文精读
TL;DR 针对长视频RAG,提出V-RAGBench基准解耦检索与生成评估,并设计CARVE方法,通过分块自适应重排序实现多模态多粒度的混合证据呈现,显著超越现有方法。
问题
问题背景
长视频理解,尤其是以自我为中心的视频,正成为 检索增强生成 (Retrieval-Augmented Generation, RAG) 的新前沿。系统需要从数小时的多模态流中,准确定位与查询相关的时空片段,这对视频问答、交互式记忆回顾等应用至关重要。
现有方法局限
当前 VideoRAG 仍面临两个核心缺口:
- 基准缺陷:现有评测集允许不依赖视频即可回答查询,使检索错误被蒙蔽,无法忠实评估检索与生成的联合效果;
- 配置僵化:绝大多数方法为整个查询设定单一模态-粒度组合(如“视觉+文本,粗粒度”),但视频中不同证据块的最优配置天然不同,这种 query-level 策略忽略了 chunk-level 的变异性,导致检索或生成阶段的信息浪费。
技术挑战与重要性
长视频的 非结构化、高冗余、跨模态对齐难 等特性,使这一问题极具挑战:
- 检索器需同时考虑多个模态(RGB、音频、文本)和多种时间粒度(帧级、片段级、叙事级),每个证据块可能只有一种组合能精准命中;
- 若不能解耦基准与方法的评价,VideoRAG 的真实进展会被虚高指标掩盖;
- 业界对 多模态视频代理 和 终身辅助技术 的关注度持续上升,让长视频记忆检索成为基础能力,直接影响下游任务的可用性。
行业类比
这类似于智能监控系统在长达数小时的录像中,根据自然语言查询定位关键事件:不能预设单一搜索策略就能适配所有关键时刻,而需要针对每一段潜在证据动态切换最有效的特征组合。
核心洞察
- 现有 VideoRAG 基准普遍存在“无需视频即可回答”的漏洞,导致检索评估失真。V-RAGBench 通过构建强制依赖视频证据的〈query, evidence chunk, answer〉三元组,首次实现了检索与生成环节的严格解耦评估,暴露了检索阶段的真实瓶颈,为后续系统改进提供了更可靠的测试基础。
- 已有方法对每个查询采用单一模态-时间粒度组合,忽略了不同证据块(chunk)的最优表示差异。CARVE 提出 chunk-adaptive reranking,在并行多配置检索后,逐块选择最佳配置,形成交错证据流进入生成器。这种块级自适应策略打破了查询级统一配置的限制,让生成器融合多粒度多模态信息,在检索和生成上均显著超越基线。
方法
CARVE 方法遵循 查询 + 长视频 → 并行多配置检索 → 块自适应重排序 → 交织证据生成 → 答案 的流水线,核心在于将检索阶段的块级决策传递至生成阶段,形成统一的交错证据表示。
输入与检索段
给定用户查询 q 和一段长视频 V,系统首先将视频按时间划分为多个 证据块 (evidence chunk)。针对每个块,并行运行多个 检索器配置:这些配置由 {视频模态 (RGB/音频/字幕/文本帧等)} × {时间粒度 (秒/场景/事件级)} 组合而成。每个配置独立计算查询与块的相似度,得到各自的候选排序列表。
块自适应重排序 (Chunk-Adaptive Reranking)
此模块是核心创新。对每一证据块 c,将所有配置为该块给出的排序合并,通过一个轻量 重排序器 预测哪个配置的检索结果最相关。具体地,重排序器以块的多种表示(各配置下的特征)和查询为输入,输出该块的 优胜配置 (winning configuration) 及其对应的块表示。重排序器训练时以块是否真正包含答案证据为监督信号,从而学习为每个块动态选择最优模态-粒度组合。
交织证据生成
检索完成后,每个块以自身优胜配置下的表示进入生成器 (LLM)。这意味着不同块可能使用不同的模态和粒度表示,最终送入生成器的上下文是多种配置交错排列的证据序列。生成器基于此 交织证据形式 (interleaved evidence form) 生成最终答案。
关键差异
与现有 VideoRAG 方法(如 Vid2Seq、EgoSchema 等)为整个查询选择单一模态-粒度配置不同,CARVE 将决策粒度下放到每个证据块,使生成器能混合利用多源信息,消除了查询级统一配置无法适应块内容多样性的局限。这种设计直接解耦了“检索什么”与“如何使用”两个设计轴,与 V-RAGBench 的 faithful 评估标准协同,可精确度量检索与生成的独立贡献。
实验
实验设计
论文构建 V-RAGBench 基准,由 〈查询,证据块,答案〉 三元组组成,确保查询必须依赖于视频证据才能回答,从而解耦检索与生成评估。CARVE 方法并行运行多组检索器,每组采用不同的模态-时间粒度配置,然后通过 chunk-adaptive reranking 为每个证据块选择最优配置;生成阶段以交错证据形式输入,使块级决策贯穿两阶段。
关键发现
- CARVE 在检索和生成指标上均超越8个现有 VideoRAG 基线。
- 交错证据形式使得不同证据块可采用不同模态(如视觉、文本)和时间粒度(如秒级、分钟级),显著优于所有查询使用单一配置的传统方式。
- 定性分析表明,块级自适应选择能更好地捕捉长视频中不同片段的异质性。
与基线对比解读
现有方法如 VideoForest、EgoRAG 等在每个查询上固定使用一种检索配置,忽略了块间差异。CARVE 的并行检索+自适应重排序框架以较小额外计算为代价,实现了证据表示的细粒度优化,验证了“检索什么”和“如何使用”两个轴上的协同设计对长视频 RAG 至关重要。
行业影响
长视频 RAG 的落地场景
长视频 RAG 技术可直接嵌入内容审核、智能监控、视频搜索、交互式教育等产品。例如,电商平台可以利用该技术对商品使用教程视频进行细粒度索引,支持用户以自然语言查询“如何更换滤芯”并直接定位到相应片段;视频会议服务可对录制内容构建可检索的知识库,实现会议问答。医疗领域可分析手术录影,辅助医生快速回顾关键步骤或异常事件。自动驾驶可以从行车记录仪长视频中检索与特定驾驶场景相关的片段,用于模型训练或事故分析。
商业价值
- 降本:CARVE 方法允许在一次检索中并行评估多种模态和粒度配置,通过 chunk-level 自适应重排序,减少了人工设计规则和反复调参的工程成本,并使检索和生成模块解耦评估,加速开发迭代。
- 增收:在内容平台中,精准的视频片段定位可提升用户粘性与付费转化,例如为付费课程提供“语义搜索+答案生成”功能,增加订阅吸引力。
- 体验提升:交错证据形式(interleaved evidence)能根据每个 chunk 的最佳配置聚合多模态信息,避免了单一配置导致的上下文丢失,生成更准确、更自然的回答,尤其适合第一人称视角(egocentric)长视频,如智能眼镜记录的企业巡检、设备维修等场景。
与现有产品栈的集成
CARVE 可作为插件式检索模块集成到现有RAG 管线。其输出为 chunk 序列和对应的最佳配置,可直接送入任意 LLM 生成器,无需修改生成器结构。工程上,可封装为独立微服务,通过标准化 API 与现有视频预处理管道(如帧抽取、字幕生成)和向量数据库(如 Milvus / Pinecone)对接。基准 V-RAGBench 的 triplet 格式(query, evidence chunk, answer)允许开发者离线评估检索效果,实现持续优化。
具体应用案例
- 企业级知识管理:大型制造企业使用 AR 眼镜记录设备维修过程,形成长视频知识库。技术员可用自然语言提问“如何校准传感器 X?”,CARVE 检索出关键步骤 chunk(可能为仪器读数序列的视觉模态 + 语音说明的文本模态),直接生成操作指引,减少停机时间。
- 在线教育平台:编程教学视频中,学生提问“如何用 for 循环处理列表?”,CARVE 从教员屏幕录制视频中同时利用代码截图(视觉) 和解说音频(文本) 的 chunk,自适应选择最佳粒度,避免无关片段干扰,提升问答准确率,从而降低退课率。
局限
- 基准构建依赖第一人称长视频,且证据块划分方式单一:V-RAGBench 基于 Ego4D 和 EPIC-KITCHENS 等公开第一人称数据集,构造的三元组⟨query, evidence chunk, answer⟩中证据块按固定时间窗口生成。这可能导致基准覆盖的场景偏向日常活动与物体交互,难以评估其他视频类型(如第三方视角教学视频、监控视频)下的检索鲁棒性,同时证据块分割策略未探索语义驱动的自适应切分,可能高估检索器在真实应用中匹配信息片段的难度。
- CARVE 的并行检索与块级自适应重排序带来额外计算开销:方法要求对每个查询同时执行多组模态-粒度配置的检索,随后运行重排序模型为每个块选择最佳配置,虽然实验显示性能提升,但推断延迟和资源消耗成倍增加,特别是在视频库规模较大或检索器数量较多时,实际部署可能需权衡效率与效果。论文未提供详细的延迟分析与成本对比,这限制了方法在低延迟或资源受限场景下的实用性。
- 实验主要与最近提出的 VideoRAG 基线比较,缺少与传统视频理解或片段检索方法(如基于滑动窗口的密集检索、传统多模态索引)的全面对比,也未深入探讨在各配置独立检索后如何融合与生成,例如生成阶段处理交错表示可能引入的不一致性。此外,评估依赖 LLM-as-a-Judge 的自动指标,虽进行了人工验证,但自动指标在精细语义一致性判断上的可靠性仍有待进一步验证。