LEAP: 面向长音视频感知的习得式分块证据检索
小时级音视频问答受制于一个上下文困境:对整段录制做密集编码会迅速耗尽上下文上限,而均匀的时间压缩又会严重稀释细粒度的声学与视觉证据。 LEAP 框架不再把整段录制放入单一上下文,而是让模型自行检索证据:将录制切分为固定时长的块,对每块执行一次轻量级定位 pass,为若干短候选窗口打分;排名最高的窗口被池化,并在单次有界回答 pass 中重新编码。因此答案输入与峰值上下文长度均与录制时长无关。 通过将证据定位与推理解耦,该框架可在预计算转写文本上定位候选时间窗口,无需解码媒体帧;同时把最终回答 pass 路由到原始音视频流,从而保留细粒度的视觉与非语音证据。两个阶段都参与训练:定位 LoRA 改善被选中的窗口,回答 LoRA 改善从同一批窗口读出的答案。块网格原生支持因果查询,使 LEAP 无需流式专用训练即可支持流式推理。 在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,并迁移到第二个全模态骨干 MiniCPM-o 4.5,超过其已发表结果 3.1-13.0%。
论文精读
TL;DR LEAP 将长录音分块检索高证据窗口,再对少量原始音视频重编码回答,把定位与推理解耦,使上下文不随时长增长,在多个 AVQA 基准上提升 4.5-16.8%。
问题
问题背景: 长视频音频问答正聚焦于小时级记录,模型需在有限上下文窗口内定位并回答细粒度问题。
现有方法局限:
- 密集全记录编码:将整段音视频编码进上下文,
token消耗随时长线性增长,很快超出上下文限制或推理预算。 - 均匀时间压缩:通过降采样帧、音频池化或粗粒度切片压缩,会严重稀释瞬时声学证据(短语音、非语音事件)和局部视觉细节,导致关键信息丢失。
- 静态检索策略:多数方法采用固定窗口或均匀采样,无法根据问题动态聚焦相关片段,且检索与推理耦合,上下文长度仍与总时长相关。
为什么这个问题难/重要: 难点在于证据定位与推理的解耦:模型需要在不看全片的情况下判断哪些窗口可能包含答案,这本身就是弱监督的稀疏检索问题;同时要保证有界峰值内存和延迟,并支持流式因果访问。业界对长视频问答、监控分析、会议摘要等场景的上下文效率要求持续上升,现有视觉-语言模型难以在长时程上维持细粒度理解。
行业类比: 这类似于开放域问答中的 retrieve-then-read 两阶段架构,将长视频问答转化为对候选证据窗口的定位与精读。
核心洞察
- LEAP 将证据定位与答案推理分离为两个独立阶段,使回答阶段的上下文长度和峰值内存消耗与录音总时长无关。与密集编码或均匀时间压缩不同,它先对分块转录进行轻量打分,再仅对高排名窗口重新编码原始音视频流,在保留细粒度声学与视觉证据的同时实现有界资源占用,为超长视频理解提供了可工程化的架构思路。
- 利用预计算转录文本作为定位阶段的检索通道,是效率与保真度的关键设计。LEAP 只在文本上运行定位 LoRA,无需解码媒体帧即可快速筛选候选窗口,回答阶段则回到原始音视频流以保留视觉和非语音信号。相比直接在音视频特征上检索,显著降低计算开销;相比纯文本回答,避免模态丢失,为长文档多模态问答的“先检索后精读”范式给出了具体实现。
- 块网格划分原生支持因果查询,使 LEAP 无需流式特定训练即可直接用于流式推理。与需要专门流式架构或重训练的方法不同,它将离线长视频能力与在线流式场景统一在同一模型下,简化了部署与迭代成本,对需要实时处理长会议、监控等长时音视频流的工程实践具有直接借鉴意义。
方法
输入与分块
将长音视频分割为固定时长 block(块),每个块配备预计算 transcript(转录)与原始视听流;问题作为查询输入。
Stage I: 定位打分
对每个块独立运行轻量 Localization Pass:使用 localization LoRA 在 transcript 上对短候选窗口打分,不解码媒体帧。输出每个窗口的相关性分数(综合平均得分与边际得分)。
Stage II: 块排序与答案生成
汇总各块窗口分数,进行 Block Ranking,选出固定数量的高排名窗口(retained-block count 为上限)。将选定窗口的原始音频、视频帧与 transcript outline 输入 Answer Pass,由 answer LoRA 重新编码并生成答案。答案输入长度与峰值上下文有界,不随录音时长增长。
训练与推理
两个阶段分别用 LoRA 训练:定位阶段优化窗口选择,答案阶段优化从同一窗口读取的答案质量。块网格天然支持因果访问,无需流式专用训练即可流式推理。
与同类方法差异:与“全量编码”或“均匀压缩”不同,LEAP 将证据定位与推理解耦,用两遍有界上下文实现时长无关的峰值内存,并分离转录检索与原始媒体重读。
实验
实验设计
实验在 LVOmniBench、MMOU、StreamArena、CG-Bench 等长时音视频问答基准上开展,覆盖离线整段输入与流式因果访问两种协议。LEAP 将长录制切分为固定时长块,先做轻量 localization pass 对每个块的短候选窗口打分,再按块排序后池化高排名窗口,最终在单个有界 answer pass 中重编码并回答。两阶段分别用 localization LoRA 与 answer LoRA 训练;transcript 通道可独立于媒体帧完成定位,回答阶段再路由到原始音视频流。
关键发现
- LEAP 相对 Qwen3-Omni-30B-A3B 基线提升 4.5%–16.8%。
- 迁移到 MiniCPM-o 4.5 后,超越其已发布结果 3.1%–13.0%。
- 块网格天然支持因果查询,StreamArena 流式协议下无需流式专用训练即可推理。
与基线对比的解读
提升并非来自堆叠更多帧或扩大模型,而是来自证据定位与推理的解耦:定位阶段可在预计算 transcript 上低成本完成,回答阶段再对原始音视频窗口精读,从而同时保留细粒度视觉与非语音声学证据。与整段稠密编码相比,LEAP 的答案输入与峰值上下文不随录制时长增长,内存边界恒定;媒体前缀可复用,每问最坏开销可核算。工程上,这类两阶段路由可用 LoRA 微调得到,训练成本可控,且易于迁移到不同 omni 主干,具备较强的架构普适性。
行业影响
落地场景
LEAP 的 分块证据检索 和 有界上下文 设计适用于一切需要从小时级音视频中抽取细粒度答案的场景:
- 企业会议 / 访谈记录:自动回答“上次关于预算的结论是什么?谁提出了异议?”
- 在线教育录播 / 直播回放:学生可快速定位“老师在哪一段讲了某个公式推导”并直接得到视频片段与解释。
- 内容平台长视频 QA:为播客、纪录片、发布会录像提供可跳转的问答与摘要,替代全文转录后逐帧分析。
商业价值
- 降本:因为回答阶段只处理检索出的少量窗口,峰值上下文长度与录制时长无关,极大降低长视频推理 token 消耗与 GPU 显存占用,尤其适合大规模视频库。
- 增收 / 体验提升:检索准确率较基线提升 4.5–16.8%,用户能获得带时间戳、可追溯的答案,减少人工查找成本;同时支持流式推理,允许对直播内容实时提问。
与现有产品 / 工作流接口
- 即插即用 LoRA:LEAP 在 Qwen3-Omni-30B-A3B 等 backbone 上仅通过 localization LoRA 与 answer LoRA 微调,无需重新训练基座模型,可快速接入已部署的多模态模型。
- 复用 ASR / 转录管道:定位阶段可以在预计算 transcript 上进行,不消耗媒体解码资源,因此可直接对接现有语音识别服务,降低集成成本。
- 流式兼容:块网格天然支持 causal query,无需流式专用训练,适合接入实时音视频分析平台。
具体 use case:
- 企业知识管理平台:对内部会议录像,用户用自然语言提问,系统先对每个 block 的转录打分,仅对 top-k 窗口重新编码原始音视频并回答,输出“答案 + 源视频时间戳”,将小时级会议检索响应时间降至秒级。
- 在线教育题库 / 答疑系统:学生针对录播课程提问,LEAP 定位到教师讲解该知识点的精确片段,直接返回视频剪辑与文字解释,提升学习效率并降低平台为整节课调用大模型的算力成本。
局限
- **依赖转录文本进行定位**:LEAP 的 localization pass 在预计算转录本上评分候选窗口,不解码媒体帧。这降低了计算开销,但意味着定位质量受限于语音识别(ASR)准确率和转录完整性。对于纯音乐、环境声、非言语人声或嘈杂场景,转录可能缺失或错误,导致检索阶段错过关键证据。尽管 answer pass 使用原始音视频流,但无法弥补定位阶段的遗漏。作者未在无转录或低资源语音场景下验证,限制了方法在非语音主导内容上的适用性。
- **固定块划分割裂跨块上下文**:录音被划分为固定时长块,每个块独立进行定位。对于需要跨块推理的问题(如比较相隔较远的事件、追踪长期因果链),这种划分可能切断必要的时间依赖。虽然块网格原生支持因果查询,但定位阶段没有显式建模块间关联,可能影响对长跨度事件的理解。此外,块大小是超参数,对性能敏感,论文未系统讨论其影响。
- **训练数据与标注成本**:LEAP 需要训练 localization LoRA 和 answer LoRA,通常需要成对的问题-答案-证据窗口标注,或通过弱监督构造伪标签。论文未明确说明训练数据源和标注成本,但此类两阶段训练往往依赖大规模指令数据或人工标注,可能限制其在缺乏标注的领域快速迁移。另外,虽然推理峰值上下文有界,但两阶段推理增加了延迟和计算总开销,对实时应用可能构成挑战。