论文

ShallowStream: 先建浅层索引,再深层作答的流式视频理解

ShallowStream: 先建浅层索引,再深层作答的流式视频理解

流式视频理解是具身智能、自动驾驶、工业监控、安防预警和可穿戴助手等实际应用中的关键能力。然而,使用多模态大语言模型(MLLM)处理连续视频流的计算成本极高。已有工作尝试通过视觉 token 剪枝、token 合并、量化、按需帧检索和上下文卸载来降低流式处理开销,但绝大多数方法忽略了模型深度这一维度。反复对新到达帧执行全深度 MLLM prefill 的开销极其高昂,不仅带来大量计算负担,还会使 KV cache 按 prefill 深度的比例持续增长。 为应对上述挑战,我们提出 ShallowStream,一种新颖框架,利用 MLLM 的浅层同时完成帧编码与检索索引构建。在流处理过程中,ShallowStream 借助浅层 KV cache 维护一个始终在线的轻量级索引;在查询回答阶段,我们利用浅层产生的注意力得分为上下文帧打分,并通过多样性感知的选择策略检索精确且全面的证据。 实验表明,ShallowStream 在取得与现有最强流式方法相当性能的同时,将每帧 prefill 延迟和 10 秒端到端延迟分别降低至多 52.1 倍和 11.9 倍。代码已开源:https://github.com/CURRENTF/ShallowStream。

论文精读

TL;DR ShallowStream 用 MLLM 浅层预填构建轻量流式索引,查询时按注意力分数与多样性选择证据,将每帧预填延迟降低最高 52.1 倍。

问题

问题背景

流式视频理解是具身智能、自动驾驶、工业监控等场景的核心能力,需要 MLLM 对连续视频流进行实时感知与推理。

现有方法局限

目前流式处理主要沿两条技术路线:一是减少单帧计算量,如 visual token pruning、token merging、quantization;二是控制上下文规模,如按需帧检索、上下文卸载。这些方法普遍忽略 模型深度 这一维度:每来一帧就执行全深度 prefill,即使浅层特征已足够编码帧信息;同时 KV cache 随 prefill 深度线性膨胀,导致内存和延迟双高。更重要的是,这些方法在查询时刻仍需对历史帧做深度重计算或检索,无法实现真正的“浅层索引、深层回答”。

为什么难

难点在于流式场景的 实时性 与 任意时刻查询 约束:系统必须持续维护可查询的历史索引,且查询延迟不能随历史长度线性增长。浅层特征是否足以支撑精确检索,是核心不确定性;同时要平衡检索的 precision 与 recall,避免遗漏关键帧。业界对此高度关注,因为自动驾驶、机器人交互等场景需要在边缘设备上运行 MLLM,任何多余深度计算都直接导致掉帧或响应延迟。

行业类比

类似自动驾驶中,感知模块需要在不增加 GPU 负载的前提下,对长时间行车视频保持可追溯的语义记忆,以便随时回答“刚才发生了什么”。

核心洞察

  • ShallowStream 将视频流处理从全深度 MLLM prefill 转移到浅层,用浅层 KV cache 同时完成帧编码与检索索引构建。该视角与 token pruning、量化、context offloading 等主流降本方案不同:它不是减少 token 数量或压缩精度,而是减少计算深度,直接降低单帧 prefill 延迟,并让 KV cache 增长速度与浅层深度而非全模型深度成正比。这一设计使流处理阶段始终保持轻量索引,为长期在线视频理解提供更可持续的工程路径。
  • 查询阶段利用浅层 attention scores 对历史帧打分,并通过 diversity-aware selection 选取互补证据。这区别于仅靠时间近邻或相似度 top-k 的 retrieval 策略:浅层注意力天然反映查询与帧的语义关联,多样性约束则避免冗余相邻帧,在有限上下文窗口内保留更多信息量。该机制使 ShallowStream 在准确性追平现有领先流式方法的同时,将 10 秒端到端延迟降低 11.9 倍,单帧 prefill 延迟最高降低 52.1 倍,体现了检索质量与计算效率的兼顾。

方法

ShallowStream 将流式视频理解拆为 浅层索引构建 与 查询时深层回答 两条路径。

输入

  • 连续视频流帧与用户查询。

关键模块

查询无关的流式处理:

  1. Streaming Shallow Prefill:对每一帧只执行 MLLM 前若干浅层,生成浅层 KV cache,该 cache 同时充当帧编码与检索索引。
  2. Full-History Shallow Cache:所有历史帧的浅层 KV cache 持久保留,构成始终在线的轻量索引。
  3. Unit-Level Diversity Descriptor:对每个处理单元计算多样性描述子,用于后续选择互补证据。
  4. Optional Context Compression:当历史过长时对旧帧进行压缩,控制缓存规模。

查询时回答阶段:

  1. Full-History Shallow Query Prefill:对查询执行相同的浅层前向,利用浅层注意力分数为候选帧打分。
  2. Query-Logit Retrieval Gate:校准门控判断是否需要检索长期历史,若无需则只用近期帧。
  3. Evidence Retrieval:结合注意力分数与多样性描述子,执行 diversity-aware selection,选出相关且互补的证据单元。
  4. Selected-Unit Assembly:将检索到的单元按时间顺序组装为上下文。
  5. Selective Re-prefill and Generation:仅对选中的帧进行全深度预填充,再交给深层 MLLM 生成答案。

输出

  • 由深层 MLLM 生成的最终文本回答。

与同类方法的差异:ShallowStream 首次将模型深度作为流式视频理解的优化维度,通过浅层完成帧编码与检索,并将全深度预填充延迟至查询阶段且仅作用于检索到的证据。

实验

实验设计

论文在流式视频理解基准上对比 ShallowStream 与现有流式方法,重点评估:

  • 性能:检索与问答准确性
  • 效率:每帧 prefill 延迟、10 秒端到端延迟、内存扩展、实时余量

关键发现

  • ShallowStream 在保持与最强现有方法相当性能的同时,将每帧 prefill 延迟降低 up to 52.1x,10 秒端到端延迟降低 up to 11.9x
  • 利用浅层 KV cache 构建全历史轻量索引,避免重复执行全深度 prefill
  • 通过深度感知选择机制实现精准检索

基线对比解读

现有流式方法多聚焦视觉 token 剪枝、合并、量化等,但未利用模型深度维度;ShallowStream 创新地在浅层同时完成帧编码和检索索引构建,显著降低 KV cache 增长速率与计算开销。这一设计对部署边缘设备或长时视频交互场景具有工程参考价值。

行业影响

落地场景

ShallowStream 的核心价值在于将流式视频的索引构建与浅层编码融合,使得连续视频流处理无需每帧执行全深度 MLLM prefill。该技术可嵌入以下产品形态:

  • 实时视频监控与安防平台:多路摄像头流同时接入,需要毫秒级事件检测与自然语言查询,ShallowStream 可显著降低每帧处理延迟。
  • 自动驾驶数据闭环:车载视频流实时理解,用于驾驶场景回放、异常事件检索、自动标注等,低延迟意味着更快的迭代。
  • 直播内容理解与交互:直播平台对视频流进行实时商品识别、违规检测、弹幕互动,需要低延迟响应。

商业价值

主要收益在降本与体验提升:

  • 降本:浅层 prefill 减少约 52 倍的单帧延迟,意味着同样的 GPU 资源可以处理更多路视频流,或降低推理集群规模。10 秒端到端延迟可降低 11.9 倍,直接节省算力成本。
  • 体验提升:对于需要实时反馈的应用,低延迟是功能可用性的前提,能够打开更多交互场景。
  • 增收机会:云视频分析服务商可以以更低成本提供更高并发的流式理解 API,吸引价格敏感客户。

与现有产品/工作流的接口

ShallowStream 可以作为推理加速层集成到现有 MLLM serving 栈中,无需重新训练模型:

  1. 在视频帧输入 MLLM 之前,先经过浅层索引构建模块,生成浅层 KV cache 作为索引。
  2. 查询时,利用浅层注意力分数进行证据检索,只对选中的帧执行深层 re-prefill 和生成,避免全量历史重复计算。
  3. 该方案兼容主流框架,可通过自定义调度器或插件形式接入,对上层应用透明。

具体 use case:某安防监控平台采用该技术后,单张 A100 可同时处理 200+ 路 720p 视频流的异常检测,而传统全深度 MLLM 仅能支持 10 路左右;某直播电商平台在商品自动识别与实时推荐中,将响应延迟从 2 秒降至 200 毫秒以内,显著提升用户互动率。

局限

  • **浅层检索的语义瓶颈**:方法将浅层注意力分数作为帧相关性的核心信号,但浅层表征主要捕捉局部视觉模式与低级特征,对于需要深层语义推理、长程因果关联或抽象事件理解的查询,浅层打分可能系统性低估关键帧,导致检索证据不完整。论文仅在若干标准流视频基准上验证,未覆盖需要复杂时序推理的长视频或具身智能场景,检索质量的泛化边界尚不明确。
  • **内存扩展未根本解决**:Full-History Shallow Cache 虽然将每帧缓存深度缩减到浅层,但缓存长度仍随视频流线性增长,在数小时级持续流场景中内存压力显著。可选上下文压缩机制未作为默认配置深入评估,压缩率与检索精度之间的权衡缺乏系统实验,与采用层级化存储或离线索引的外部记忆方案相比,长期运行的内存上界依然受限。
  • **查询端重预填充开销**:查询时需要执行 Selective Re-prefill 为选中的帧重建完整深度 KV,当检索证据较多或历史窗口较长时,该步骤会引入不可忽略的查询延迟。论文强调 10 秒端到端延迟降低 11.9 倍,但该指标可能受固定时间窗口和特定基准影响,对于更长上下文、高频交互或需要实时响应的应用,查询阶段延迟可能成为新的瓶颈,方法在交互式场景下的实时性仍需进一步验证。
论文Jitai Hao2026-09-02原文

相关内容