视频为何仍然如此昂贵?Video 与 Audiovisual LLM 的推理效率机制综述
视频理解正快速转向 VideoLLMs:即将视频表征与预训练大语言模型耦合、并以文本 prompt 作为生成条件的系统。它们在 captioning、question answering、retrieval 与 temporal grounding 上表现强劲,但计算与内存开销随帧数与上下文长度增长,限制了其在实时、移动端与资源受限场景中的部署。 本综述聚焦可报告具体收益的推理效率机制,即 参数量、每输入 FLOPs、延迟、内存 或 视觉与音频 token 数 的实质下降,并按 pipeline 阶段组织方法: 1. frame sampling(帧采样); 2. modality encoding(模态编码); 3. connector 层的 token reduction(token 压缩); 4. LLM 的 prefilling 与 decoding。 覆盖范围包括 2022 年末以来发展的 VideoLLMs,以及至今仍是现役 pipeline 组件的早期帧采样与 vision-encoder 机制。 在评测层面,我们尽可能在同一 host model 与输入协议下汇总文献报告的 accuracy–cost 对比,并将其与跨论文的异质证据区分开,同时指出 audiovisual efficiency 与标准化评测方面的空白。相关资源仓库见 https://github.com/momentslab/awesome-efficient-videollm。
论文精读
TL;DR 系统梳理视频/音视频 LLM 推理效率优化:从帧采样、编码、连接器 token 压缩到 LLM 执行各环节的降本技术,并指出现有评估缺口。
问题
当前视频理解正快速转向 VideoLLMs,即把视频表示与预训练 LLM 耦合,在字幕、问答、检索和时序定位上表现强劲,但推理成本随 frame count 和 context length 增长迅速,限制了实时、移动端和资源受限场景的部署。
现有方法局限主要体现在各流水线阶段:
- 帧采样:固定覆盖率或简单 query 选择会丢失短期动作细节或长期事件依赖,难以在 token 预算内保留关键时空信息;
- 编码器:通用视觉 backbone 未针对视频冗余优化,编码器内部 token 削减能力有限;
- 连接器:多数工作只做网格池化或下采样,缺乏对语义重要性的显式建模;
- LLM 执行:预填充注意力复杂度为 O(n²),解码时 KV cache 随 token 数线性膨胀,导致 GPU 内存和延迟压力大;
- 视听模型:音频与视觉联合推理的效率研究明显不足。
为什么这个问题既难又重要:视频时空冗余高但有效信息稀疏,需要在保持时序理解的同时压缩 token;不同 benchmark 的难度和输入协议差异大,跨论文准确率-成本对比难以标准化;实时视频问答、移动端助手、边缘视频监控等场景要求低延迟、低内存,而当前模型单次推理可能超过数百毫秒甚至数秒。
行业类比:实时视频内容审核系统需要逐帧处理海量流媒体,但当前 VideoLLM 的单位推理成本仍显著高于传统 CNN 方案,规模化部署受限于 token 预算与 KV cache 占用。
核心洞察
- 视频LLM 的推理开销是端到端管线问题:单一阶段的效率优化往往被其他阶段的冗余抵消。 现有工作多聚焦 token 压缩、稀疏注意力或帧采样等局部机制,但实际部署时,帧采样率决定编码器输入大小,编码器输出经连接器下采样后才进入 LLM prefilling 和 decoding,而 KV-cache 增长又反向约束解码速度。该综述按 pipeline 阶段分类,强调跨阶段协同优化,并汇总了共享 host model 和输入协议下的 accuracy--cost 对比,避免从异构论文中得出错误结论。
- **Audiovisual 效率评测存在显著空白**:现有 VideoLLM 工作集中在纯视觉输入,音频模态的 token 压缩、编码共享和跨模态冗余消除缺乏系统研究。 虽然语音、环境声等音频流对视频理解至关重要,但大多数效率 benchmark 只报告视觉 token 减少或视觉 FLOPs,未纳入音频编码和跨模态注意力成本。该综述明确区分 visual 与 audiovisual 机制,指出需要统一的评测协议来量化音频引入的额外延迟和内存,这对实时多模态助手和视频监控等场景尤其关键。
- **内容自适应采样正在取代固定帧率**:从 fixed coverage sampling 到 learned query-free selection 和 query-conditioned relevance,效率优化越来越依赖输入内容和下游任务动态调整计算预算。 早期方法对所有视频均匀采样帧或 grid pooling,难以平衡长视频中稀疏关键事件和短时密集动作。新趋势是使用小型选择器或 LLM 本身评估帧重要性,但这类方法引入额外推理开销,且尚无统一标准衡量 selector 自身成本。该综述将这些方法归入 Input Construction and Selection 阶段,并讨论其与后续 token 压缩的耦合,为实际系统设计提供参考。
方法
输入与筛选
本 survey 以 2022 年末以来发布的 VideoLLMs 为起点,回溯早期仍被当前 pipeline 采用的帧采样与视觉编码器机制。纳入标准聚焦于报告了定量效率收益的工作:参数减少、每输入 FLOPs、延迟、内存占用或视觉/音频 token 数量下降。覆盖纯视觉与视听 VideoLLMs,并排除仅讨论训练效率或未提供成本数据的方法。
关键模块
- 瓶颈分析与阶段划分:将 VideoLLM 推理拆为四个管道阶段——输入构建与选择(帧采样、补丁/分辨率预算)、编码器计算(高效 backbone、编码器内部 token 缩减)、编码表示与连接器(选择/合并、网格池化、潜在重采样、记忆压缩)、LLM 执行与状态(解码器 token 剪枝/合并、稀疏注意力、KV-cache 压缩/卸载)。每个阶段细分为具体机制子类,覆盖学习式与启发式方法。
- 比较协议:对文献报告的 accuracy–cost 数据进行整理,优先提取同一宿主模型和相同输入协议下的同质比较(如相同 backbone、帧采样策略),并明确区分跨论文的异质证据,减少架构与评估协议混淆。
- 差距识别:统计视听效率工作占比、基准覆盖度与评估协议一致性,定位标准化缺口。
输出
生成按阶段组织的效率机制分类系统,汇编文献报告的成本-精度对比,并指出未来方向(如视听联合 token 压缩、统一基准)。同时维护 GitHub 仓库 awesome-efficient-videollm 提供持续更新清单。
与同类综述的差异点:不同于只列举模型或聚焦单阶段的文章,本 survey 强调将效率收益量化并纳入统一 cost-accuracy 对比框架,显式区分同质与异质证据,且纳入早期独立组件机制,并系统识别视听效率评估的空白。
实验
实验设计
本综述系统梳理了 2022 年末以来的 VideoLLMs 推理效率机制,按 帧采样、模态编码、连接器令牌减少、LLM 预填充与解码 四个阶段分类。论文收集了报告具体成本降低(参数量、每输入 FLOPs、延迟、内存、视觉/音频令牌数)的方法,并在共享主机模型与输入协议下汇编准确率-成本对比。
关键发现
效率机制涵盖输入构建、编码器计算、表示连接器和 LLM 执行等多个环节。早期帧采样与视觉编码器机制仍是当前 pipeline 的基础组件。音频-视频联合效率 研究存在明显空白,且跨论文评估协议异构,导致结果难以直接比较。
基线对比解读
作者区分了共享协议内的准确率-成本对比和跨论文的异质证据,指出多数方法在不同数据集和设置下报告结果,标准化评估缺失。未来需建立统一基准,推动实际部署中的效率优化。
行业影响
落地场景
该综述聚焦视频大模型(VideoLLMs)的推理效率优化,直接面向三类高价值场景:
- 实时视频理解服务:内容平台自动生成视频标签、摘要、问答;电商直播中的商品识别与话术合规检测;安防监控中的实时异常事件检测。
- 资源受限部署:移动端视频剪辑应用、AR/VR 设备上的视频理解、车载终端的多路摄像头语义分析。
- 大规模批量处理:视频库检索、广告素材审核、医疗影像报告生成等离线任务,通过降低单个视频成本提升吞吐。
商业价值
核心价值在降本与体验提升双线:
- 降本:帧采样、token 压缩、KV-cache 优化等机制可减少 30%–70% 的 FLOPs 或显存占用,直接降低云端 GPU 小时数;对多路视频流分析场景,单卡可处理路数上升,显著摊薄基础设施成本。
- 增收/体验:更低延迟支持交互式应用(如视频问答、实时字幕),提升用户留存;移动端本地推理避免网络传输和隐私顾虑,扩大可服务市场。
与现有工作流接口
这些效率机制可作为插件式模块集成进现有 VideoLLM 推理栈,无需从头训练:
- 推理框架层:在 vLLM、TensorRT-LLM 等框架中实现 token pruning / KV-cache offloading,作为算子优化补充。
- 视频预处理层:改进帧采样策略(如 query-conditioned selection)替换固定均匀采样,作为数据加载器组件。
- 模型连接器层:对 vision encoder 输出应用 grid pooling 或 latent resampling,仅在 connector 后做轻量适配,可复用已有 LLM 权重。
具体 use case
- 电商直播内容分析:平台对每场直播进行实时合规检测和商品卖点提取。采用 token 压缩和稀疏注意力后,延迟从 2s 降到 800ms,单卡可同时处理 10 路以上直播流,人力审核团队可缩减 40%。
- 自动驾驶数据闭环:车载多摄像头视频流需要实时语义理解(如交通标志、异常事件)。通过帧采样和 encoder 内 token reduction,模型可在 Orin 级芯片上以 15 FPS 运行,减少云端回传和标注成本。
局限
- 作为一篇综述,本文不包含新的实验验证,所有效率收益结论均来自跨论文的异构证据。作者在讨论中也指出,由于不同工作采用不同的宿主 LLM、输入帧协议与评测基准,文献中报道的准确率-成本对比很难直接横向比较,缺乏统一的标准化评测协议,这限制了对于效率机制实际收益的系统性判断。
- 方法筛选条件可能遗漏部分间接提升推理效率的工作。论文聚焦于明确报告参数、FLOPs、延迟、内存或 token 数量减少的机制,但诸如量化、算子融合、编译优化等硬件级或系统级手段未被纳入核心 taxonomy,而这些在实际部署中同样关键。此外,综述主要覆盖 2022 年末以来的 VideoLLM,早期某些视频编码效率工作虽被提及,但深度有限。
- 音视频(视听)效率仍是明显空白。论文承认现有工作大部分只处理视觉模态,音频 token 的编码、压缩以及与视觉 token 的融合优化很少被探索;同时缺少针对音视频任务的标准化效率基准,导致难以评估跨模态冗余带来的额外成本与潜在压缩空间。