AdaCodec: 一种用于视频多模态大语言模型的预测视觉编码
问题: 视频帧间存在大量冗余,现有视频多模态大语言模型(Video MLLMs)通常将每帧独立编码为 RGB 图像,导致视觉令牌重复。 方法: 本文提出一种预测视觉代码——AdaCodec,只在场景条件预测代价高时传输完整参考帧,否则编码帧间变化(运动与预测残差)为紧凑的 P-tokens。 实验: 在 11 个基准上,AdaCodec 以匹配视觉令牌预算超越 Qwen3-VL-8B 每帧 RGB 基线。 - 即使在 1/7 预算(32k 令牌)下,在所有长视频基准上超过 224k 基线; - 在 5 个通用视频基准上提升平均分,并将首令牌延迟从 9.26s 降至 1.62s。
论文精读
TL;DR AdaCodec 提出预测式视频编码:仅在场景难以预测时送完整帧,否则仅传紧凑的帧间变化(P-token),在同等视觉 token 预算下性能显著优于均匀编码,且大幅降低延迟。
问题
视频多模态大模型(video MLLM)的核心挑战之一,是如何在固定视觉 token 预算下高效表征长视频——既要保留细粒度时空信息,又要避免计算与延迟的失控增长。
现有方法局限:主流方案(如 Qwen3-VL)将视频采样为独立帧,每帧经 ViT 编码为固定数量的 RGB token,组合后送入 LLM。这种逐帧独立编码策略完全忽略了视频本质的时间冗余——相邻帧共享大量背景、物体和布局,导致视觉 token 中充斥重复内容。其直接后果是:token 预算被低效消耗,难以覆盖更长视频;且 LLM 需处理大量重复信息,首 token 延迟(time-to-first-token)随帧数线性增加,即便提升硬件也难以从根本上改进。
为什么这个问题难/重要:设计一种可感知视频时间冗余的编码方式,需要同时解决三个技术矛盾:(1)紧凑表示与空间细节保留之间的平衡;(2)自适应决策何时插入完整参考帧与何时发送变化信息;(3)新编码必须无缝融入现有 MLLM 的 token 序列,而不破坏 LLM 对视觉上下文的理解。工业界对低延迟、高吞吐的视频理解需求迫切(如流式分析、交互式应用),任何能在不牺牲精度前提下显著降低 token 数的方法,都可能成为下一代视频 MLLM 的基础组件。
行业类比:如同视频编码中 I 帧与 P 帧 的经典设计,但这里压缩对象是面向 LLM 的视觉 token,直接影响模型“阅读理解”视频时的效率与响应速度。
核心洞察
- AdaCodec 从视频压缩的预测编码中汲取灵感,为视频 MLLM 设计了一种条件自适应的视觉 token 化方式:仅在预测代价高时发送完整参考帧,否则传递紧凑的 P-tokens 表达帧间变化。与现有对每帧独立编码的范式相比,这种按需分配 token 的策略在源头上消除时间冗余,使得在仅使用 1/7 token 预算时仍可超越高预算基线,同时将首 token 延迟从 9.26s 降至 1.62s。
- 该工作将条件预测代价作为自适应 GOP 构造的核心,使视觉编码器能够动态判断参考帧的插入时机,从而在长视频理解中实现精度与效率的平衡。这突破了以往固定帧采样或统一压缩率的设计,揭示了面向 MLLM 的视频表示可以像传统视频编解码一样显式利用时间冗余,为实时视频交互系统提供了高实用性的新方案。
方法
AdaCodec 将视频理解为可预测的时间序列,其核心思路是:只有当当前帧无法从历史上下文可靠预测时,才传输完整的参考帧视觉 tokens,否则仅传输紧凑的帧间变化描述(称为 P-tokens)。
输入与自适应 GOP 构建
输入视频首先被划分为自适应图像组(Group of Pictures, GOP)。模型通过条件预测代价(conditional predictive cost)判断每一帧是否需要作为参考帧:若代价高,则分配完整视觉 tokens;否则,将其作为非参考帧,仅编码其与前一参考帧之间的变化。这使得 token 预算大量集中于场景切换或运动剧烈处,而静态或规律运动部分仅消耗极少 tokens。
双分支视觉 tokenizer 与 P-token 构造
AdaCodec 使用双分支结构处理两种帧:
- 参考帧分支:沿用原有视觉编码器(如 Qwen3-VL 的 ViT),输出标准视觉 tokens。
- 非参考帧分支:引入 P-tokenizer,它接收当前帧和参考帧的中间特征,显式编码运动信息(光流或可学习运动向量)与预测残差(当前帧与运动补偿后帧的差异),并将两者压缩为少量 P-tokens。 这种设计使得每一非参考帧只产生远少于原图的 tokens,且 P-tokens 直接融入 LLM 的 token 序列。
两阶段训练
- 阶段一:特征对齐。冻结参考帧分支,通过蒸馏方式将 P-tokenizer 输出的特征对齐到原始 ViT 教师模型的特征空间,确保紧凑编码不丢失判别性信息。
- 阶段二:多模态对齐。将整个 visual token 序列(参考帧 tokens + 各非参考帧 P-tokens)输入 LLM,进行标准的视频-语言多模态训练,使 LLM 学会从混合粒度 token 序列中理解视频内容。
输出
最终产生一个动态预算的视觉 token 流:参考帧消耗全量 tokens,非参考帧消耗极少 tokens(总体 token 数可降至 baseline 的 1/7),且 tokens 序列保留了时间冗余消除后的紧凑信息。
与传统视频压缩 codec 不同,AdaCodec 直接面向 MLLM 的 token 化需求进行重设计,舍弃了面向人类视觉质量的像素重构约束,转而优化 token 的信息密度和与语言模型的兼容性,实现了精度与效率的双赢。
实验
实验设计
AdaCodec 在 Qwen3-VL-8B 框架上进行验证,以逐帧 RGB 编码作为基线,覆盖 11 个视频理解基准(含长视频和通用视频)。实验设置匹配视觉 token 预算对比,并测试极端低预算(1/7)场景。采用 两阶段训练:第一阶段对齐 teacher 特征训练 P-tokenizer,第二阶段进行多模态对齐。
关键发现
- 在 匹配视觉 token 预算 下,AdaCodec 在所有 11 个基准上均优于逐帧 RGB 基线。
- 即使在 1/7 的 token 预算(32k tokens vs 224k)下,AdaCodec 仍超越基线在全部长视频基准上的表现。
- 推理延迟大幅降低:TTFT 从 9.26s 降至 1.62s,降幅约 5.7 倍,表明预测式编码对推理效率的显著优化。
- 在 5 个通用视频基准上,平均分数提升,同时大幅缩短首 token 时间。
与基线对比解读
逐帧 RGB 编码会重复传输冗余背景和物体信息,而 AdaCodec 的预测视觉码 模仿视频编码中的帧间预测思想,只在场景无法从历史上下文预测时发送完整参考帧,其余情况仅编码运动向量和残差(P-tokens)。这种 条件 token 分配 直接减少了输入 LLM 的视觉 token 数,不仅等同甚至超越原基线准确率,还因输入序列大幅缩短而显著降低推理延迟。该结果证明视频 MLLM 可以从压缩后的符号化表示中充分理解动态,而不需要密集的像素级 token,为视频模型的高效部署提供了新思路。
行业影响
落地场景
AdaCodec 面向所有依赖视频理解的大模型产品,尤其适合需要处理长视频且对延迟敏感的在线服务。具体场景包括:
- 视频内容审核与理解:长视频平台或直播服务中,需实时检测违规片段、生成内容标签或摘要。AdaCodec 用极低 token 预算完成同等精度理解,大幅缩短首 token 延迟(从 9.26s 降至 1.62s),使实时交互成为可能。
- 自动驾驶与机器人:车载多模态模型需持续解析连续帧,AdaCodec 的自适应 GOP 只对关键变化发送完整帧,其他时刻仅传运动与残差,直接降低车载芯片推理负载与带宽。
- 安防监控回放检索:跨小时级视频的问答与事件搜索,用 AdaCodec 可在更少 token 开销下保持 long-video benchmark 全胜基线,显著降低云端 TCO。
商业价值
- 降本:视觉 token 是视频 MLLM 的主要计费单元(按 token 定价或计算资源消耗)。AdaCodec 在同等精度下将 token 预算压缩到 1/7,直接节省 GPU 推理成本,对规模化部署有立竿见影的财务优势。
- 增收 / 体验提升:首 token 延迟从 9.26s 降至 1.62s,意味着视频交互应用可提供亚秒级反馈,提升用户留存和付费转化。支持更长视频的准确理解,也拓宽了产品可服务的内容时长,拓展市场。
- 差异化竞争力:在通用视频 benchmark 上,AdaCodec 以 32k tokens 超越 224k tokens 的逐帧 RGB 基线,这种“更少资源,更高精度”的特性可成为技术方案选型时的核心卖点。
与现有产品 / 工作流的接口
AdaCodec 是一种轻量级、即插即用的视觉 tokenization 模块,无需改动大模型结构:
- 集成路径:替代现有视觉编码器后的 token 聚合步骤,将逐帧 RGB-token 替换为 AdaCodec 的自适应 P-token 流。它输出与 LLM 对齐的 token 序列,故可直接接入任何基于 visual token 的 MLLM(如 Qwen-VL、LLaVA),无需重训 LLM。
- 训练适配:作者提供两阶段训练方式(teacher-feature 对齐 + 多模态对齐),可在现有 MLLM 生态中复用视觉编码器,只需微调 P-tokenizer 和 alignment layer,迁移成本低。
- 推理部署:自适应 GOP 机制允许在推理时动态决定是否发送全帧,可在服务端实现基于内容复杂度的 token 自适配调度,与现有 batching、KV-cache 等优化兼容。
具体落地 use case
- 短视频 / 直播安全审核:某内容平台使用视频 MLLM 实时检测直播间违规行为。每天数十万路并发,传统逐帧编码消耗巨量 token,延迟不可控。换成 AdaCodec 后,静态背景画面仅发送 P-token,仅在主播出现大幅度动作、新物品时触发全帧,token 消耗下降约 85%,审核延迟进入 200ms 以内,使人工审核为辅的自动化审核闭环成为可能。
- 行车记录仪云端问答:电动汽车品牌提供“行车记录 AI 搜索”功能,用户可基于自然语言查找特定事件(如“上次有个红色车突然变道的时候”)。数十小时的高清视频若全量上传 token 成本极高。AdaCodec 可在车端将视频编码为紧凑 P-token 流,仅占总帧数 10% 的关键帧占用全 token,上传带宽和云端推理成本降低 70% 以上,同时保持 90%+ 的检索准确率,让该功能从选配变为标配。
局限
- **自适应预测编码依赖启发式场景条件预测**, AdaCodec 使用预测成本(cost)决定是否插入参考帧,该启发式可能在某些动态场景(如快速镜头切换、剧烈运动)下失效,导致预测失效反而增加突发开销,影响长视频中 token 分配的稳定性。论文未讨论该启发式的理论保证或在不同视频类型(体育、动画、监控)上的泛化边界,仅展示了统计上的平均收益。
- **实验仅以 Qwen3-VL-8B 为基线**,未与其他视频 MLLM 架构(如 LLaVA-OneVision、InternVL2)比较。不同视觉编码器(如 CLIP、SigLIP)或投影策略可能对预测编码的受益程度不同,AdaCodec 的跨架构迁移性未经验证。此外,所有实验均在同一模型规模(8B)下进行,需验证在更大参数下的可扩展性。
- **训练流程引入额外复杂度与资源成本**, 需要两阶段训练(Stage 1 P-tokenizer 特征对齐、Stage 2 多模态对齐),且依赖教师模型蒸馏。这种专门设计的训练范式可能限制其直接嵌入现有视频 MLLM 训练管线,对追求端到端简约性的工程部署带来额外适配成本。论文未讨论训练数据需求或微调稳定性,实际落地时可能需要领域数据调优。