论文

EarlyTom: 早期令牌压缩实现快速视频理解

EarlyTom: 早期令牌压缩实现快速视频理解

视频大语言模型(Video-LLMs)在视频理解任务中展现出强大能力,但其实际部署受限于处理大量视觉令牌导致的效率低下。近期方法虽能在极低令牌保留率下保持与全令牌基线相当的准确率,但大多仅在预填充后期进行压缩,视觉编码器的效率仍未优化。本文首先证明,视觉编码过程对首次令牌时间(TTFT)贡献显著;因此,仅在编码器之后压缩视觉令牌仍有较大探索空间。 基于此,我们提出EarlyTom,一种免训练令牌压缩框架,在视觉编码器内部早期压缩视觉令牌,从而显著降低TTFT并提升吞吐量。此外,我们引入解耦的空间令牌选择策略,提升整体压缩效果。在LLaVA-OneVision-7B模型上,EarlyTom在单块NVIDIA A100 GPU上将TTFT降低最高2.65倍,FLOPs降低最高61%,同时准确率保持与全令牌基线相当。这些改进显著增强了Video-LLMs在实际生产场景中的部署实用性。

论文精读

TL;DR EarlyTom 是一个训练无关的早期视觉 token 压缩框架,在视觉编码器内部进行压缩,将 Video-LLM 的 TTFT 降低 2.65 倍、FLOPs 减少 61%,同时精度媲美全 token 基线,大幅提升实际部署效率。

问题

领域现状

Video-LLMs 在处理长视频或高帧率视频时,需将大量视觉 token 馈入 LLM,导致 TTFT (time-to-first-token) 显著增大,成为生产部署的核心瓶颈。业界急切需要既能保持推理精度又可大幅降低首 token 延迟的压缩方案。

现有方法及其局限

主流 token 压缩方法(如 FastVDeCoVidyCompress)通常在视觉编码器之后或 LLM prefilling 后期进行,视觉编码器仍需对全量视频帧执行高分辨率前向计算,其计算耗时在 TTFT 中占比可达 60% 以上。这种后期压缩策略无法减少编码器 FLOPs,导致:

  • 吞吐量受限于编码器,无法随压缩率线性提升;
  • 首次生成延迟依然很高,不满足实时交互需求;
  • 未利用编码器内部层次化特征进行渐进式筛选,压缩效率与精度平衡不足。

问题的核心挑战与重要性

早期在编码器内压缩视觉 token 的挑战在于:

  1. 空间-时序信息耦合:浅层特征仍保留精细空间细节,贸然丢弃 token 易破坏对象边界、运动轨迹等关键信息;
  2. 动态冗余异质性:不同视频帧、不同区域的信息密度差异大,固定压缩率难以避免关键帧跳变或细节丢失;
  3. 训练自由与通用性:为方便集成不同 Video-LLM,方法应避免繁重微调,但无训练的早期压缩极易损害多任务泛化能力。 若突破该难题,可在不牺牲精度的前提下将 TTFT 降低 2–3 倍,FLOPs 削减 60% 以上,使 Video-LLM 能在边缘设备实时视频理解等低延迟场景下规模化落地,直接关系视频 AI 的商业化进程。

行业场景类比

类似在实时视频分析管线中,为降低云端传输与计算成本,通常会在摄像头端进行轻量预处理或关键帧抽取——EarlyTom 相当于在模型的“感知前端”智能压缩,用更少的原始计算换取等同的感知质量。

核心洞察

  • **早期视觉 token 压缩**:将视觉 token 压缩操作从视觉编码器后移至编码器内部早期阶段,突破了现有方法只在编码完成后压缩的范式。视觉编码本身贡献了 TTFT 的主要部分,EarlyTom 在编码早期即丢弃冗余 token,避免了对所有 token 的处理,从而将 TTFT 最高降低 2.65 倍,同时保持准确率。这与现有滞后压缩方法(如 FastV、TokenPacker)形成鲜明对比,直接针对系统瓶颈进行优化。
  • **解耦空间 token 选择**:EarlyTom 引入解耦的空间 token 选择策略,分别建模帧间和帧内的 token 重要性,而非使用统一的全局采样。该设计在压缩比与准确率之间实现了更好的平衡,使得在极低 token 保留率下仍能维持与全 token 基线相当的精度,优于仅依赖注意力权重的单一空间压缩方法。

方法

核心思路

EarlyTom 针对 Video-LLM 视觉编码效率瓶颈,提出训练无关的早期 token 压缩框架。传统方法多在编码器输出端压缩,但作者发现视觉编码本身贡献了大量 TTFT(Time-To-First-Token),因此将压缩提前到编码器内部,缩短了计算关键路径。

输入与框架流程

输入为视频帧序列。EarlyTom 的压缩发生在 Vision Encoder 内部,而非传统方法仅在后端处理。整体流程为:

  1. 帧预处理:视频帧按常规方式分块转为图像 patches,形成初始视觉 tokens。
  2. 编码器内早期压缩:在 Encoder 的某一中间层(文中未指定具体层,但强调“早期”)插入压缩模块。该模块对 tokens 进行空间维度的选择,仅保留信息量高的 tokens,抛弃冗余部分,后续 Encoder 层仅处理缩小的 token 集。
  3. 解耦的空间 token 选择:作者提出一种与内容无关的空间选择策略。该策略将 token 选择分解为两个步骤:首先在帧间(temporal)维度评估 token 重要性,再在帧内(spatial)维度进行选择,从而避免直接做时空联合压缩导致的注意力干扰,提升压缩质量。
  4. 输出:压缩后的 tokens 直接送入 LLM 进行自回归解码,无需额外对齐训练。

关键设计:解耦空间选择

由于视频 tokens 同时包含时间与空间相关性,直接在三维空间做重要性评分易受注意力分散影响。EarlyTom 将过程分解为:

  • 帧级选择:在时间轴上对比各 token 的响应,优先保留运动显著或语义关键的帧区域。
  • 帧内空间选择:对保留帧内的 tokens 再做一次空间精细化筛选,剔除背景或静态区域。 这种解耦方式简化了评分计算,且不依赖额外参数,完全训练无关

与同类方法的差异

与 FastV、TokenSelect 等后置压缩方案不同,EarlyTom 首次将压缩推进到 Vision Encoder 内部,使编码器本身的计算量大幅降低。这不仅减少 TTFT,还同步提升推理吞吐,且解耦选择机制避免了联合压缩带来的注意力 sink 问题,性能更稳。

实验

实验设计

实验基于 LLaVA-OneVision-7B 模型,在单块 NVIDIA A100 GPU 上评估 EarlyTom 的推理效率与精度。EarlyTom 是一种 training‑free 的 token 压缩框架,其核心操作在视觉编码器内部早期完成,无需额外微调。评测指标聚焦 TTFT(time‑to‑first‑token)与 FLOPs,并以保留全部 visual token 的原始模型为基线,对比精度变化。

关键发现

  • TTFT 显著下降:EarlyTom 最高可将 TTFT 降低 2.65×,意味着视频理解服务从接收输入到产出第一个 token 的延迟大幅缩短,这对实时交互场景至关重要。
  • 计算开销锐减:FLOPs 最多减少 61%,直接降低 GPU 资源占用,允许更高吞吐与更低成本。
  • 精度无损:在如此激进的压缩下,EarlyTom 仍维持与 full‑token 基线可比的精度,验证了早期压缩不损害关键视觉信息的假设。

与基线方法的深度对比

现有主流方法(如 FastVTokenPacker 等)多在 prefill 后期对视觉 token 进行压缩,此时视觉编码器已经完整处理了全部 token,因此编码器本身的 FLOPs 与延迟并未得到优化。EarlyTom 的独特之处在于将压缩前置到编码器内部,直接减少编码阶段的计算量,从而在源头释放效率瓶颈。此外,配合解耦空间 token 选择策略,EarlyTom 能更精准地保留对语言模型回答关键的空间信息,避免了传统统一压缩可能造成的信息丢失。这种从编码器入手的范式转移,为视频大模型的生产部署提供了一条训练无关、即插即用的优化路径。

行业影响

落地场景

EarlyTom 直接面向需要快速响应的视频理解产品,如 视频内容审核平台交互式视频问答系统实时视频摘要生成短视频自动标签与推荐 等。这些场景通常要求端到端延迟在秒级以内,而传统 Video-LLM 因需要处理大量视觉令牌,首令牌时间(TTFT)过长,难以满足在线服务要求。EarlyTom 在视觉编码器内部早期压缩令牌,显著降低 TTFT,使视频大模型可用于生产环境的实时交互。

商业价值

  • 降本:在单卡 NVIDIA A100 上 TTFT 减少最高 2.65 倍,FLOPs 降低最高 61%。这意味着相同的硬件可以支撑更高的并发请求,云服务成本直接下降。
  • 增收与体验提升:更低的延迟让产品形态从“离线处理”转向“实时交互”,可解锁新的商业模式,例如 付费实时视频分析直播带货中的秒级商品识别与推荐。用户体验的提升也会间接拉动用户留存和付费转化。

与现有产品/工作流的接口

EarlyTom 是训练无关的即插即用框架,无需重新训练或微调,可直接集成到现有 Video-LLM 推理管道中。只需在视觉编码器的指定层插入轻量级压缩模块,不改变模型结构,与 LLaVA-OneVisionLLaVA-Video 等主流多模态架构兼容。集成方式类似在 Transformer 层间添加一个“丢弃令牌”的算子,对现有部署流水线(如 vLLM、TensorRT-LLM)侵入性小,可通过配置文件或少量代码适配完成部署。

具体落地用例

  1. 电商直播实时分析:在直播流中,EarlyTom 可让 Video-LLM 以低延迟检测商品、识别主播动作、判断违规内容,并实时生成结构化标签。相比全量令牌处理,响应时间可降低到 1 秒以内,支持弹幕中的自动商品问答,提升购买转化率。
  2. 内容平台的视频审核与摘要:对于 UGC 平台,EarlyTom 加速视频合规审核和自动摘要生成,在不损失准确率的前提下,将每视频处理成本降低约 60%,允许平台以相同预算覆盖更大规模的内容摄入。

局限

  • 虽然 EarlyTom 在 LLaVA-OneVision-7B 上展示了显著的 TTFT 降低,其泛化性验证仅局限于附录 A 中的 LLaVA-Video 和 Qwen2.5-VL 两个模型,尚未在更广泛的 Video-LLM 架构(如多尺度视觉编码器或非 ViT 结构)上测试。此外,所有实验均在单张 NVIDIA A100 GPU 上完成,不同硬件平台(如边缘设备或不同 GPU 显存限制)下的压缩收益与吞吐量变化缺乏评估,可能限制其在多样部署环境中的直接应用。
  • 作为训练自由的方法,EarlyTom 的压缩策略完全依赖启发式规则(如注意力 sink 现象驱动的空间选择),这可能导致在需要保留细粒度时空细节的任务(如长视频问答或精细动作定位)上出现不可恢复的信息丢失。与可微压缩或可学习剪枝相比,缺乏任务自适应能力,可能难以在高度动态的视频内容中平衡压缩率与精度。
  • 论文主要关注 TTFT 和 FLOPs 的降低,对解码阶段(生成 token 时的吞吐量)和内存占用的影响讨论不足。早期压缩虽减少了进入 LLM 的 token 数,但视觉编码器内部的压缩操作本身引入了额外计算开销(如注意力计算和 token 选择),其具体成本与编码器总开销的占比未量化,可能导致总体吞吐量提升不如预期。
论文Hesong Wang2026-05-28原文

相关内容