论文

面向高效全模态大语言模型的分阶段自适应Token选择

面向高效全模态大语言模型的分阶段自适应Token选择

全模态大语言模型(Omni-modal LLMs,om-LLMs)通过将视频和音频编码为时间对齐的Token序列,实现统一的音视频理解。然而,在LLM中处理这些密集的非文本Token会带来巨大的计算开销。现有方法要么只关注视觉输入,要么在LLM前以固定模态比例剪枝Token,未能捕捉跨模态Token重要性在不同层的演化。 针对这一局限,本文首先分析了om-LLM的逐层Token依赖关系,发现视觉和音频依赖呈现块状模式,并随层深逐渐减弱,表明许多深层非文本Token在跨模态融合后变得冗余。基于此,我们提出 SEATS,一种训练无关、分阶段自适应的Token选择方法。具体而言: - 在LLM前,通过注意加权多样性选择移除时空冗余; - 在LLM内部,逐块渐进剪枝Token,并利用查询相关分数从时间窗口动态分配保留预算给各模态; - 在深层,一旦跨模态融合完成,移除所有剩余非文本Token。 实验在 Qwen2.5-Omni 和 Qwen3-Omni 上进行,SEATS 显著提升推理效率。仅保留10%的视觉和音频Token,即可实现 9.3× FLOPs降低 和 4.8× prefill加速,同时保持 96.3% 的原始性能。

论文精读

TL;DR SEATS 通过阶段自适应地剪枝视觉和音频 token,无需训练即可将全模态大模型推理 FLOPs 降至 9.3 分之一,速度提升 4.8 倍,性能仅降 3.7%。

问题

问题背景

全模态大语言模型(om-LLMs)将视频、音频编码为时间对齐的 token 序列,在窗口级交错送入 LLM 进行统一理解,但密集的非文本 token 导致巨大的计算开销,限制其实际部署。

现有方法局限

现有训练无关 token 选择方法存在两个不足:一是仅针对纯视觉输入设计,无法适应 om-LLM 中视觉与音频 token 并存的跨模态场景;二是仅在 LLM 前执行一次固定比例的剪枝,忽略了 token 重要性在深层网络中的动态演变。即使少数工作尝试在 LLM 内部剪枝,也未能根据跨模态融合的层间特性动态调整保留预算,导致深层仍保留大量冗余 token。

技术挑战与重要性

om-LLM 的推理瓶颈源于跨模态 token 冗余随层深增加而加剧:早期层需要密集 token 进行时空交互,而晚期层在跨模态融合完成后,视觉和音频 token 逐渐变为冗余。如何无训练地精确识别各层的重要 token 并分阶段剪枝,同时保持模型性能,是一个高难度问题。该问题直接影响模型在短时延场景下的可用性,是当前全模态模型走向落地的核心技术瓶颈,受到业界广泛关注。

行业类比

该问题类似于实时视频理解服务中需要在每一帧推断后动态丢弃无用特征,以降低计算负载——om-LLMs 的深层推理恰好需要类似的阶段式 token 淘汰策略。

核心洞察

  • Omni-modal LLMs中视觉和音频 token 的重要性并非固定,而是随网络深度呈现出块状递减模式。现有 token 选择方法通常对所有层采用统一的剪枝策略,或仅在 LLM 前用固定比例去除 token,忽视了跨模态融合过程中 token 重要性的动态演化。SEATS 通过分析各层注意力依赖发现,依赖在早期层强,后期层显著减弱,证明大量后期非文本 token 是冗余的。据此,SEATS 设计了阶段自适应剪枝:在 LLM 前基于多样性选择去除时空冗余;在 LLM 内部按块逐步剪枝,并在跨模态融合完成后直接丢弃全部非文本 token。这种与层依赖性对齐的策略使得在保留极少数 token(如10%)时仍能保持96.3%性能,同时实现9.3倍 FLOPs 缩减。这揭示了全模态 LLM 推理加速的关键并非不加区分地压缩,而是需要顺应模型内部的多模态交互动力学。
  • 基于查询相关性得分的自上而下预算分配,将保留 token 的预算从时间窗口动态重分配给不同模态。传统方法对视觉和音频模态采用固定保留比例,忽略不同输入片段内模态重要性的差异。SEATS 提出在 LLM 内部,以块为单位根据查询-键相关性得分评估每个窗口内视觉和音频 token 的重要性,然后从窗口级别分配预算到模态级别:对相关性高的窗口保留更多 token,并让同一窗口内的视觉和音频 token 竞争有限的预算,从而更精细地剪枝。这种动态分配机制使模型能自适应地聚焦于当前任务最相关的信息,例如在某个时刻强调视觉线索而压缩音频,反之亦然。实验证明,仅保留10% token 时,该方法不仅大幅减少计算,还维持了多模态理解的高精度,优于固定比例方案。

方法

输入:时序对齐的多模态 Token 序列

Omni-modal LLM(如 Qwen2.5-Omni)将视频和音频分别编码后,按时间窗口交错排列形成统一的 token 序列。这种 window-level interleaving 使模型能进行跨模态理解,但也带来了大量冗余的视觉/音频 token。

阶段一:LLM 前的空间-时间冗余剪枝 (Window-based DivPrune)

在 token 进入 LLM 主干前,SEATS 应用一种基于窗口的 注意力加权多样性选择(DivPrune)。该方法在每个时间窗口内计算 token 间的注意力相关性,优先保留能最大化信息多样性的 token,直接剔除空间和时间维度上的重复信息。与固定比例的预修剪相比,此阶段可自适应地根据内容复杂度决定保留量。

阶段二:LLM 内部的渐进式跨层 token 选择

进入 LLM 后,SEATS 并不一次性丢弃 token,而是根据对 层间 token 依赖性的观察——视觉和音频依赖呈块状(block-wise)且随深度递减——设计了一个 阶段自适应 机制:

  • 块级 TRR 衰减调度:将 Transformer 层分组为若干 block,每个 block 内按预设的 Token Retention Rate (TRR) 衰减曲线逐步减少 token 数量,模仿跨模态融合逐渐完成后信息冗余度上升的自然趋势。
  • 自上而下的 token 预算分配:从 LLM 深层向浅层回溯,依据各层的查询相关性得分(query relevance scores)动态分配每个时间窗口内保留的 token 数量。这确保了预算优先分配给对最终预测更关键的 token。
  • 查询引导的视觉/音频 token 选择:在每层实际选择 token 时,利用该层查询向量与视觉/音频 token 的注意力分数作为重要性指标,保留得分最高的 token。
  • 晚期层全丢弃:当跨模态融合完成后(深层 block),SEATS 直接移除所有剩余的非文本 token,让 LLM 后续层仅处理纯文本 token,大幅降低计算量。

输出与效率

最终,SEATS 将视觉和音频 token 数量缩减至原始的 10%,在 Qwen2.5-OmniQwen3-Omni 上实现 9.3× FLOPs 降低4.8× prefill 加速,性能仅损失 3.7%。

与同类方法的差异:现有训练无关 token 选择要么仅处理纯视觉输入,要么在 LLM 前采用固定模态比例修剪,忽略了跨层 token 重要性的动态变化。SEATS 首次将 层间依赖性分析 转化为可操作的 阶段自适应选择策略,实现了 om-LLM 推理的精细粒度效率优化。

实验

实验设计

Qwen2.5-OmniQwen3-Omni 上评估 SEATS。作为训练无关的令牌选择方法,SEATS 分两阶段:

  • 预 LLM 阶段:通过 注意力加权多样性选择(Window-based DivPrune)去除时空冗余。
  • LLM 内部阶段:按块逐步剪枝令牌,利用查询相关性得分动态分配各窗口及各模态的保留预算;深层跨模态融合完成后,移除全部剩余非文本令牌。 指标为 FLOPs、预填充延迟及下游任务性能,对比固定比例剪枝、仅预 LLM 剪枝等基线。

关键发现

  • 仅保留 10% 视听令牌时,SEATS 实现 9.3 倍 FLOPs 缩减4.8 倍预填充加速,同时保持 96.3% 原始性能,清晰显示深层令牌的高度冗余。
  • 层间令牌重要性呈块状衰减,跨模态融合后视觉、音频令牌可安全丢弃;分片衰减调度(block-wise TRR decay)与自顶向下预算分配有效捕捉这一动态。
  • 注意力加权多样性选择优于均匀采样或仅依靠注意力分数,保障了稀疏令牌的信息覆盖。

与基线对比的深度解读

相比仅作用于预 LLM 阶段或按固定模态比例剪枝的方法,SEATS 的自适应预算分配根据查询相关性动态权衡视听令牌的保留数量,避免过剪或欠剪。其“全部丢弃”策略利用了深层非线性融合的稳定性,远不同于底层直接丢弃的粗暴做法。此外,它支持 视觉-音频-文本全模态,相较于仅针对视觉的令牌剪枝方案通用性显著提升。消融实验进一步验证了每个组件的贡献,表明跨阶段协同设计的必要性。

行业影响

落地场景

SEATS 的主要价值在于加速全模态大模型(om-LLMs)的推理,适用于任何需要同时理解视频流和音频流的业务场景。典型产品包括:

  • 视频内容分析:自动剪辑、标签生成、章节划分
  • 视频会议助手:实时摘要、行动项提取
  • 交互式教育平台:学生基于教学视频提问,系统即时解答
  • 内容审核与安全:对直播或点播进行多模态违规检测
  • 监控与自动驾驶:快速分析多路摄像头与麦克风输入的语义

这些场景中,模型需逐帧处理大量视觉和音频 token,而 SEATS 可将 token 数量削减至 10%,使原本因时延过高而无法上线的应用成为可能。

商业价值

商业回报主要体现在大幅降低推理成本提升服务吞吐,同时保持几乎无损的性能(性能保留 96.3%)。

  • 降本:FLOPs 减少达 9.3×,意味着在相同硬件上可处理的请求量提升数倍,直接削减云端 GPU 租赁或自建集群的运营支出。对于基于 om-LLM 的视频处理 API 供应商,边际成本显著下降,可转向按更低价格提供计费服务。
  • 增收:更低的时延能改善用户体验,增加用户停留时间和付费转化(例如视频问答产品的付费订阅)。同时,吞吐提升后可以承接更多客户而不增加硬件投入,提高营收天花板。

与现有产品 / 工作流的接口

SEATS 是一种无需训练、即插即用的 token 选择策略,集成成本极低:

  • 它由一个预处理模块Window-based DivPrune)和LLM 内部递归剪枝模块组成,可直接挂载到现有 om-LLM 推理管线中,无需修改模型权重或训练参数。
  • 在工程上,可封装为一个推理加速中间件,对上层应用完全透明。例如,在部署 Qwen2.5-Omni 或 Qwen3-Omni 时,设置剪枝 ratio 和退出层阈值即可自动生效。
  • 支持与 vLLM、TensorRT-LLM 等推理框架结合,通过自定义 attention mask 实现,无需侵入模型图编译流程。

具体落地用例

  1. 社交媒体视频内容审核平台
    平台每天接收数亿条用户上传的短视频,需要同时分析画面和语音中的违规内容。使用 SEATS 加速 om-LLM 推理,可将单视频审核平均耗时从 2 秒降至 0.4 秒,使审核系统具备实时全量覆盖能力,而不必依赖高风险的低精度模型。
  2. 企业级视频知识库问答
    企业客户在内部培训视频库中提问,如“产品演示第 3 分钟提到的参数是什么”。om-LLM 需理解视频和音频片段,SEATS 使系统在 1 毫秒级延迟内响应,提供接近实时对话的体验,且推理成本仅为主模型 1/10,使该功能可从按量付费转为免费增值,促进平台活跃度。

局限

  • SEATS引入了多个关键超参数,包括窗口级别的多样性选择比例、块级别的token保留率衰减系数以及跨模态融合完成的判定阈值。这些参数需要针对不同的om-LLM架构和任务进行手动调节,缺乏自动化配置策略。在实际部署时,调参成本较高,可能限制方法的即插即用性。此外,不同模型对跨模态交互深度的设计差异可能导致SEATS的块划分与衰减策略需要重新适配,影响通用性。
  • 该方法仅在Qwen2.5-Omni和Qwen3-Omni上进行了验证,虽然这两款模型具有代表性,但om-LLM生态包含多种异构设计(如GPT-4o、Gemini等),它们在视觉和音频token的编码方式、交织策略及跨模态层排布上存在差异。SEATS的有效性是否可平滑迁移到这些架构尚不明确。同时,实验集中于视频问答和描述等任务,对于长视频流、纯音频理解或实时流式输入等场景的鲁棒性与效率收益缺乏量化评估。
  • SEATS重点优化了预填充阶段的计算开销,通过逐层裁剪非文本token实现了高比例的FLOPs降低和预填充加速。然而,在自回归解码阶段,模型仍需处理交互历史中的token,且该阶段的频繁内存访问和逐token生成特性使token选择机制难以直接应用。论文未探讨解码阶段的效率优化,这可能导致端到端对话延迟的改善有限,特别是在需要长上下文生成的应用中。
论文Zijie Xin2026-05-19原文

相关内容