OmniDelta: 技能驱动的预算分配用于 OmniLLMs 中的令牌压缩
新兴的 Omni 多模态大语言模型 (OmniLLMs) 实现了对文本、音频和视频的统一理解,但其长音频-视频令牌序列带来了大量的内存和推理成本。现有的压缩方法主要关注在固定预算下选择重要令牌,而未充分探索前面的预算分配问题。 我们表明,直接查询到音频/视频的相似性对于模态间预算分配不可靠,并且统一的模态内预算可能会遗漏关键证据而保留冗余内容。为解决这些限制,我们提出 OmniDelta,一个无需训练、技能驱动的框架,它将 意图感知的模态间分配 与 内容感知的模态内分配 相结合。OmniDelta 首先构建音频和视频技能池,根据查询需求调整固定的保留令牌预算,然后利用局部复杂性和时间冗余在音频片段和视频帧上重新分配模态预算。生成的局部预算可与现有剪枝策略结合,保持总保留令牌比率不变,同时改变预算的分配位置。 在四个音频-视频基准测试上使用两个 Qwen2.5-Omni 模型进行的实验表明,OmniDelta 在不同的剪枝比例下建立了新的精度-效率 帕累托前沿。在 Qwen2.5-Omni-7B 上保留 25% 令牌时,OmniDelta 将 GPU 内存减少 22.0%,并且相对于全令牌推理实现了 1.64 倍的端到端加速。
论文精读
TL;DR OmniDelta 是一种训练自由的技能驱动预算分配框架,通过意图感知跨模态与内容感知模态内分配,解决 OmniLLMs 长序列压缩中的预算分配难题,在多种剪枝率下实现精度-效率 Pareto 最优。
问题
全模态大模型(如 Qwen2.5-Omni)统一理解文本、音频、视频,但其长序列 token 带来显著推理开销,token 压缩 成为必选项。当前工作的重心多在给定固定总预算下筛选重要 token,而预算分配——即如何在模态间与模态内划分这些保留配额——却鲜少被系统研究。
现有方法的局限体现在两方面:
- 跨模态分配依赖不可靠的启发式:直接计算查询到音频/视频的相似度常受语义歧义和噪声影响,无法准确反映各模态对回答的贡献,导致关键模态预算不足或冗余模态占用过多。
- 模态内统一分配忽视内容异质性:对视频所有帧或音频所有片段均匀分配 token,易遗漏短时关键证据(如一闪而过的文本),同时为静默或静态冗余帧浪费预算。这种“一刀切”策略造成精度 - 效率的次优平衡。
该问题兼具挑战性与重要性。技术难点在于:需要意图感知 地动态调整模态间配比(查询“翻译”侧重音频,“发生了什么”侧重视频),并内容感知 地根据局部复杂度和时序冗余重新分配模态内预算;同时方案必须免训练、低延迟,才能与现有 token 剪枝算法无缝集成并满足在线推理需求。随着视频问答、语音助手等多模态交互大规模落地,精细化预算分配对降低服务成本、提升用户体验至关重要,直接关乎全模态模型从实验室到生产环境的迁移。
类似推荐系统根据用户 query 动态分配注意力到不同特征域,而不是均匀加权,OmniDelta 为全模态推理中的 token 预算注入“按需分配”的智能,以更少计算捕获关键多模态线索。
核心洞察
- **预算分配是 token 压缩的必要前置问题**,不应简单采用均匀预算或直接相似度驱动。本文首次将多模态 token 压缩分解为跨模态(inter-modal)与模态内(intra-modal)两阶段预算分配,再复用现有剪枝策略。这比主流方法仅关注固定预算下的 token 选择更根本,揭示了先“合理分钱”再“精打细算”的 Pareto 改进空间。
- **技能驱动的意图感知分配(skill-driven intent-aware allocation)** 取代了不可靠的 query-to-audio/video 相似度。通过预先构建**音频与视频技能池**,将查询意图映射为模态级的保留 token 数量,使预算跟随任务需求流动。相比直接计算跨模态相似度,技能路由更鲁棒,因为相似度在长序列上易受噪声干扰,而技能池抽象出高层语义类别,对齐了查询与模态内容的功能角色。
- **模态内基于局部复杂度和时间冗余的内容感知再分配**实现异构预算(heterogeneous budgets)。论文从理论上证明均匀预算会浪费在冗余片段,并丢失关键局部证据。通过计算局部复杂度(如帧差)和冗余度,在片段/帧间重分配预算,能显著提升检索与推理的 token 效率,且与现有剪枝算法解耦,可即插即用。
方法
OmniDelta 是一种训练无关的 token 压缩框架,专为 OmniLLMs 设计,核心思想是用查询意图和局部内容动态分配压缩预算,而非固定全局比例。整体流程分为三阶段:
输入与技能池构建
系统接收用户查询、音频 token 序列和视频 token 序列。预先构建音频技能池与视频技能池,每个技能池由一组可解释的语义原子(如“语音情感识别”“物体运动分析”)组成,每个原子对应一个可检索的特征向量,通过查询到技能池的映射,将开放意图转化为可计算的模态偏好。意图感知的模态间预算分配(Inter-Modal)
将总保留 token 比率视为可转移预算。计算查询与每种技能池条目的相似度,根据匹配技能的类型决定音频与视频模态的应得分额。例如,查询侧重语义理解时,视频 budget 可能更高;侧重情绪判别时,音频 budget 会获得更多倾斜。分配过程保证预算总量恒定,且分配函数是单调有界的,避免剧烈抖动。内容感知的模态内预算重分配(Intra-Modal)
在获得各模态的全局预算后,进入细粒度分配:- 音频:按时间片段计算局部能量、过零率等复杂度指标,抑制静音或平稳背景段,增强语音活动区。
- 视频:利用帧间光流或特征差异衡量时间冗余,减少静态场景的 token 占用,保留高运动或场景切换区域。
最终为每个音频段和视频帧输出一个局部保留比率,形成异质化的空间-时间预算掩码。
Token 剪枝与输出
将生成的 local budget 与任意现成的 token 剪枝策略(如 FastV、PruMerge 等)组合,在总预算不变的约束下,让剪枝操作精准避开关键信息。输出即为压缩后的 token 序列,送入 OmniLLM 进行生成。
与同类方法的差异:现有压缩方案通常采用固定预算或仅依赖粗粒度的 query-to-modality 余弦相似度,忽略了模态内部的结构冗余和任务意图的多样性;OmniDelta 首次通过可解释的技能池实现意图—模态的语义对齐,并在模态内部进行细粒度、内容自适应的局部预算调整,全程无需额外训练,即可在同类压缩比下显著提升下游精度。
实验
实验设计
在 四个音视频理解基准 上评估 OmniDelta,使用 Qwen2.5-Omni 的两个模型规模。对比方法包括固定预算下的 token 剪枝策略,以及均匀模态内预算分配。实验在不同 token 保留率(如 25%)下测量 准确率‑效率前沿,并分析预算分配的可视化结果与消融。
关键发现
OmniDelta 在准确率‑效率 帕累托前沿 上全面超越基线。在 25% token 保留 的设置下,OmniDelta 相比全 token 推理:
- GPU 内存下降 22.0%
- 端到端加速 1.64×
- 准确率损失极小,建立了新的前沿 动态预算分配在 意图感知的模态间分配 与 内容感知的模态内分配 上均表现出明显的优越性,消融实验证实了每一部分的贡献。
与基线的深度对比
固定预算方法依赖 直接查询‑模态相似度 进行模态间分配,但该相似度被证明 不可靠——高相似度并不保证 token 重要性。OmniDelta 以 技能池(skill pool) 为中介,根据查询意图将固定总预算 动态重分配 到音频与视频,显著提升了关键证据的保留比例。此外,模态内采用 局部复杂度与时间冗余度 指导分配,克服了均匀预算的不足。这一 训练无关 的框架可叠加现成剪枝策略,只改变预算花费位置而不增加总开销,为多模态大模型的推理优化提供了实用思路。
行业影响
落地场景
OmniDelta 可嵌入任何集成 OmniLLM 的实时音视频理解产品,如 视频会议摘要、直播内容审核、短视频智能标签、语音助手、在线教育互动问答 等。在这些场景中,长音频视频流往往包含大量冗余,全 token 推理导致高延迟和高成本。OmniDelta 通过查询意图与内容特征的动态预算分配,让推理聚焦于关键片段,尤其适合需要低延迟响应的交互式应用。
商业价值
- 降本:在 Qwen2.5-Omni-7B 上,25% token 保留率下 GPU 内存降低 22.0%,端到端速度提升 1.64 倍,可直接减少云端推理的 GPU 租赁成本 和能耗。
- 体验提升:实时音视频应用中,推理延迟降低意味着更流畅的交互,例如视频问答的响应时间从秒级降至百毫秒级。
- 增收:单卡吞吐提升 1.6 倍以上,同硬件可支撑更多并发请求,在按调用量付费的商业模型中可显著扩大服务规模而不增加基础设施投入。
与现有产品 / 工作流的接口
OmniDelta 是 训练无关的即插即用模块,位于 OmniLLM 推理 pipeline 的预处理阶段,输出动态的 token 预算向量,然后无缝衔接现有的 token 剪枝策略(如 FastV、PyramidKV)。集成路径清晰:
- 构建音频 / 视频技能池(离线完成);
- 对每个请求,根据查询意图进行跨模态预算转移(inter-modal),再依据内容复杂度和时间冗余进行模态内重分配(intra-modal);
- 将预算交给下游 token 选择器,保留总 token 比例固定,仅改变预算花费位置。 该流程可封装为推理服务的中间件,与 vLLM、Triton Inference Server 等框架兼容,无需重新训练模型。
具体落地 Use Case
- 电商直播分析:用户提问“刚才主播展示的连衣裙面料是什么?”,OmniDelta 根据意图将音频预算转移到主播讲解时段,视频预算集中在服装特写帧,跳过无关的背景镜头,在 0.3 秒内完成定位与回答,成本仅为全量推理的 1/3。
- 在线教育视频问答:学生询问“课程哪一部分讲解了反向传播推导?”,系统利用 OmniDelta 将预算分配给包含白板书写和关键术语的片段,快速生成带时间戳的答案,提升学习体验,同时降低平台的整体推理开支。
局限
- - **技能池覆盖范围与泛化性**:方法依赖预先构建的音频和视频技能池,技能池的条目基于典型问题意图(如“动作识别”“场景描述”)设计。尽管作者展示了代表性条目,但实际开放域查询的意图分布远为复杂,技能池难以穷举所有可能。当用户指令偏离池内技能时,意图感知的模态间预算分配可能出现偏差,导致重要模态预算不足。这一依赖先验的设计限制了框架在真正零样本场景下的鲁棒性。
- - **启发式规则的性能上限**:模态间分配基于查询与技能描述的相似度,模态内分配利用局部复杂度和时间冗余信号。这些规则虽 training-free 且可解释,但缺少参数学习,可能无法逼近问题的最优解。对于需要精细证据选择的跨模态推理任务(如区分两个极为相似的视频片段),手工设计的分配策略可能丢失关键信息,而学习式分配方法(如轻量预测头)可能取得更高精度,但需额外训练成本。
- - **模型与数据通用性待验证**:实验仅基于 Qwen2.5-Omni 的两个规模变体及四个音频-视频基准,未测试其他主流 OmniLLMs(如 Video-LLaMA、VITA、InternVL-omni)。不同模型的编解码器、token 化策略和注意力机制差异可能影响预算分配收益。同时,基准多偏向结构化推理,真实世界流媒体等连续交互场景下的表现尚未评估,这限制了结论的推广性。