论文

用于视觉 Token 剪枝的 AI4AI 框架

用于视觉 Token 剪枝的 AI4AI 框架

视觉 Token 剪枝 能大幅降低多模态大语言模型(MLLMs)的推理成本,但现有方法多依赖固定手工启发式与昂贵试错。面对剪枝目标、预算和模型架构的多样化,手动设计越来越困难。 为此,本文提出一个 AI4AI 框架,探讨大语言模型能否自动设计有效的视觉 Token 剪枝算法。尽管 LLM 具备算法知识与推理能力,将其转化为专用任务的有效方案仍具挑战。关键在于设计合适的搜索状态表示,连接 LLM 内部知识与视觉 Token 剪枝的结构约束。基于此,我们提出 AutoPrune,一个免训练的 LLM 驱动策略设计框架。其核心是 Token 剪枝领域特定语言(TPDSL),包含 131 个可复用原子,覆盖预算控制、Token 评分、选择约束和 Token 重组。TPDSL 将每个搜索状态表示为强基础策略的残差修改,缩小搜索空间并引导 LLM 关注关键性能组件。 在 14 个多模态基准和 3 个 MLLM 主干上的实验表明,AutoPrune 即使在移除 94.4% 视觉 Token 时,仍保留超 99% 的全 Token 性能,同时 FLOPs 减少 9.9 倍,prefill 延迟减少 6.4 倍。

论文精读

TL;DR AutoPrune 用 LLM 自动设计视觉 token 剪枝策略,通过 TPDSL 与残差搜索空间,在去除 94.4% 视觉 token 下保留 99% 性能,FLOPs 降 9.9 倍、prefill 延迟降 6.4 倍。

问题

问题背景

多模态大模型(MLLM)在推理时需要处理大量视觉 token,视觉 token 剪枝已成为降低计算成本的关键手段。当前领域关注如何在保持性能的同时最大化压缩率。

现有方法局限

现有剪枝方法大多依赖手工启发的固定策略,例如基于注意力分数的阈值过滤或空间聚类降采样。这些策略通常针对特定模型和预算进行人工调参,一旦剪枝目标、预算或模型架构发生变化,就需要重新投入专家试错成本。随着设计空间不断扩大(包括预算控制、评分函数、选择约束、token 重组等维度),手动遍历组合变得不可行,且难以保证策略在跨任务、跨骨干上的可迁移性。此外,现有方法缺少统一的搜索状态表示,无法将剪枝策略的结构化约束与自动设计算法有效对接。

技术挑战与重要性

该问题的难点在于:大语言模型(LLM)虽有丰富的算法知识,但如何将通用知识转化为针对特定任务的剪枝策略并非易事。核心瓶颈在于设计恰当的搜索状态表示,使 LLM 既能理解剪枝策略的空间结构,又能保证生成结果的合法性与可执行性。业界对 MLLM 推理效率的持续关注,使得自动生成剪枝策略成为高价值方向,若成功可显著降低专家参与度,缩短策略迭代周期。

行业类比

这一思路类似于用 AutoML/NAS 替代人工设计神经网络结构:从手工试探转向由 LLM 驱动的策略搜索,只不过搜索对象从网络拓扑换成了 token 剪枝算法,本质上都是自动化算法设计在特定任务上的迁移。

核心洞察

  • 将 LLM 的通用算法知识转化为视觉 token 剪枝策略,关键在于搜索状态表示的设计。AutoPrune 提出 TPDSL(Token Pruning Domain-Specific Language),用 131 个可组合原子描述 budget 控制、token 评分、选择约束和 reassembly,把开放式搜索变成结构化程序合成。与之前依赖手工启发式或黑盒搜索不同,这种表示让 LLM 的推理直接作用于策略组件,而不是在原始 token 空间漫无目的地探索,大幅提升了设计空间的可行性与可解释性。
  • 残差修改(residual modification)范式是 AutoPrune 的核心创新:每个搜索状态被表示为对强基础策略的微小改动,而非从零生成。这显著缩小了搜索空间,使 LLM 聚焦于对性能影响最大的策略组件。实验显示,即使移除 94.4% 的视觉 token,AutoPrune 仍保持 99% 以上性能,同时 FLOPs 降低 9.9 倍、prefill 延迟降低 6.4 倍。这种‘从强基线出发做微调’的思路,对训练免费的自动化算法设计具有普适借鉴价值。

方法

方法:AutoPrune 的 LLM 驱动视觉 Token 剪枝策略设计

输入:给定多模态大模型(MLLM)的视觉编码器输出 token、目标剪枝预算,以及一个强基策略(如现有剪枝方法)作为起点。

关键模块:

  • TPDSL 领域特定语言:定义 131 个可复用原子,覆盖预算控制、token 评分、选择约束、token 重组四类操作。每个原子具备明确组合规则与运行时语义,并通过材料化与安全验证确保生成策略可执行。
  • 残差搜索状态表示:每个候选策略表示为基策略的残差修改,而非从零开始。LLM 只对基策略进行局部替换或插入,受残差交换配额限制,缩小搜索空间并引导注意力到对性能影响最大的策略组件。
  • LLM 驱动的策略设计:以 LLM 作为策略提议器,根据 TPDSL 语法、当前策略性能反馈和预算要求,迭代生成新策略。通过 TPDSL 引导的残差细化,LLM 的算法知识与结构约束相结合,避免生成无效策略。

输出:一个可部署的 TPDSL 剪枝策略,直接嵌入 MLLM 推理流程,在推理时对视觉 token 进行预算控制和选择,无需额外训练。

与依赖手工启发式或昂贵专家试错的方法不同,AutoPrune 将 LLM 的通用算法知识通过 TPDSL 约束到专用搜索空间,并以残差修改提高搜索效率与策略迁移性。

实验

实验设计

AutoPrune 在 14 个多模态 benchmark 上评估,覆盖 LLaVA-1.5-7B、LLaVA-NeXT-7B 及更高级架构等 3 个 MLLM backbone。方法以 training-free 方式,让 LLM 依 TPDSL 的 131 个原子与 residual refinement 自动生成剪枝策略,无需手工调参。

关键发现

  • 在极端剪枝率 94.4% 下,性能保持超过 99% 的 full-token 水平。
  • 同时 FLOPs 降低 9.9x,prefill 延迟降低 6.4x,显示视觉 token 冗余很高。
  • 策略跨 budget、跨 backbone 可迁移,说明 residual base policy 结构有效。

与基线对比解读

相比固定启发式与人工专家策略,AutoPrune 将搜索空间从手工设计释放到 LLM 自动探索;residual 表示让 LLM 聚焦关键组件,避免盲目搜索。training-free 特性大幅降低设计成本,且实验表明 policy 质量不受单一 LLM proposer 限制(ablation 支持)。

行业影响

落地场景

AutoPrune 适用于所有部署多模态大模型(MLLM)的推理服务,尤其是对延迟敏感或计算资源受限的场景:

  • 电商:商品图像自动问答、详情页图片理解、以图搜图等,可大幅降低 GPU 推理成本。
  • 内容平台:视频帧级标签生成、图文内容审核、自动字幕/摘要,处理海量视觉 token 时收益显著。
  • 医疗/金融文档分析:影像报告生成、票据/合同图像理解,需要在保持高精度的同时控制推理开销。

商业价值

核心收益沿 降本 与 体验提升 两条线:

  • 降本:在 LLaVA-NeXT-7B 上,去除 94.4% 视觉 token 仅损失 <1% 性能,FLOPs 降低 9.9x,prefill 延迟降低 6.4x。这意味着同样的硬件可支持更高并发,或直接降低云推理账单。
  • 体验提升:延迟降低直接改善实时交互类产品(如视觉问答助手)的用户体验,且无需重新训练模型,策略可快速迭代适配不同预算。

与现有工作流接口

AutoPrune 是 训练免费 的,不改变 MLLM 权重,因此可以作为一个轻量级前置模块插入现有推理栈:

  1. 离线阶段:设置 TPDSL 的 131 个原子与基础策略,LLM 搜索生成残差修改的策略(如 residual_exchange_quota=3),并验证安全性。
  2. 在线阶段:将生成的剪枝策略以规则形式部署在 token 进入 LLM 前,与视觉编码器输出直接对接,无需修改模型服务本身。

具体 Use Case

  • 电商平台智能客服:用户上传商品图片咨询细节,AutoPrune 可将每张图片的视觉 token 减少 90% 以上,保持答案质量相当,使单卡可服务的并发请求数提升约 6-10 倍,直接降低推理单元成本。
  • 在线教育解题应用:学生拍照上传题目,系统用 MLLM 识别并解答。AutoPrune 在保留公式、图表关键信息的同时大幅剪除背景冗余 token,使解题响应从秒级缩短到亚秒级,支撑高峰时段的流量弹性。

局限

  • **AutoPrune** 虽声称 training-free,但搜索过程需多次调用 LLM 生成候选策略,引入额外推理开销与随机性。在算力受限或对延迟敏感的部署场景中,LLM 搜索成本可能抵消部分剪枝收益;此外,LLM 输出的随机性会导致搜索轨迹不稳定,往往需要重复采样或引入额外验证,增加实际使用复杂度。论文未给出搜索阶段的具体算力消耗与时间成本,也未讨论如何在生产环境中高效管理这一开销。
  • **TPDSL** 的 131 个原子虽然覆盖了预算控制、打分、选择约束等常见组件,但设计空间仍然受限,难以表达与特定模型架构深度耦合的动态剪枝逻辑,例如基于注意力图的自适应权重调整或跨层协同剪枝。同时,残差修改依赖一个强 base policy 作为起点,如果 base policy 本身存在系统性偏差,搜索可能陷入局部最优,无法发现更优的全局策略。论文未分析 base policy 选择对最终结果的影响范围。
  • 实验仅在 **LLaVA-1.5-7B**、**LLaVA-NeXT-7B** 等三个 MLLM 骨干上验证,且 benchmark 集中在视觉问答与推理类任务,对生成式 MLLM、视频理解或多轮交互等场景的泛化性未充分评估。此外,尽管 TPDSL 提供了结构化表示,但搜索得到的策略组合逻辑仍较为复杂,人工审查与解释成本较高,不利于安全关键场景下的审计与合规。
论文Zhen Liu2026-08-07原文

相关内容