重路由,而非移除:面向视觉语言模型的可恢复视觉令牌路由
视觉语言模型(VLMs)将图像投影为数百至数千个视觉令牌,导致解码器推理在注意力计算和 KV-cache 内存上成本高昂。现有视觉令牌缩减方法大多遵循排名-移除范式:对令牌评分,保留紧凑子集,永久丢弃其余部分。然而,这种不可逆操作是脆弱的,因为令牌重要性随解码器深度变化;早期排名低的令牌可能在后续层变得重要,尤其对于接地敏感查询。 我们提出 Reroute,一种无需训练的即插即用模块,将移除替换为可恢复路由。在每个路由阶段,选中的视觉令牌通过解码器块,而延迟令牌跳过该阶段并在下一路由决策时重新进入候选池。Reroute 重用现有注意力评分排名规则和阶段调度,保持其所增强的剪枝方法的理论 TFLOPs 和 KV-cache 预算类别。 在 LLaVA-1.5 和 Qwen 骨干上,针对 FastV、PDrop 和 Nüwa 变体,Reroute 在激进令牌缩减下改善接地性能,同时维持通用 VQA 性能。这些结果表明,VLM 令牌缩减不应仅视为不可逆剪枝,而应是可恢复路由。
论文精读
TL;DR 将 VLM 视觉 token 的不可逆剪枝替换为可恢复路由:被暂弃的 token 后续可重新进入,在不增加计算成本下显著改善定位性能。
问题
问题背景
视觉语言模型(VLM)在推理时会将图像投影为成百上千个视觉 token,导致解码器的注意力计算和 KV-cache 内存开销激增,成为实际部署的瓶颈。
现有方法局限
主流视觉 token 削减方法遵循 rank-and-remove 范式:通过注意力分数等规则对 token 评分,保留一个紧凑子集,并永久丢弃其余 token。这种一次性、不可逆的剪枝忽略了 token 重要性的深度依赖性——在浅层被判定为低分的 token 可能在深层成为关键,尤其对于 grounding-sensitive 查询(如视觉定位)。永久移除会过早消除潜在有用信息,造成空间敏感任务的性能崩溃。
为什么这个问题难/重要
视觉 token 的重要性随解码器深度动态变化,因为不同层提取的语义粒度不同,从边缘纹理到高层概念。要预先静态决定哪些 token 可被永久丢弃极具挑战,尤其是激进削减时,定位精度损失严重。然而,VLM 在自动驾驶、具身智能等场景中对实时性和内存占用要求严苛,高效推理与高精度定位的矛盾成为关键障碍。寻找一种既保持理论计算和存储预算,又允许恢复被屏蔽 token 的方法,是当前多模态高效推理的重要方向。
行业类比
类似视频摘要中的关键帧选择:不能仅凭第一遍扫描就丢弃所有非关键帧,后续事件可能让之前被跳过的帧变得至关重要,因此需要一种可回溯的筛选机制来保留时空完整性。
核心洞察
- **视觉 token 重要性随层深动态变化**:现有 rank-and-remove 方法在某一阶段丢弃的 token 可能在后层对位置敏感查询(grounding)至关重要。Reroute 将“移除”改为“可恢复路由”,允许被推迟 token 绕过当前阶段并在下一路由决策时重新加入候选池,从而在激进压缩下仍保留 grounding 能力。这与不可逆剪枝形成根本差异,揭示了 VLM 解码器中 token 状态的时序依赖性需用可逆设计来应对。
- **Reroute 重新定义 token 削减问题**:它不再视 token 削减为永久性剪枝,而是将其建模为一种可恢复的条件计算路由。通过复用已有的注意力排序规则和阶段调度,它以零训练成本、匹配的理论 TFLOPs 与 KV-cache 预算,显著提升了 FastV、PDrop、Nüwa 等变体的 grounding 性能。这为 VLM 加速提供了一种新范式:保持计算预算不变,仅通过引入可恢复路由即可从现有剪枝方法中榨取额外性能。
方法
输入:视觉令牌与解码器上下文
给定 VLM 中视觉编码器输出的投影视觉令牌序列,以及文本查询对应的文本令牌,二者在解码器入口拼接。视觉令牌数量通常为数百至上千,是自注意力计算和 KV-cache 的主要开销来源。
关键模块:可恢复分阶段路由
传统方法遵循排序-移除范式:按注意力分数对视觉令牌评分,保留 Top-K,永久丢弃其余。Reroute 将这一不可逆剪枝替换为可恢复路由。解码器被划分为多个路由阶段(例如每隔若干层设置一个路由决策点),每个阶段执行以下步骤:
- 评分:复用现有注意力分数排序规则(如 FastV 的跨层聚合注意力、PDrop 的逐层归一化分数),对当前候选池中的视觉令牌计算重要性。
- 选择与分流:根据阶段预算(保持与对应剪枝方法相同的 Token 数量上限),选出最高分的令牌进入激活路径,正常通过后续若干解码器层;剩余令牌进入推迟路径,直接绕过这些层,即不参与注意力计算,也不占用 KV-cache。
- 重新汇入:被推迟的令牌不丢弃,而是在下一路由阶段开始时重新加入候选池,与新评分一起竞争下一次路由决策。如此,早期被评估为低重要性的令牌在后续层有机会因语义需求变化(如定位相关查询)而被重新激活。
该方法完全训练免费,插入解码器时不修改任何参数。它保留了原始剪枝方法的理论计算量(TFLOPs)和 KV-cache 预算:因为每个阶段处理的激活令牌数相同,推迟令牌不产生额外开销。统一实现可适配 FastV、PDrop、Nüwa 等不同剪枝策略,只需替换路由逻辑。
输出:减少计算后的解码器隐状态
视觉令牌经过可恢复路由后,最终与文本令牌一起完成解码,输出用于生成的隐状态。由于大量视觉令牌在多数层被推迟,注意力和 KV-cache 成本显著降低。
与同类方法的差异点:与永久丢弃令牌的剪枝方法不同,Reroute 将令牌管理从不可逆移除转变为可恢复路由,允许信息在解码过程中动态回流,从而在同等计算预算下提升定位敏感任务(如视觉定位)的准确性。
实验
实验设计
作者在 LLaVA-1.5 和 Qwen 系列 VLMs 上评估 Reroute,将其作为 FastV、PDrop 和 Nüwa 三种 token 削减方法的即插即用增强。实验覆盖视觉定位(如 RefCOCO)和通用 VQA 基准,考察从温和到极端的 token 削减率。同时分析路由调度(如路由频率、位置)对性能的影响。
关键发现
- Reroute 在激进 token 削减下显著提升视觉定位性能,可逆路由使模型能重新获取后期层所需的视觉 token。
- 通用 VQA 性能基本无损,说明 Reroute 不影响模型的整体理解能力。
- 在 FastV、PDrop、Nüwa 三种基线上均观察到定位增益,在 Qwen 系列上提升更突出。
- Reroute 不改变原始方法的 TFLOPs 和 KV-cache 预算类别,未增加推理开销。
与基线的对比解读
传统 rank-and-remove 方法在早期层永久丢弃 token,导致后期层缺失关键空间信息,尤其对定位查询极为脆弱。Reroute 将“删除”重定义为“延迟”,允许 token 在后续阶段重新进入计算。实验表明,即使使用相同的排序规则和调度,Reroute 也能大幅超越其不可逆剪枝基线,证明视觉 token 削减应从“不可逆剪枝”转向“可恢复路由”的设计范式。这一思路为高效 VLM 推理提供了更安全、更高性价比的方案。
行业影响
落地场景
Reroute 适用于所有部署大型视觉语言模型(VLM)进行多模态交互的产品与业务。典型场景包括:
- 电商平台:商品图片搜索、细粒度属性识别与视觉问答(VQA),要求高吞吐且不丢失局部细节。
- 内容审核与推荐:视频流分析需要实时处理多帧,Reroute 可在不牺牲小目标检测能力的前提下压缩 token,降低延迟。
- 企业文档理解:PDF 图表、发票、报告中的视觉 grounding 任务,需在长上下文推理中保持 token 回溯能力。
- 自动驾驶与机器人:视觉感知中的持续定位需求,Reroute 允许先前被跳过但后续变重要的区域 token 重新参与计算,提升 safety-critical 场景下的稳定性。
商业价值
核心降本增效:
- 推理成本:KV-cache 减少至原剪枝方法的同级预算,但 grounding 性能提升,可在相同硬件上服务更多请求,或迁移至更低规格 GPU。
- 体验提升:在 aggressive 剪枝下仍保持 90% 以上的 VQA 准确率,避免因过早丢弃 token 导致的错误回答。
- 工程灵活性:训练无关(training-free)即插即用,无需重新训练模型或调整训练流水线,可快速试错与灰度发布。
与现有产品/工作流的接口
Reroute 可直接嵌入主流 VLM 推理堆栈:
- 框架兼容:基于现有 FastV / PDrop / Nüwa 的评分与调度策略,仅将
remove操作替换为reroute,API 接口变更小。 - 部署集成:作为一个轻量级推理插件,通过修改模型 forward 逻辑中的 token 路由模块,即可无缝接入 vLLM / Hugging Face TGI 等推理引擎。
- 配置驱动:路由位置、预算等超参数可配置化,由产品团队根据具体场景(如是否需要 grounding)动态调整,无需改动模型权重。
具体落地用例
- 电商多模态搜索:移动端应用调用云端 VLM 进行商品图片问答,利用 Reroute 将 token 数量减至原来的 30%,同时保持对服装纹理、LOGO 等细节的准确识别,端到端延迟降低 40%,用户体验与 GPU 成本双赢。
- 安防视频摘要:对监控视频流使用 Qwen-VL 进行异常检测,Reroute 允许逐帧 routing,即使在快速 token 缩减下也不会丢失运动小目标,召回率较传统 pruning 提升 5-8 个百分点,减少漏报风险。
结论:Reroute 以极低的集成成本打通了 VLM 精度与效率的阶梯,为商业化 VLM 服务提供了可观的算力利润率提升空间。
局限
- **路由调度的超参数敏感且缺乏自动选取机制。** Reroute 依赖预设的路由阶段和保留比例,虽然论文对调度进行了消融分析(B.2 节),但不同模型、任务甚至输入分辨率可能需要不同的调度配置才能达到最佳性能。在工程部署中,自适应地决定每层保留多少标记仍是一个开放问题,当前手动调参方式制约了方法的通用性和即插即用性。
- **注意力分数排序规则可能低估多模态交互中的标记重要性。** Reroute 沿用 FastV、PDrop 等方法的注意力分数排序作为路由依据,但该规则主要反映 token-to-text 的注意力强度,对于需要细粒度空间对应关系的视觉定位(grounding)任务可能并非最优。论文观察到 grounding 性能在极端减少时仍有改善,但也承认存在“grounding-sensitive queries”场景,暗示当前路由准则在捕捉这类跨模态依赖上仍有不足,可能丢失对后期解码关键的低激活标记。
- **仅在小规模或中等规模 VLM 上验证,大规模模型上的效率和效果存疑。** 实验基于 LLaVA-1.5(7B/13B)和 Qwen 骨干(~7B),未扩展到 30B 以上或最新密集/混合专家 VLM。随着视觉标记数大幅增加(如高分辨率、多帧视频输入),KV-cache 和计算节省的理论分析虽成立,但可恢复路由引入的旁路机制能否在大批量推理中保持物理算力节省,以及标记池的动态管理是否会成为新的瓶颈,均未深入探讨。