论文

晚期层融合就够了:视觉饱和下多模态大语言模型的双路径视觉令牌路由

晚期层融合就够了:视觉饱和下多模态大语言模型的双路径视觉令牌路由

多模态大语言模型(MLLMs)通常继承为单模态文本设计的深层对称Transformer骨干,并对图像与语言令牌施加相同计算。这种设计忽略了关键模态不对称性:图像与文本令牌在信息密度、冗余度和所需推理深度上存在显著差异。通过对LLaVA-1.5的逐层分析,我们发现视觉令牌在中层趋于饱和。具体而言,文本到图像注意力从第0层的0.68骤降至第4层的0.07,并在第18层后稳定在0.04附近,而文本令牌则持续受益于深层语义处理。这些发现表明架构对称性与深度异步模态演化之间存在不匹配,导致深层任务特定适应中出现冗余视觉计算和感知表征漂移。 受此启发,我们提出双路径视觉令牌路由(DPVR),一种面向高效MLLMs的模态非对称路由框架。其核心实例DPVR-LF(晚期层融合)在饱和点将视觉令牌路由至单层可训练侧分支,运行13层纯文本前向传播(跳过深层堆叠中的图像位置),并仅在最终层重新融合视觉与文本流。仅使用约3%的可训练参数,DPVR-LF在标准基准上保持竞争力,同时减少深层Transformer堆叠中的视觉计算。 实验结果挑战了“视觉令牌必须遍历所有深层语言模型层”的传统假设,表明单个晚期融合层足以维持LLaVA风格MLLMs的强大感知能力。

论文精读

TL;DR 发现视觉令牌在LLaVA中层饱和后,提出DPVR-LF:在饱和点将视觉令牌送入可训练旁路,深层仅处理文本,最终层融合,大幅降低视觉计算且性能持平。

问题

问题背景

多模态大语言模型 (MLLMs) 的主流设计延续了纯文本 Transformer 的架构对称性:所有图像 token 与文本 token 无差别地穿过全部层。这使得视觉-语言融合成为当前高效推理优化的焦点,尤其在高分辨率、多图像场景下 visual compute 占比陡增,倒逼架构层面的重新思考。

现有方法局限

现有 token 精简方案(如 FastVSparseVLM)多依赖启发式剪枝或下采样,本质仍要求视觉 token 参与深层计算。但精细的 layer-wise 分析表明,视觉饱和度 (visual saturation) 在早期层就已出现——LLaVA-1.5 的 text-to-image attention 从第 0 层 0.68 降至第 4 层 0.07,18 层后稳定在 0.04。这意味着深层视觉计算贡献微弱,却会带来两个隐患:

  • 冗余计算:40+ 层中图像 token 的注意力近乎常数,浪费大量 FLOPs;
  • 表示漂移:深度任务特异化可能扭曲已饱和的视觉表示,反而损害下游感知。

为什么这个问题难 / 重要

同步处理视觉与语言 token 的直接收益是易于实现,但模态间信息密度与推理深度异步 (depth-asynchronous modality evolution) 的根本差异被掩盖。挑战在于:

  1. 如何可靠地探测饱和点 (saturation point),并在不同模型规模、不同输入长度下保持泛化;
  2. 如何设计非对称路由,使视觉 token 提前退出深层栈 (deep stack) 却依然保持端到端梯度健康、不损失最终效果;
  3. 极简的晚期融合是否足以恢复多模态表征能力,这直接挑战了“视觉 token 必须经历全部 LLM 层”的默认假设。 对工程实践而言,发现浅层视觉表示即可支撑复杂 VQA / 基准,意味着可以大幅压缩推理时计算预算,这在低延迟交互、批推理场景下尤为关键。

行业类比

这类似于视频理解中关键帧与非关键帧的差异化处理:稀疏采样的 I 帧承担深层语义,而 P 帧可以依赖浅层特征注入,避免所有帧的均等计算,从而在吞吐与精度间取得平衡。

核心洞察

  • 视觉 token 在浅层即完成跨模态交互,深层计算冗余。通过对 LLaVA-1.5 的逐层分析发现,文本对图像的注意力从 layer 0 的 0.68 骤降至 layer 4 的 0.07,之后在 layer 18 后趋近 0.04,表明视觉 token 在模型中间层已饱和,而文本 token 仍需要更深处理。这揭示了 MLLM 中架构对称性与模态异步演化的根本矛盾:对称的 Transformer 为视觉 token 分配了过多深层计算资源,而这些层几乎只服务于文本。此观察从计算冗余角度定量解释了现有架构的低效,与单纯减少视觉 token 数量的方法正交,为从层级别进行计算路由提供了直接依据。
  • 单一晚融合层训练有素时足以保持多模态性能,挑战视觉 token 必须贯穿所有层的假设。DPVR-LF 在视觉饱和点将视觉 token 路由到可训练的单层侧分支,文本 token 继续通过 13 层深堆叠,最后在最终层重新融合。仅需约 3% 可训练参数,该方法在多个基准上维持了与全模型竞争的性能,而视觉计算量显著降低。这表明深层的视觉表征漂移并不必要,一个轻量侧分支就能为深层文本处理提炼出恰当的视觉信号。这种不对称路由为参数高效微调与动态计算在 MLLM 中的结合提供了新范式,直接挑战了当前所有 token 平等穿越所有层的设计惯性。

方法

方法概述

DPVR-LF 基于观察到的 视觉饱和现象:在 LLaVA-1.5 中层 4 之后,文本到图像的注意力从 0.68 骤降至 0.07,深层中稳定在 0.04 左右,表明视觉 token 无需经过全部 32 层深度处理。方法采用 非对称双路径路由,将视觉信息在浅层与主干分离,减少深层冗余计算。

输入与路由

  • 输入:视觉 token v 与文本 token t 拼接后的序列。
  • 路由点:选定一个 饱和层索引 s(如 18),前 s 层正常进行多模态自注意力;自 s+1 层起,视觉 token 被导向 可训练侧分支,主干 Transformer 仅处理文本 token(跳过视觉位置),形成 13 层纯文本前向

关键模块

  1. 侧分支(Side Branch):一个单层可训练 Transformer 层,对视觉 token 进行独立处理,学习适配深层文本表示。训练时仅此分支与融合层参数更新(约 3% 可训练参数),其余冻结。
  2. 晚层融合(Late-Layer Fusion):在最后一层前,将侧分支输出的视觉表示 v' 与主干输出的文本表示 t' 进行融合。实验表明,仅一层融合即可恢复多模态性能,且该层会自发形成 1.77 倍视觉注意力集中,强化关键视觉区域。
  3. 计算节省:深层自注意力中,视觉 token 不再参与计算,显著降低 KV 缓存与矩阵运算量,尤其在预填充阶段。

输出与训练

  • 输出:融合后的隐藏状态进入最终的线性头,生成文本。
  • 训练:采用图像-文本指令对,冻结原始 LLaVA 权重,仅优化侧分支与融合层。通过稀疏梯度路径(视觉 token 仅经侧分支回传)稳定训练。

差异点

与主流 Token 剪枝或早期融合方法不同,DPVR-LF 利用 模态异步性 进行静态路由,在极晚层(最终层)才重新融合视觉信号,证明单次晚期融合足以维持感知能力,而非强制视觉 token 穿越全部深层。

实验

实验设计

基于 LLaVA-1.5 架构,首先通过层级的文本-图像注意力分析量化 视觉饱和度 现象(注意力从层0的0.68降至层4的0.07,层18后稳定在0.04)。基于此提出 DPVR-LF:在视觉token饱和度点(例如层18)将其导入单层可训练旁路,后续13层文本仅前向计算,跳过图像位置,在最终层重新融合。在 7B 和 13B 规模上训练与评测,采用标准多模态基准,仅训练约 3% 参数(旁路与适配层)。消融实验覆盖融合层位置、视觉深度、文本长度敏感性及计算效率。

关键发现

  • 视觉饱和一致性:跨不同模型尺寸和输入图像,视觉token的信息增益在浅层后急剧衰减,深层对视觉信息几乎无进一步提取。
  • 性能保持:DPVR-LF 在主要基准上与原始对称模型性能接近,证明最后单层融合即可维持强感知能力。
  • 计算节省:减少了深层Transformer中视觉token的所有计算,显著降低FLOPs,尤其在长文本场景下收益更明显。
  • 融合层行为:最终融合层注意力集中在视觉token上的权重约为文本token的 1.77倍,表明模型学会从压缩的视觉表示中高效检索信息。

基线对比解读

与原始 LLaVA-1.5 全对称结构相比,DPVR-LF 在仅约3%可训参数下实现 竞争力持平,打破了"视觉token必须贯穿所有深度语言模型层"的惯例。相较于其他token削减方法(如剪枝、自适应丢弃),DPVR-LF 不需要修改预训练主干、无额外动态路由开销,且保持单一前向图的简洁性。在解码阶段,由于视觉token不参与深层的自回归生成,内存与计算进一步降低。局限性在于预填充阶段仍需浅层视觉计算,且当前方案仅针对LLaVA风格模型,通用性待验证。

行业影响

落地场景

DPVR-LF 主要面向需要高效多模态推理的产品与业务,如视觉问答 (VQA)图像描述多模态对话代理电商以图搜图内容审核以及文档理解。这些场景通常部署基于 LLaVA 等架构的大模型,且对延迟和吞吐量敏感。通过将视觉 token 在早期层分离并在末期层融合,DPVR 可显著降低深层 Transformer 的视觉计算开销,适合大规模在线服务和边缘设备适配。

商业价值

核心价值在于推理成本降低体验提升。视觉 token 在深层被跳过,使计算量减少约 13 层 (对应 LLaVA-1.5-7B),直接节省 GPU 算力与能耗,使服务相同请求所需的硬件资源减少,或相同资源下吞吐量提升。对于按 token 计费的 API 服务,可降低每次调用成本;对于实时应用 (如客服机器人),低延迟改善用户满意度。论文显示仅约 3% 可训练参数微调即可保持竞争性能,迁移成本极低,回报快。

与现有产品 / 工作流的接口

DPVR-LF 可作为参数高效插件集成到现有 LLaVA 风格的多模态 LLM 流水线中。无需改动预训练基座,只需添加一个可训练的侧分支与末端融合层,其余权重冻结或轻量 LoRA 微调。这使得现有模型能在不重建模型服务栈的前提下获得加速。推理框架 (如 vLLM, TGI) 可通过自定义 attention_maskposition_ids 跳过视觉 token 在深层的位置,与现有优化 (kernel fusion, KV cache) 兼容。对于定期更新模型的团队,DPVR 提供了一个低风险、高回报的架构改良方案,可快速验证并推广至生产环境。

具体场景示例

  • 电商图片搜索:用户上传商品图片,系统生成多角度描述并匹配商品库。DPVR 加速的多模态模型可在大量并发请求下保持低延迟,同时维持描述质量。
  • 智能客服截图理解:用户发送应用界面截图询问问题,模型需快速解析图片中的 UI 元素与文本。跳过深层视觉计算后,首 token 延迟降低,交互更流畅。

局限

  • - **解码阶段计算节省有限**:论文诚实指出 DPVR-LF 主要在预填充阶段减少视觉计算,而在自回归解码时,由于每步生成都需要重新计算注意力,视觉 token 的编码无法被完全跳过,因此实际吞吐量与全深度模型接近。这限制了该方法在需要流式响应或长序列生成的实时交互场景中的性价比优势,使得整体效率提升受序列长度和解码策略影响较大。
  • - **任务覆盖与架构泛化性不足**:评估集中在 LLaVA-1.5 框架下的图像问答和标准视觉基准上,未涉及视频、多图推理或跨模态检索等更复杂的任务。视觉饱和阈值可能高度依赖于特定视觉编码器(CLIP ViT)和投影层设计,当切换到其他连接器或模型规模时,需重新分析饱和点并调整路由策略,移植成本较高,削弱了方法的即插即用特性。
  • - **稀疏梯度路径可能引起训练不稳定**:侧分支和后期融合导致大部分 Transformer 层在训练时只接收文本梯度,视觉 token 仅在最终融合层接受全局监督。尽管梯度分析表明这种设计能间接传递视觉信号,但在多任务联合训练或使用较大学习率时,视觉分支的收敛速度可能滞后,需要更精细的超参数调优才能避免性能波动,增加了工程部署的调试负担。
论文Siyuan Liu2026-06-08原文

相关内容