所有视觉标记都同等重要吗?面向视觉-语言检索的Object-Evidence Preserving Token Merging
多向量视觉-语言检索通过最大相似度晚交互保留细粒度视觉证据,但密集的图像侧标记导致存储和评分开销高昂。现有令牌压缩方法虽降低此成本,却可能移除或坍缩未来查询令牌所需选择的对象级和区域级证据。 我们提出 SaMer,一个目标感知的令牌合并框架,将图像侧后投影器令牌压缩为 K 个代表性质心,同时保留原始晚交互接口。SaMer 仅在训练时利用对象标注作为合并先验以抑制跨实例混合,推理时无需真实边界框或检测器,并在冻结视觉和语言骨干网络的前提下仅适配共享投影层。 当 K=64 时,SaMer 移除超过 93% 的图像侧令牌,将 ColPali 存储压缩 16.09 倍,同时在 Flickr30K 和 MSCOCO 上提升 R@1。性能提升源于目标感知合并保留了查询可选的物体证据,而剪枝或纯特征池化会移除或坍缩这些证据。SaMer 还优于其他压缩基线,并展现更强的短语级定位能力,表明高效的多向量检索不仅依赖于减少令牌数量,更在于保留未来查询令牌需选择的证据。
论文精读
TL;DR SaMer 通过对象感知合并压缩视觉 token 超 93%,保留可被查询选中的对象证据,在存储降低 16 倍的同时提升视觉语言检索精度。
问题
问题背景
多向量视觉语言检索(如 ColPali 等基于晚期交互的模型)通过保留细粒度视觉token并执行最大相似度匹配,显著提升了跨模态检索的精度。然而,图像侧生成的高密度token(通常每张图数百个)导致存储开销和评分配对成本急剧增加,成为大规模部署的主要瓶颈。
现有方法的局限
现有token压缩方案主要分为两类:基于剪枝的移除(如Score-based pruning)和基于池化的特征聚合(如平均池化、Token Merging)。它们都隐含假设所有视觉token对检索同等重要,或仅根据特征相似性进行合并,忽略了token归属的对象或区域边界。具体局限包括:
- 剪枝方法可能直接丢弃承载细粒度对象证据的关键token,导致查询词无法命中相关视觉线索。
- 特征池化则可能将来自不同对象的token强制融合,产生“混合表征”,破坏对象级别的可区分性,使得晚期交互中的query token无法选取到准确的对象证据。
- 这些方法在训练阶段通常没有对象级别的监督信号,因此无法显式学习保留对象完整性的压缩策略。
为什么这个问题既困难又重要
挑战在于:压缩必须在极低token预算下(如K=64)保持每个token仍然可被独立查询并携带清晰的对象信息。这要求压缩过程不仅考虑特征相似性,更要理解视觉内容的语义组成(如不同的物体、属性、关系)。从工程角度看,检索系统的延迟和存储成本与实际token数量直接挂钩,而检索精度又高度依赖细粒度证据的保存,两者存在本质矛盾。业界对高效、高精度多模态检索的需求日益增长,例如文档问答、产品搜索等场景,都希望在不牺牲精度的前提下降低索引规模。
行业类比
类似自动驾驶感知系统中的多传感器融合:压缩点云数据时若盲目降采样,可能会丢失远处小物体的关键点,导致感知失败;必须保留那些对下游任务(如检测、跟踪)具有高证据价值的点,这与视觉token压缩中保留对象证据的理念如出一辙。
核心洞察
- 在多向量晚期交互检索中,视觉令牌的证据可选择性远比其数量重要。SaMer 证明,即使将图像侧令牌压缩超过 93%,只要保留的对象级证据仍能被查询令牌通过 MaxSim 选择,检索性能不降反升。这与现有压缩方法单纯追求减少令牌数量却牺牲细粒度证据的做法形成鲜明对比,揭示了高效多向量检索的本质是保留“未来查询令牌需要选择”的证据,而非盲目保留更多令牌。
- 对象感知合并(object-aware merging)提供了一种简单而有效的令牌压缩先验,显著抑制了跨实例特征混淆。传统方法如剪枝或特征池化容易破坏对象边界、融合不同实例的信息,导致证据坍缩。SaMer 仅在训练时利用对象标注作为弱监督先验来指导合并簇的形成,推理时无需任何检测器或边界框,且只微调共享投影层。这种设计既保证了压缩后令牌仍对应可区分的对象区域,又避免了额外检测器带来的推理开销和跨域泛化问题,为实际部署中的高效检索提供了新思路。
方法
输入
给定图像,经过冻结的视觉 Backbone(如 ViT)得到一组视觉 Token,再通过一个共享的投影层(Projection Layer)映射为 Post-Projector Tokens,用于和文本 Query Token 进行 Late Interaction 匹配(MaxSim 操作)。原始 Token 数量过多,导致存储和计算开销大。
关键模块
1. 后投影 Token 合并(Post-Projector Token Merging)
将 Post-Projector Token 分组并合并为 K 个代表性 Centroid。分组基于 Token 间的相似度(如余弦距离),合并时对每组 Token 取平均,生成新的压缩 Token。
2. 对象感知合并先验(Object-aware Merge Prior)
- 仅在训练阶段引入目标标注(如实例分割或边界框),为每个 Token 分配所属对象 ID,构建合并约束:鼓励同对象 Token 合并,抑制跨对象混合。
- 实现方式:在合并时增加对象一致性正则项,或直接按对象分组再聚类,确保每个 Centroid 主要包含同一物体的视觉证据。
- 推理阶段完全不需要任何标注或检测器,依赖投影层学到的对象敏感特征,自动完成语义保留的合并。
3. 压缩感知的投影层适配(Compression-Aware Projection-Only Adaptation)
- 冻结视觉与语言 Backbone,仅微调共享投影层。
- 训练时直接以压缩后的 Centroid 执行 Late Interaction 检索任务(如对比损失或匹配损失),使投影层学习生成对合并友好的表示,补偿压缩带来的信息损失。
输出
得到 K 个 Centroid Token,直接替代原始 Post-Projector Token 参与 Late Interaction 检索。存储和评分成本随 Token 数线性降低,同时因保留了对象级可查询证据,检索精度和短语级定位能力均优于同类压缩方法。
与同类方法的差异
SaMer 通过对象感知合并在 Token 压缩中显式保留细粒度视觉证据,区别于基于重要性剪枝(可能直接丢弃关键信息)或纯特征池化(易造成语义混叠)的方案,从而在极低 Token 预算下仍维持甚至提升多向量检索性能。
实验
实验设计
实验基于 ColPali 多向量延迟交互框架,在 Flickr30K 和 MSCOCO 检索基准上评估压缩与检索性能。训练阶段利用目标标注作为合并先验,防止跨实例混合,但推理时无需任何边界框或检测器;仅微调共享投影层,视觉与语言骨干网络冻结。主要压缩超参数 K=64(保留 64 个质心 token),对比方法包括剪枝(pruning)、特征池化(feature‑only pooling)等压缩基线。此外,通过 phrase‑level grounding 实验检验压缩对细粒度证据保留的影响。
关键发现
- 精度不降反升:在 K=64 且移除 >93% 图像 token 的条件下,R@1 在 Flickr30K 和 MSCOCO 上均提升(原文未列具体数值,但强调超越未压缩 ColPali)。
- 存储与效率:存储开销缩减 16.09 倍,同时保持原始 late‑interaction 接口,推理时无需额外检测器。
- 证据保留:对象感知合并保留了查询可选的视觉证据,而剪枝或纯特征池化会破坏或混合 object‑ 和 region‑level 信息,导致 phrase‑level grounding 能力下降。
原文明确指出:“gains arise because object‑aware merging preserves query‑selectable object evidence that pruning or feature‑only pooling can remove or collapse.”
基线对比深度解读
传统压缩方法(剪枝、特征池化)仅追求降低 token 数量,容易丢弃未来查询可能需要的局部证据。SaMer 通过对象感知合并,将语义相似的 token 聚合为质心,既压缩了表征又保留了对象边界。这种策略在低压缩预算下尤为关键:剪枝可能直接丢弃关键区域,特征池化则模糊了实例边界,而 SaMer 的质心仍能保持可选择的证据单元。因此,它不仅在检索指标上超越所有压缩基线,还在 phrase‑level grounding 上展示出更强的细粒度定位能力。这说明高效多向量检索的核心不是单纯减少 token 数,而是保留查询所需的可选择性证据,为后续检索压缩研究提供了新的设计原则。
行业影响
落地场景
SaMer 主要解决多向量视觉−语言检索中大规模图像索引的存储与计算瓶颈。只要业务涉及使用 late interaction(如 ColPali / ColBERT 风格)进行高细粒度多模态搜索,均可受益。典型落地场景包括:
- 电商平台:以文搜图的商品检索,需要在千万级商品图中快速匹配细粒度查询(如“蓝色条纹短袖”)。压缩后索引体积缩小 16×,延迟降低,同时保留对象级证据,提升转化率。
- 企业文档智能搜索:处理合同、票据、扫描 PDF 等富含图表、签名的文档,使用多向量检索定位含特定数值或 Logo 的页面。SaMer 在压缩视觉 token 的同时保持可被查询 token 选中的细粒度信息,避免关键信息丢失。
商业价值
- 直接降本:图像侧 token 从 ~1024 压缩至 64(去除 >93%),ColPali 存储成本下降 16.09 倍。对云上部署的 SaaS 或搜索服务,大规模索引的存储和内存费用大幅减少,同时支持更高吞吐。
- 增收与体验提升:保持或提高 R@1 等指标,意味着检索更精准,用户能更快找到目标商品或文档,直接改善 CTR 和用户留存。在需要毫秒级响应的场景中,推理延迟降低可支撑实时交互。
与现有产品/工作流的接口
SaMer 仅需微调一个共享投影层,视觉和语言 backbone 冻结,对现有 pipeline 侵入极低:
- 索引阶段:在图像编码器后插入轻量的投影层和 SaMer 合并模块,输出固定 K 个 centroid token。这些 token 直接送入向量数据库(如 FAISS)存储,无需额外改造。
- 查询阶段:查询文本的 token 照常生成,使用标准 MaxSim 计算相似度,无需修改检索流程。
- 无需在线检测器:训练时可用外部对象标注作为先验,但推断时完全不依赖检测器或框,集成非常简单。
SaMer 可与已有的乘积量化、倒排索引等压缩技术叠加,进一步降低内存占用,适合构建新一代高效多模态搜索系统。
局限
- 训练阶段依赖物体标注先验:SaMer 在训练时需要利用物体标注(如边界框或分割掩码)构造合并先验,以抑制跨实例 token 混合。尽管推理时不再需要这些标注,但训练数据必须包含精确定位信息,限制了其在仅有弱监督图文对的大规模数据集上的直接应用。若无法获得物体标注,则必须依赖其他弱监督信号或跨数据集迁移,这可能影响合并策略的有效性。
- 压缩质心数量 K 的选择缺乏自适应性:论文固定 K=64 作为压缩目标,在不同数据集上均使用该数值。然而,最佳 K 可能依赖于图像复杂性、查询粒度与下游任务。对于包含大量小目标或高分辨率图像,固定 K 可能未能充分保留所有关键证据;而对于简单图像,K=64 又可能存在冗余。缺乏根据图像内容动态调整 K 的机制,可能限制了方法在更广泛场景下的鲁棒性。
- 评估范围较窄且效率指标不够全面:实验主要集中在 Flickr30K 和 MSCOCO 两个中等规模数据集,尚未在更大规模检索基准(如 MS MARCO、LAION)或跨域场景中验证。此外,效率分析仅报告了存储缩减和部分速度提升,缺乏对推理延迟、内存带宽占用以及端到端系统吞吐量的详细测量,而这些对实际部署至关重要。同时,投影层微调策略依赖冻结的主干网络,当基础视觉或语言模型更新时,需要重新适配,长期维护成本未被讨论。