CoVeR: 面向 VLM 中多视角 3D 推理的基于覆盖度的 token 剪枝
将 3D 场景表示为多视角图像,能让 2D VLM 复用预训练先验完成 3D 推理,绕开标注 3D 数据的稀缺问题;但这会产生数千个冗余视觉 token,其开销随视角数量增长。 现有视觉 token 剪枝器分两类,在 3D 多视角设定下均有局限: - 学习重要性 方法按注意力或编码器特征排序 token;由于此处冗余本质上是空间性的,它们会保留来自少数显著区域的近重复 token,使场景大部分区域未被表示。 - 体素化 方法改善了空间覆盖,却无法强制精确的 token 预算,并随多视角观测在 3D 中重叠而饱和,保留率远低于目标。 我们发现空间覆盖度与 3D 推理性能相关,并提出 CoVeR:一个确定性、免训练的选择器,仅使用 token 坐标,不依赖学习信号。它选出能共同覆盖场景每个区域的 token,兼顾两者之长:强制精确的每场景预算、突破体素化饱和平台、避免近重复选择。 实验表明,CoVeR 在三个 3D 推理基准上均超越先前 SOTA,并作为即插即用模块在四个 VLM 上验证了泛化性。仅用约 8% 的视觉 token,它即保留全 token 性能的 93.5%,平均超越 SOTA 3.9 个百分点。
论文精读
TL;DR CoVeR 是一个基于空间覆盖的训练无关视觉 token 剪枝器,仅用 token 坐标对多视图 3D 场景做精确预算覆盖,以约 8% token 保留 93.5% 全量性能,平均超 SOTA 3.9 个百分点。
问题
问题背景
当前多视图 3D 推理希望通过 2D VLMs 复用预训练视觉与语言先验,以绕开 3D 标注稀缺问题;用多张视图表示 3D 场景已成为通用做法。但这种表示会生成数千甚至更多冗余视觉 token,成本随视图数量线性增加。
现有方法局限
主流 token 剪枝方法分为两类:
- Learned importance 方法利用 attention 或编码器特征对 token 排序,但 3D 多视图下的冗余本质是空间性的,这类方法倾向保留少数显著区域的近重复 token,导致大部分场景未被表示。
- Voxelization 方法通过体素覆盖改善空间分布,但无法强制精确的每场景预算,并且当多视图观察在 3D 空间重叠时,保留率会饱和,远低于目标预算。
为什么这个问题难 / 重要
作者通过实验表明 空间覆盖率 与 3D 推理性能相关,因此 token 选择必须同时满足三个条件:
- 精确的 token 预算控制;
- 对整个场景区域的完整覆盖;
- 不依赖任何可学习信号,具备确定性、训练无关和跨模型即插即用能力。
这在工程上较难:既要保持多视图的几何信息,又要去掉冗余,传统方法通常顾此失彼。业界对高效 3D 多模态推理、VLM 部署成本及实时性有持续关注,这类模块化 token 剪枝策略直接影响推理延迟与显存占用。
行业类比
类似自动驾驶或机器人视觉中,多路相机视频流需要实时筛选关键帧与关键区域,在有限算力预算下同时保证空间覆盖和场景理解,而不是仅关注显著物体。
核心洞察
- 空间覆盖而非注意力重要性是多视图 3D 推理中 token 剪枝的关键信号。CoVeR 证明仅凭 token 的 3D 坐标做覆盖选择,就能在三个基准上超过 SOTA,因为多视图视觉冗余本质是空间重复,learned importance 会保留近重复 token 而遗漏大部分场景,覆盖优先策略则保证每个区域都有代表 token。
- CoVeR 用确定性、训练无关的覆盖选择器同时突破 learned importance 和 voxelization 两大基线限制。Voxelization 无法执行精确 token 预算且随多视图重叠饱和,learned importance 造成近重复选择。CoVeR 通过覆盖初始化与扩张实现精确 per-scene budget,打破饱和平台,并在四个 VLM 上以约 8% 视觉 token 保留 93.5% 全 token 性能,平均超越 SOTA 3.9 个百分点。
- 实证显示空间覆盖率与 3D 推理性能正相关,将剪枝目标从“重要性排序”转为“覆盖率最大化”。这种几何先验零训练成本,不需要梯度或标注数据,可直接作为多视图 VLM 的即插即用预处理模块,为工程落地提供了新的默认剪枝范式。
方法
输入与预处理
CoVeR 接收多视图图像的视觉 token 及其对应的 3D 坐标(通过视图投影或深度估计获得)。与依赖注意力或编码器特征的现有方法不同,CoVeR 仅利用 token 的空间位置信息,无需任何训练或可学习参数。
关键模块:覆盖率驱动的选择
- 覆盖初始化:将 3D 场景空间划分为规则网格(体素),从每个非空体素中选取一个代表 token 作为初始选择种子,保证场景各区域至少有一个 token 被保留。
- 覆盖扩展:在满足精确每场景 token 预算的前提下,迭代地从剩余 token 中选取能最大增加空间覆盖范围的候选(例如覆盖新体素或增强稀疏区域密度),直到达到指定预算。
- 覆盖目标:整体选择过程本质是最大化 token 集合对场景 3D 空间的覆盖率,同时约束所选 token 之间的空间冗余最小化。该过程是确定性的贪心算法,不涉及注意力或特征排序。
输出
CoVeR 输出一个固定大小的 token 子集,可直接替换原始多视图 token 序列,送入后续 2D VLM 完成 3D 推理任务。由于方法无训练、确定性强,可作为即插即用模块在不同 VLM 骨干间泛化。
与同类方法的差异
与学习重要性方法相比,CoVeR 避免了因注意力集中导致的近重复 token 保留,确保场景整体被均匀代表;与体素化方法相比,CoVeR 能强制精确预算,并突破多视图 3D 重叠导致的保留率饱和上限。
实验
实验设计
- 在三个 3D 推理基准上验证 CoVeR,对比两类主流 token 剪枝方法:learned importance 与 voxelization。
- 以四个 2D VLM 作为 backbone,测试 CoVeR 作为即插即用模块的泛化性。
- CoVeR 仅依赖 token 坐标,执行确定性、training-free 的每场景精确 token 预算。
关键发现
- CoVeR 在三个基准上全部超越 SOTA,平均性能提升 3.9 个百分点。
- 在仅保留约 8% 视觉 token 的条件下,CoVeR 达到全 token 性能的 93.5%。
- 空间覆盖与 3D 推理性能强相关,CoVeR 打破 voxelization 的饱和平台,避免 learned importance 的近重复 token 选择。
对比解读
- learned importance 方法因空间冗余导致大量近重复 token 来自少数显著区域,场景覆盖不足。
- voxelization 虽改善覆盖但无法精确控制 token 数,且在多视图重叠下饱和,保留率远低于目标。
- CoVeR 通过确定性覆盖选择,同时满足精确预算与全场景覆盖,在多视图 3D 推理中更具优势,且跨模型泛化性强。
行业影响
落地场景
CoVeR 面向多视图 3D 推理的视觉 token 剪枝,可直接应用于需要 2D VLM 理解 3D 场景的业务:
- 电商 3D 商品展示:处理商品多角度图像,支持自然语言查询(如“这个沙发的靠背高度”),无需昂贵 3D 标注。
- AR / VR 空间理解:在头戴设备上实时分析多摄像头输入,识别物体、布局、遮挡关系,支撑虚拟摆放、导航辅助。
- 自动驾驶仿真与数据挖掘:从多视角环视图像中快速提取场景语义,减少云端 VLM 推理成本。
- 数字孪生与企业服务:对工业设备、建筑空间的多视图扫描进行问答式巡检。
商业价值
核心收益来自降本增效:
- 降低推理成本:CoVeR 仅保留约 8% 视觉 token,可减少约 92% 的视觉编码与注意力计算量,直接降低 GPU 时延与费用。
- 保持性能:在三个 3D 推理基准上平均保留 93.5% 的 full-token 性能,相比 SOTA 平均提升 3.9 个百分点。
- 无训练、即插即用:无需额外数据或微调,缩短部署周期,避免模型训练与维护成本。
与现有产品 / 工作流的接口
CoVeR 是一个确定性、无训练的 token 选择器,只需输入 token 的 3D 坐标和预定义预算,输出保留 token 的索引。集成方式很简单:
- 在 VLM 的视觉编码器之后、LLM 之前插入 CoVeR 模块。
- 从多视图图像中提取 token 坐标(可由相机位姿与投影矩阵计算)。
- 设置每场景预算(如
budget=512),CoVeR 返回均匀覆盖场景的 token 子集。
该模块不依赖特定模型,已在四个 VLM 上验证,可作为标准预处理组件嵌入现有推理 API 或端侧推理引擎。项目主页:CoVeR,代码:GitHub。
局限
- 仅使用 token 坐标进行覆盖选择,忽略视觉内容的语义重要性。在多视角 3D 推理中,某些关键区域(如小物体、文本标识或需要细粒度识别的部位)可能因几何均匀化而被漏选;相比之下,learned importance 方法能依据注意力或编码器特征保留这些 token。论文未在极端低预算(如 <5%)场景下评估语义缺失对性能的影响,也未与语义感知的剪枝方法进行直接对比,限制了其在需要强语义先验的任务中的适用性。
- 方法依赖准确的 token 3D 坐标,需要从 VLM 中间表示中提取或估计,这可能引入额外计算开销和坐标误差。且 CoVeR 假设场景为静态且多视角覆盖充分;对于动态场景、视角稀疏或遮挡严重的情况,基于空间覆盖的策略可能失效,因为 token 坐标无法反映时序变化或被遮挡区域的重要性。此外,方法未利用 token 之间的特征相关性,只是几何均匀化,可能破坏 VLM 内部依赖的空间语义结构。
- 与同类工作相比,CoVeR 完全忽略模型内部信号,在模型具有明确注意力偏向的任务中可能不如自适应方法;它虽然解决了 voxelization 的饱和和预算不可控问题,但引入了覆盖半径、扩张步长等超参数,且这些参数可能需要针对不同 VLM 和任务进行调节,缺乏即插即用的完全自适应性。此外,其性能增益主要来自保留更多样化的 token,而非减少实际计算量,因为 token 选择本身需要额外的坐标计算和覆盖算法执行。