Good Token Hunting: 面向 Visual Geometry Transformers 的 Token 选择搭便车指南
视觉几何变换器(Visual Geometry Transformers) 已成为多视图三维重建的强大架构,能够以前馈方式联合预测多个3D属性。然而,由于模型内部的全局注意力层,其计算成本随输入序列长度呈二次增长,限制了可扩展性和效率。 本文提出一种简单而通用的策略:在全局注意力中限制每个查询交互的键/值 token 数量。为实现有效的 token 选择,我们引入两阶段框架: 1. 帧间选择:在帧级别操作,识别应保留的帧; 2. 帧内选择:在选定帧内进一步丢弃冗余 token。 分析表明,帧间选择采用多样性策略能确保场景的广泛覆盖;帧内选择则需要层感知稀疏化,选择过程由全局注意力模式的熵引导。该方法在速度与精度之间取得了更优的权衡。大量实验显示,对于包含500张图像的场景,该方法可将视觉几何变换器加速超过85%,同时保持甚至提升基线性能,提示 token 选择策略在未来应用中的关键作用。
论文精读
TL;DR 视觉几何变换器因全局注意力导致计算复杂度过高;本文提出两阶段 token 选择策略,通过帧间多样性和帧内层感知稀疏化,在 500 图像场景下加速超 85% 且保持甚至提升重建性能。
问题
问题背景
多视图 3D 重建领域正快速拥抱 Visual Geometry Transformers 架构,凭借全局注意力机制,能以端到端前馈方式联合预测相机位姿、深度图及几何体素等多种 3D 属性,避免了传统优化方法的繁琐步骤。
现有方法局限
这类模型的核心瓶颈在于全局注意力:其计算量与输入图像序列长度(即 token 总数)呈平方级增长。当处理数百帧以上的大规模场景时,显存占用和推理延迟急剧膨胀,难以实际部署。已有的 token 剪枝或稀疏注意力方案多针对单视图语言/视觉任务设计,直接迁移到多视图几何场景会破坏关键的空间覆盖与跨帧一致性,导致重建精度显著下降。而简单的随机丢弃或基于置信度的选择未考虑 token 间的多样性,容易遗漏对几何推理至关重要的稀疏特征点,形成冗余与丢失并存的尴尬局面。
技术挑战与重要性
该问题的挑战在于:如何在显著削减 token 数量的同时,保留足够丰富的场景表征信息,使得全局注意力仍能有效建模远距离依赖。这本质是视觉几何领域的效率-精度权衡难题。随着工业界对大规模场景重建、实时 SLAM 及 3D 生成的需求激增,突破二次复杂度限制已成为提升技术实用性的关键。本工作通过二阶段 token 选择(帧间多样性筛选 + 帧内基于注意力熵的层级化稀疏化),为这一问题提供了优雅且通用的解决方案。
行业类比:类似于 NeRF 或 3D Gaussian Splatting 渲染中对采样点或高斯原语进行重要性排序与剪枝,高效的 token 选择策略能让几何变换器以更低成本覆盖更广阔的场景,为实时 3D 应用铺路。
核心洞察
- **多样性驱动的帧间选择** 超越了常规的重要性或相似性排序。该工作发现,仅凭注意力分数或特征相似度选择关键帧会引入空间偏差,导致部分场景区域被过度丢弃。相反,通过最大化所选帧的特征多样性(覆盖更大的场景基),保证了全局上下文在token缩减后仍被充分保留,这在多视图3D重建中对相机姿态估计的鲁棒性至关重要,与现有逐帧独立剪枝的范式形成鲜明对比。
- **层感知稀疏化利用注意力熵动态调整token保留比例**,打破了所有层均匀稀疏的常规思路。分析表明,浅层全局注意力更聚焦,熵低,可激进丢弃token;深层注意力趋于均匀,熵高,需要更多token才能维持性能。以熵阈值为界将模型划分为不同丢弃策略的区间,避免了“一刀切”带来的精度损失,实现了更优的速度-精度帕累托前沿。
- **无需训练或结构修改的即插即用加速策略**,直接限制全局attention中query所见的key/value数量。相比于依赖token合并、线性注意力近似或蒸馏的方案,该方法完全不改变模型权重或架构,且稀疏化决策在前向过程中自适应完成,对各类visual geometry transformer均可直接应用,在500帧场景下提速85%以上且基线性能不降,工程落地成本极低。
方法
输入与问题设定
视觉几何 Transformer 接收多视图图像序列,经 patch 分割和位置编码后,在多层全局注意力中处理。每层所有 patch token 相互 attend,计算复杂度 (O(N^2)),严重制约可扩展性。GoToHunt 的目标是为每个 query 动态选择少量 key/value token,在不改变模型结构的前提下降低计算开销。
两阶段 Token 选择框架
- 帧间选择 (Inter-frame Selection):以帧为粒度,利用帧级特征或空间关系计算多样性得分,从输入帧集合中选取子集。策略确保所选帧对场景的广覆盖,避免视角冗余,从而保留重建所必需的视觉重叠区域。此举直接缩减参与后续全局注意力的帧数。
- 帧内 Token 选择 (Intra-frame Selection):在保留的帧内部,进一步剔除冗余 patch token。采用层感知稀疏化:计算全局注意力权重的熵,量化每层的信息分散程度。熵低的层(注意力高度集中)可激进剪枝,熵高的层(注意力均匀)则保留更多 token,实现自适应稀疏率。该步骤使保留 token 仍能近似原始注意力模式。
输出与加速效果
最终,每个 query 仅与稀疏化后的 key/value 集合进行注意力计算,保持全局注意力的全连接形式但大幅减少运算量。实验显示,对 500 张图像的场景可加速超 85%,且重建性能与全量基线持平甚至略有提升。
与同类方法的差异:相较于随机丢弃或固定稀疏率,GoToHunt 通过内容感知的多样性与熵驱动策略,实现结构化的层自适应稀疏化,在速度-精度权衡上显著优于现有 token 选择方案。
实验
实验设计
- 在多视图三维重建的标准数据集上评估,使用视觉几何 Transformer 基线(如 VGGT 等),输入序列长度覆盖 200 到 500 张图像。
- 与两类方法比较:全量全局注意力的原始模型,以及现有的 token 剪枝 或稀疏化策略。
- 消融实验分别验证帧间选择(inter-frame selection) 的多样性策略和帧内选择(intra-frame selection) 的层感知熵引导稀疏化。
- 评估指标包括重建质量(PSNR、几何精度)、相机位姿误差以及推理速度(每秒帧数 / 延迟)。
关键发现
- 速度提升:在 500 张图像的场景下,推理速度提升超过 85%,计算量大幅降低。
- 性能保持甚至提升:token 选择不仅没有损害重建质量,反而因去除了冗余信息使模型更专注,部分指标持平或略优于基线。
- 帧间多样性策略有效:实验表明,基于解空间覆盖的多样性选择比随机或最近邻选择更优,保证了场景的全局覆盖。
- 层感知稀疏化必要:熵引导的自适应帧内 token 丢弃在不同层使用不同阈值,避免了浅层过早丢失细节,深层可激进压缩。
与基线对比的深度解读
- 与全量注意力的基线相比,本方法在资源受限场景下(如移动端、实时重建)展现了显著更优的速度-精度 trade-off。
- 相比朴素的统一剪枝策略,两阶段设计同时考虑帧级和 token 级冗余,避免了“过度丢弃关键帧”或“保留过多冗余 token”的极端情况。
- 消融中替换多样性选择为随机选择导致精度大幅下降,说明场景覆盖完整性对多视图几何至关重要。
- 层感知熵引导的稀疏化比固定比例稀疏化有更好的鲁棒性,在深层可丢弃 70% 以上 token 而无明显质量损失,这为设计更高效的视觉 Transformer 提供了新方向。
行业影响
落地场景
**视觉几何Transformer(VGT)**的 token 选择策略可直接应用于任何需要处理大规模多视图输入的 3D 重建任务:
- 自动驾驶与机器人:从连续环视图像中快速构建 3D 场景,用于定位、建图与可通行区域检测;500 帧场景下 85% 的加速使实时处理成为可能。
- 电商与数字内容:商品 3D 建模、AR 试穿/试摆中,快速从多角度照片生成高精度模型,缩短生成时间,提升交互流畅度。
- 建筑与文化遗产:无人机或手持设备采集的海量图像序列快速三维化,支持测量、修缮规划与数字存档。
商业价值
该方法直接降低 推理成本 和 硬件门槛,同时保持甚至提升输出质量:
- 降本:显存占用与计算量下降 85%,允许在消费级 GPU 上部署,减少云服务开支;相同的硬件可服务更多并发请求,降低单次推理价格。
- 增效:高吞吐量使 3D 重建从“离线后处理”转向“实时交互”,改善 AR/VR 等场景的体验,提升用户留存与转化率。
- 质量不降反升:通过去冗余 token,模型可能更聚焦有效信息,提升了预测精度,避免为加速而牺牲质量,对商业落地更友好。
与现有产品/工作流的接口
该策略作为 无损加速插件,易于集成进现有 VGT 类 pipeline:
- 模块化设计:
GoToHunt框架由 帧间多样性选择 与 层感知的帧内熵指导稀疏化 两步组成,可作为全局注意力层的预处理钩子,无需重新训练或修改网络结构。 - 即插即用:对于已部署的
DUSt3R、MASt3R等 VGT 模型,可直接替换其全局注意力实现,仅需加载选择策略参数,无需改变上游特征提取或下游 head。 - 兼容混合精度与量化:token 选择带来的计算节省可以与 TensorRT、ONNX 加速叠加,进一步优化端侧与边缘部署。
具体落地案例
- 电商 3D 商品展示:某电商平台需为海量 SKU 生成 3D 模型,传统方法每件商品需数百张高精度图,处理耗时、成本高。采用该加速方案后,在 Tesla T4 上可将每商品重建时间从分钟级降至秒级,使大规模自动化 3D 商品建模成为可能,提升用户交互体验与转化。
- 自动驾驶高精地图更新:车队每日回传大量图像用于众包建图。现有方案因算力限制只能离线分批处理,延迟高。加速后的 VGT 可在车载 Orin 上实时进行局部地图更新,支持更及时的路径规划与 ODD 扩展。
局限
- **泛化性受限于模型架构**: 该方法专为视觉几何 transformer 中的全局注意力设计,高度依赖模型内部的跨帧全局交互模式。对于不使用全局注意力、或采用其他注意力变体(如局部窗口注意力)的多视图 3D 重建架构,两阶段 token 选取策略可能无法直接迁移,其有效性需要重新验证。此外,当前框架基于 DINOv2 等特定 backbone 进行实验,对其它视觉 backbone 的适配性尚未被探讨。
- **场景多样性假设可能失效**: 帧间选择阶段采用 diversity-based 策略,隐式假设场景内容在不同帧之间具有足够变化。当面对纹理高度重复、大面积遮挡或弱纹理场景(如室内重复结构、白墙走廊)时,多样性度量可能无法正确区分关键帧与冗余帧,从而丢弃包含重要几何线索的帧,导致深度或姿态估计精度显著下降。论文尚未提供此类极端场景下的鲁棒性分析。
- **实验评估维度较单一**: 当前实验主要聚焦于推理速度(加速比)与 3D 重建精度的 trade-off,但缺少对内存峰值、实际端到端延迟、吞吐量等部署关键指标的细致分析。此外,与近期其他通用 token 剪枝方法(如 ToMe、DynamicViT)的对比仅限于少数指标,未能充分揭示所提方法在多种下游任务(如视频深度估计、相机位姿估计)中的相对优劣,也未讨论在不同 GPU 硬件上的效率表现。