论文

ViT-Up: 忠实特征上采样用于 Vision Transformers

ViT-Up: 忠实特征上采样用于 Vision Transformers

Vision Transformers (ViTs) 已成为视觉表示学习的主流架构,提供强大且可复用的骨干特征。然而,由于全局自注意力的二次复杂度,ViTs 通常在较小的patch-token网格上操作,这对语义分割、深度估计等密集预测任务造成了持续瓶颈,推动了任务无关特征上采样器的发展。现有最先进方法虽能生成视觉锐利的密集表示,但其依赖浅层图像编码器进行引导上采样,可能导致特征泄露、碎片化和模糊。 本文提出 ViT-Up,一种隐式特征上采样框架,从中间 ViT 隐藏状态构建逐层查询,替代外部图像引导。这使得模型能在任意连续图像坐标下预测特征,同时保持与骨干特征空间的对齐。实验表明,ViT-Up 在密集预测和语义对应任务上持续优于现有图像引导上采样器。在 DINOv3-S+ 上,ViT-Up 在 Cityscapes 上提升 +2.07 mIoU,在 SPair-71k 上提升 +4.17 PCK@0.10;在更大的 DINOv3-B 骨干上,增益增至 +3.36 mIoU 和 +8.09 PCK@0.10,表明 ViT-Up 随骨干容量扩展而性能提升。

论文精读

TL;DR ViT-Up 摒弃外部图像引导,直接从 ViT 中间层隐状态构建查询,实现任意连续坐标的特征上采样,在保持特征空间对齐的同时大幅提升密集预测精度,且随骨干容量增长表现出更强的扩展性。

问题

问题背景

Vision Transformers (ViTs) 已成为视觉表示学习的主流架构,但在密集预测任务(如语义分割、深度估计)中,由于全局自注意力的二次复杂度,ViTs 通常只能工作在较小的 patch 网格上,导致输出特征图分辨率不足,难以满足像素级任务需求。

现有方法的局限

近期工作通过任务无关的特征上采样器来恢复高分辨率特征,例如 FeatUp 等基于图像引导的上采样方法。它们借助浅层图像编码器(如卷积网络)提取的底层纹理信息来指导上采样过程。然而,这类方法存在三个主要问题:

  • 特征泄漏:外部图像编码器引入的信息可能与 ViT 自身特征空间不兼容,破坏预训练特征的语义一致性;
  • 碎片化:引导信号多来自浅层边缘或纹理,容易造成高分辨率特征图中出现不连续或碎片状伪影;
  • 模糊:为融合不同来源的特征,往往需要平滑操作,导致细节丢失。

为什么这个问题重要且困难

  • 根本矛盾:高分辨率带来平方级计算开销,而密集预测又依赖高分辨率特征,如何在低分辨率特征中恢复高频细节是一个核心挑战;
  • 应用范围广:语义分割、深度估计、对应匹配等任务都受益于高质量上采样特征,任务无关的上采样器可直接复用多种预训练 ViT 骨干,避免重复训练;
  • 保真度要求高:上采样必须忠实地保持原始特征空间的结构和语义,而非简单插值或注入无关信息,否则会损害下游任务性能。

行业类比

这种“从低分辨率信号中重建高分辨率连续表示”的思想,与图像超分辨率中的局部隐式函数(LIIF) 相似——在任意连续坐标上预测像素值,无需依赖外部引导,ViT-Up 将这一范式迁移至特征空间。

核心洞察

  • **ViT-Up 用中间隐藏状态替代外部图像编码器作为引导信号**,从根本上消除了“特征泄漏”与碎片化。现有图像引导上采样器(如 FeatUp、DINOv2 reg)靠浅层卷积网络提取的低级纹理来细化 ViT 特征,但这会污染语义空间。ViT-Up 改用 ViT 自身的多层隐藏状态构建逐层查询,通过隐式函数在连续坐标上预测特征,全程不引入主干之外的信号,从而在密集预测中保持特征的原生语义纯度。
  • **将隐式神经表示与 ViT 特征层级结合**,实现了分辨率无上限且几何精确的上采样。该方法为每个空间坐标生成一个查询嵌入,再由 ViT-Up Block 用跨注意力聚合中间层特征,最终输出该点的特征向量。这与固定网格的插值或转置卷积有根本不同:它学习一个连续映射,允许任意缩放,并在 SPair-71k 等语义对应基准上带来 +4~8 PCK 的提升,证明几何对齐能力远超离散上采样。
  • **上采样过程完全在主干特征空间内完成**,保障了下游任务与预训练表示的对齐。ViT-Up 的隐式函数输出与原始 ViT token 同维度的特征,无需附加投影头或空间变换来匹配下游解码器。这种设计让上采样后的特征可以直接用作分割头或深度头的输入,实验显示在 DINOv3-S+ 上 Cityscapes mIoU 提升 2.07,且随骨干容量增加增益更大(B 型号 +3.36 mIoU),表明该方案与预训练目标高度兼容且扩展性强。

方法

ViT-Up 的设计遵循“输入 → 查询构建 → 逐层细化 → 连续坐标输出”的流程,完全摒弃了传统图像引导上采样器所需的外部浅层编码器。

输入与查询构建

给定一个 ViT 主干(如 DINOv3)的某一层或多层中间隐藏状态,Query Embedding 模块将目标上采样网格的连续坐标(如 (x, y) 归一化到 [-1, 1])映射为高维查询向量。这些查询向量不再依赖原始 RGB 图像信息,而是直接嵌入到与主干特征相同的语义空间中。

ViT-Up Block 与特征混合

每个 ViT-Up Block 由交叉注意力层和前馈网络组成。查询向量通过交叉注意力访问主干隐藏状态中的 token 信息,逐步融合不同层级的语义。模块采用 FeatX(Feature Cross-Attention)设计,允许查询同时关注多个主干层的输出,从而自适应地汇聚多尺度信息,避免单层信息的局限性。

主干适应与多尺度监督

为了增强主干特征与上采样目标的兼容性,Backbone Adaptation 在原始 ViT 中插入少量可学习参数(如适配器),在保留预训练权重的同时小幅调整特征分布。训练时,采用 Multi-scale Feature Supervision:将上采样后的特征与教师信号(如更高分辨率主干特征或人工标注特征)在不同尺度下计算 L1 损失,并以特征cosine相似度作为辅助保持语义一致性。

输出

最终,每个查询向量输出对应坐标的特征向量,拼接后得到任意分辨率的密集特征图,可直接用于语义分割、深度估计或语义对应等下游任务。

与同类方法的差异:ViT-Up 抛弃了图像引导分支,通过内部隐藏状态构建查询,从根本上避免了因 RGB 纹理泄漏导致的特征模糊与碎片化问题,同时保证上采样特征与主干特征空间严格对齐。

实验

实验设计

实验在密集预测语义对应两大任务上验证 ViT-Up 的上采样质量,选用 DINOv3 作为主干网络,并对比 S+ 和 B 两种规模。密集预测使用 Cityscapes 语义分割(线性探测评估),语义对应使用 SPair-71k 关键点匹配(PCK@0.10 指标)。基线涵盖以 FeatUp 为代表的图像引导上采样器。训练阶段引入多尺度特征监督,并额外进行密集线性探测、特征保持分析及消融实验,系统检验查询构建层数、细化层数与输出分辨率的影响。

关键发现

  • ViT-Up 在所有设置下均超越先前最优方法。
  • DINOv3-S+ 上,Cityscapes mIoU 提升 +2.07,SPair-71k PCK@0.10 提升 +4.17;换用更大容量的 DINOv3-B,增益扩大至 +3.36 mIoU 和 +8.09 PCK@0.10,显示出良好的主干网络扩展性。
  • 消融表明,从多层隐藏状态构建查询和引入额外的细化层对性能至关重要,而进一步提高输出特征分辨率收益有限。

与基线对比的深度解读

现有引导上采样方法虽然能产出视觉锐化的密集特征,但其依赖的浅层图像编码器容易引入特征泄露碎片化问题,且与主干特征空间的对齐不足。ViT-Up 完全摒弃外部图像引导,改为从 ViT 中间隐藏状态逐层构建查询,实现对连续坐标上的特征隐式预测,从而严格保持与主干特征空间的一致性。这种设计在保留语义结构的同时避免了泄露,尤其在大位移对应和精细结构场景下优势显著。主干网络容量越大,这种自对齐机制的优势越明显,因此 ViT-Up 在 DINOv3-B 上的领先幅度远大于 S+ 版本。

行业影响

落地场景

ViT-Up 可直接用于需要高分辨率密集预测的视觉任务,覆盖自动驾驶(城市场景语义分割、深度估计)、医学影像分析(CT/MRI 病灶分割)、遥感图像分析(土地覆盖分类、变化检测)、电商内容生产(商品自动抠图、虚拟试穿)以及AR/VR(深度感知与三维重建)等场景。其即插即用特性使任何基于 ViT 骨干的系统都能快速获得更精细的特征表示,而无需大幅改动架构。

商业价值

  • 降本:该方法避免了对高分辨率图像编码器的依赖,计算开销主要来自轻量的隐式查询,可降低推理算力需求,尤其在端侧部署时节省成本。
  • 增收:在分割质量、深度精度上的提升可直接转化为产品竞争力,例如更高精度的自动驾驶感知系统可减少人工接管,医学影像辅助诊断中的更少漏检可提升诊断价值。
  • 体验提升:更“忠实”于骨干特征的上采样减少了特征泄漏与模糊,使下游任务结果更可靠,提升终端用户对 AI 产品的信任度。

与现有工作流的集成

ViT-Up 是一个与骨干解耦的轻量模块,可直接替换现有基于图像引导的上采样器(如 FeatUp)或双线性插值。集成过程简单:只需将骨干 ViT 的隐藏状态作为输入,无需额外的浅层图像编码器,因此不会与现有训练管道或数据预处理冲突。它支持任意连续坐标查询,可灵活输出不同分辨率特征,适配不同任务头。

具体落地 Use Case

  • 电商商品分割:在基于 DINOv3 等骨干的商品识别系统中,用 ViT-Up 替换原有上采样模块,可将粗粒度 patch 网格提升到像素级精确掩膜,实现实时自动抠图,减少人工修图成本。
  • 自动驾驶语义分割:在实时感知系统中,ViT-Up 以较低计算开销提供高分辨率特征,改善小物体(如行人、交通标志)的分割边缘,同时保持对整体场景的理解一致性,提升路径规划的安全性。

局限

  • **信息瓶颈 (Information Bottleneck)**:ViT-Up 从 ViT 中间隐藏状态逐层构建查询,这些隐藏状态本身是为全局语义而优化的,可能缺乏恢复高分辨率密集特征所需的空间细节。当目标分辨率远高于原始 patch 网格时,隐式函数需要从有限的 token 表示中推断像素级变化,可能导致高频纹理丢失或模糊。原文也指出了这一瓶颈,表明模型在极度密集的预测任务中可能无法保持与输入图像一致的结构保真度。
  • **骨干耦合 (Backbone Coupling)**:ViT-Up 强烈依赖 ViT 架构的中间层特征,因此无法直接应用于 CNN 或混合骨干。即使在不同 ViT 变体之间迁移,也需要针对隐藏状态的维度和语义对齐进行调整。对于没有明确分层 token 表示的模型(如 Swin,其窗口注意力会改变特征图空间结构),适配成本较高,限制了该方法作为通用上采样器的普适性。
论文Krispin Wandel2026-06-12原文

相关内容