RaysUp: 通过几何感知射线表示的超轻量通用特征上采样
预训练的视觉基础模型(VFMs)因强大的语义表示和泛化能力成为现代计算机视觉的核心,但其输出通常为低分辨率(patchified或pooled),限制了在细粒度像素级推理任务中的效果。现有特征上采样方法要么降低语义保真度,要么依赖VFMs特定的重训练和重型架构,影响效率和可扩展性。 为此,本文提出RaysUp,一个超轻量、任务无关且VFMs无关的特征上采样框架,能以任意分辨率重建高分辨率特征图。与传统2D插值或注意力方法不同,RaysUp将特征重建提升到几何感知的射线域。具体创新包括: 1. 空间解耦引导编码器(Spatially Decoupled Guidance Encoder) 实现方向感知的引导编码; 2. 任意分辨率交叉注意力(Any-Resolution Cross-Attention) 支持分辨率灵活的重建; 3. 射线位置编码(RayPE) 通过6D Plücker射线坐标注入隐式3D几何先验; 4. 几何感知邻域注意力(Geometry-Aware Neighborhood Attention) 保证内容自适应双边聚合的同时保持几何一致性。 在多种密集预测任务上的广泛实验表明,RaysUp 在仅使用AnyUp 16%参数量的情况下达到最优性能,推理速度提升约7倍。这些结果显著改善了精度-效率权衡,使RaysUp成为通用特征上采样的实用可扩展方案。代码已开源。
论文精读
TL;DR RaysUp 通过几何感知光线表示将特征上采样转化为 3D 光线域重建,利用 6D Plücker 坐标注入几何先验,仅用 AnyUp 16% 参数即实现 7 倍加速和 SOTA 性能。
问题
问题背景
预训练视觉基础模型(VFMs)因强大的语义表示和泛化能力成为现代计算机视觉核心,但其输出通常经过patchify 或池化,分辨率显著低于原始图像,难以直接用于需要像素级推理的稠密预测任务(如语义分割、深度估计)。
现有方法局限
现有特征上采样策略主要分两类,均存在明显短板:
- 基于插值的方法(如双线性、转置卷积)本质上是邻域滤波,无法恢复高频细节,严重破坏语义边界和几何一致性,导致分割边缘模糊、深度估计不准。
- 基于注意力或学习的方法(如 FeatUp、AnyUp)虽能保留更多语义,但普遍依赖模型特定重训练、采用重量的交叉注意力或隐式重建模块,推理耗时大、参数量高,且大多要求固定上采样倍率,难以灵活适配任意分辨率的需求。 此外,这些方法通常任务感知(task-aware),在跨任务或跨 VFM 迁移时需额外适配,限制了通用性。
难点与重要性
特征上采样的核心挑战在于:从稀疏、语义浓缩的低分辨率特征重建出稠密、空间连续且保持语义与几何一致的高分辨率表示,同时不能依赖原始图像外的监督信号。
- 技术难点:低分辨率特征丢失了精细的空间结构和纹理信息,单纯依靠 2D 邻域聚合无法还原;若引入三维几何先验(如深度、相机姿态)则需保证通用性,避免与特定 VFM 训练范式耦合。
- 工业关注度:随着 SAM、DINOv2 等基础模型落地,密集下游任务对效率与精度平衡提出极高要求。一个超轻量、即插即用的上采样器能大幅降低部署成本,提升多任务系统的可维护性。
行业类比
类似在自动驾驶感知管线中,多尺度特征金字塔需要将骨干网络的低分辨率特征图上采样到高分辨率以融合多传感器数据,RaysUp 的几何感知射线域重建思路为这类分辨率灵活且语义无损的特征增强提供了一种通用且高效的解决方案。
核心洞察
- 将特征上采样从 2D 平面操作提升到几何感知的射线域重建,利用 6D Plücker 坐标作为位置编码注入隐式 3D 先验,使上采样后的特征在多视图变换和尺度变化下保持几何一致性。与 FeatUp、AnyUp 等仅依赖 2D 邻域注意力的方法不同,RaysUp 通过射线表示天然建模了像素与 3D 场景的对应关系,从而避免了 2D 插值或注意力扩边时常见的语义漂移和细节模糊,在不增加参数的前提下显著提升了密集预测任务的精度。
- 通过空间解耦的引导编码器将高分辨率引导特征压缩为方向感知的紧凑表示,配合任意分辨率交叉注意力,使上采样头不受固定特征图尺寸的限制。与以往方法需要针对特定分辨率和 VFM 结构进行重训练或设计重型上采样模块不同,RaysUp 的解耦设计实现了真正的分辨率可伸缩性——只需一次训练即可对任意输入分辨率进行上采样,参数规模仅为同类方法(如 AnyUp)的 16%,推理速度快约 7 倍,为低计算预算场景提供了轻量级通用上采样方案。
方法
RaysUp 通过 几何感知的射线域重建 实现超轻量通用特征上采样,整体流程分为四步:
1. 输入与几何先验准备
输入包括 VFM 的低分辨率特征图 F_lr(如 ViT patch token)和可选的高分辨率引导图像 I_guide。为注入 隐式 3D 几何先验,利用相机位姿为每个像素计算 6D Plücker 射线坐标,将 2D 像素提升为 3D 空间中的射线。
2. 空间解耦引导编码器 (Spatially Decoupled Guidance Encoder)
将引导信息沿水平和垂直两个方向独立编码,生成方向感知的引导特征,有效降低参数量,并为后续交叉注意力提供结构化先验。该设计是超轻量化的关键之一。
3. 任意分辨率交叉注意力 (Any-Resolution Cross-Attention)
以目标高分辨率网格生成可学习查询 Q,与低分辨率特征及引导特征的键值对进行交叉注意力。查询生成与分辨率解耦,支持 任意输出分辨率,无需重新训练或改变模型结构。
4. 射线位置编码 (Ray Positional Encoding, RayPE) 与邻域注意力
将 Plücker 坐标编码为位置嵌入,注入查询和键中,使模型感知每个像素的射线方向与原点,强制几何一致性。随后,Geometry-Aware Neighborhood Attention 在初始重建特征上施加内容自适应且几何约束的双边聚合,兼顾语义保真与几何平滑。
输出与训练
最终输出高分辨率特征图 F_hr,可直接用于各类密集预测任务。训练目标通常结合特征重建损失(如 L1 损失对齐教师高分辨率特征)与下游任务损失。
与同类方法的差异:RaysUp 不同于需要 VFM 再训练的 FeatUp 或依赖较重注意力架构的 AnyUp,它通过 射线域建模 与 几何先验注入,在仅 16% AnyUp 参数量下实现 7 倍推理加速,真正做到了任务无关、VFM 无关的超轻量通用上采样。
实验
实验设计与评估维度
RaysUp 在语义分割、深度估计、表面法向估计、视频目标分割与开放词汇分割等多类密集预测任务上验证,覆盖多种预训练 VFM(如 DINOv2 / CLIP / MAE)与任意输出分辨率。训练以教师网络高分辨率特征为监督信号(MSE 损失),基线包含 FeatUp、LoftUp、JAFAR 及 AnyUp 等主流特征上采样方法,重点评估精度、参数效率与推理速度。
关键发现
- 精度-效率双领先:RaysUp 在所有任务上达到 SOTA 或极具竞争力的性能,而参数量仅为 AnyUp 的 16%,推理速度约 7 倍提升。
- 几何感知光线域上采样有效:通过 RayPE (6D Plücker 坐标) 注入隐式 3D 先验、空间解耦指导编码 与 几何感知邻域注意力,以极低成本保留了语义保真度与几何一致性。
- 任意分辨率灵活重建:任意分辨率交叉注意力 机制使模型可适应不同下游需求,无需针对每个分辨率重训。
- VFM 无关 & 任务无关:不对特定 VFM 微调,无需访问其内部权重,通用性远超需要 VFM 协同重训的方案。
与基线的深度对比
与 AnyUp 相比,RaysUp 用 84% 参数削减 和 7x 加速 取得了同等或更优的精度,根源在于 AnyUp 依赖高计算量的全局注意力,而 RaysUp 将重建提升到光线域,利用几何先验大幅压缩了搜索空间。 相比 FeatUp 等需针对 VFM 重训或特殊设计的方案,RaysUp 的 完全解耦设计 使其可直接插入任何 VFM 后,部署成本极低。 这一精度-效率-通用性的三重突破,使高分辨率特征上采样首次成为大规模生产环境可行的组件,为稠密预测任务的轻量化感知提供了新的技术范式。
行业影响
落地场景
RaysUp 作为超轻量通用特征上采样框架,可直接嵌入任何依赖预训练视觉基础模型(VFM) 的密集预测任务,如语义分割、深度估计、表面法线估计、开放词汇分割、视频对象分割等。对于需要像素级高分辨率输出的产品,例如自动驾驶感知系统(实时生成车道线、可行驶区域)、医疗影像分析(病灶边界精细分割)、电商商品图片编辑(自动精确抠图与背景替换),RaysUp 能显著提升特征图分辨率而不拖慢推理速度。此外,在内容平台的自动化视频理解与编辑、增强现实(AR) 的3D场景重建中,其分辨率任意调节能力使得模型可灵活适配不同设备与输入尺寸。
商业价值
RaysUp 的核心优势在于极致的参数效率(仅 AnyUp 的16%参数)与约7倍推理加速。这意味着:
- 降本: 在云端或边缘端部署时,更低的显存占用与计算开销直接减少硬件成本;对于按调用量计费的API服务,更快的推理可以显著降低单次调用成本。
- 增收: 性能提升(在多个基准上达到SOTA)可增强产品竞争力,支撑更高定价或扩大市场份额;更快推理能支撑更高吞吐,满足大流量场景需求。
- 体验提升: 高分辨率输出带来更精准的细节,提升自动驾驶安全性、医疗诊断可靠性、创意工具的用户粘性。
与现有产品/工作流的接口
RaysUp 是任务无关、模型无关的即插即用模块,集成路径简单:
- 作为轻量级上采样头,可接在任意VFM(如 DINOv2、CLIP、MAE)的后端,无需重新训练基础模型。
- 输入为多尺度低分辨率特征图,输出为目标分辨率的密集特征,与下游任务头(如分割解码器)无缝衔接。
- 工程上,RaysUp 可用PyTorch实现,依赖标准算子,可与现有训练/推理框架(如MMSegmentation、Detectron2)直接整合。
- 由于支持任意分辨率,无需修改原有数据预处理流水线,可动态适应不同输入尺寸。
具体落地用例
- 电商商品图片自动编辑: 平台需一键更换商品背景或生成不同颜色款式。利用RaysUp 对VFM特征上采样,可获得精确到发丝级别的商品边缘信息,驱动分割模型输出高质量mask,实现零人工介入的批量处理。相比现有方案,7倍速度提升支持实时交互预览,降低用户等待时间。
- 自动驾驶多任务感知: 车载计算平台资源受限,同时运行目标检测、语义分割、深度估计等多个任务。RaysUp 作为各任务共享的上采样器,以极小算力将共享VFM特征提升至高分辨率,保证感知精度同时降低整体延迟,满足车规级实时性要求。
局限
- **依赖相机位姿信息**:RayPE 基于 6D Plücker 射线坐标注入几何先验,要求每张图像提供准确的相机内参与外参。对于无标定网络图片或多源异构数据,需额外引入姿态估计模块,不仅增加流水线复杂度,姿态误差还可能导致上采样特征退化,限制了在非可控采集条件下的直接部署。
- **评估覆盖域不够广泛**:尽管声称 VFM 无关与任务无关,但实验集中于 DINOv2 等常见 VFM 及语义分割、深度估计等经典密集预测任务,缺乏在医疗影像、遥感图像等特殊领域上的验证。同时与 AnyUp / FeatUp 等基线对比时,虽然参数效率和推理速度快,但在绝对精度上的相对提升幅度可能有限,轻量化设计是否在所有场景均保持足够的细粒度表达尚存疑。
- **超轻量设计的表达能力边界**:参数仅为 AnyUp 的 16%,虽然大幅提升效率,但模型容量受限可能导致对复杂纹理、高频细节的恢复不充分,尤其在需要极端高分辨率重建的任务(如 4K 以上图像修复或细节敏感的医疗分割)中,性能可能不及更重量的上采样器,需要在计算与精度之间谨慎权衡。