UniT: 统一几何学习与组自回归 Transformer
近期的前馈模型在从传感器观测推断密集3D结构方面取得了显著进展,但其核心能力仍分散于多个不兼容范式,包括在线感知、离线重建、多模态融合、长时程可扩展性和度量尺度估计。本文提出 UniT,一种基于新颖的组自回归 Transformer 的统一模型,将上述看似离散的能力整合至单一框架。核心思想是将传感器观测组视为基本自回归单元,并以无锚点和尺度自适应方式预测对应的点图。 具体而言,在线与离线场景中的多样化视角配置通过单一组自回归过程自然统一:在线模式通过改变组大小,在多步自回归中处理单帧组;离线模式则在单次前向传播中聚合多帧组。同时,队列式 KV 缓存机制确保长时程下的有界自回归内存,通过无锚点关联建模减少对早期帧的长距离依赖,从而动态丢弃过时记忆。为改进跨场景的度量尺度泛化,框架进一步引入尺度自适应几何损失,将相对几何约束与部分绝对尺度项结合,隐式正则化全局尺度,实现从尺度不变几何到度量尺度解的渐进过渡。结合专用模态注意力模块以整合辅助模态,UniT 在涵盖七项代表性任务的十个基准上取得统一几何感知的最优性能。
论文精读
TL;DR UniT 通过分组自回归 Transformer 将在线/离线几何感知统一为无锚点、尺度自适应的点云预测,结合队列缓存与模态注意力,实现长视距可伸缩性和度量级精度,在多项任务上达到 SOTA。
问题
问题背景
从多视角传感器观测中恢复密集 3D 结构(如深度图、点云)是几何感知的核心任务,在自动驾驶、机器人导航、增强现实等领域需求强烈。近年来,前馈神经网络在此方向取得显著进展,但大多数方案被设计为针对特定设置(如在线逐帧估计或离线批量重建)的孤立模型。
现有方法局限
传统方法往往将不同感知范式割裂开来:
- 在线方法 强调低延迟、逐帧推断,但难以利用多帧之间的几何约束,导致长期序列的尺度漂移和细节丢失。
- 离线方法 能获得全局一致的重建,却无法满足实时性要求,且通常假设已知相机位姿或固定帧数。
- 多模态融合 常通过手工设计的后处理步骤整合,缺乏端到端的统一学习框架。
- 长时序建模 面临自回归内存膨胀问题:随着帧数增加,显存占用线性或超线性增长,难以部署。
- 度量尺度估计 多依赖外部尺度信息或特定传感器,在跨场景泛化时脆弱。
这些范式互不兼容,使得构建一个能同时支持在线/离线、多模态、长时序且尺度准确的系统变得极为复杂,通常需要多个模型级联,增加了工程维护成本和延迟。
为什么这个问题难/重要
统一几何感知面临几个根本性挑战:
- 视图配置异质性:在线和离线设置中帧的到达方式完全不同(流式 vs. 批量),需要模型灵活适应不同的分组策略。
- 长程依赖与内存平衡:自回归模型必须记住历史信息,但无限增长的内存不可行,如何选择性遗忘是难点。
- 尺度模糊性:仅从图像恢复绝对尺度是 ill-posed 问题,模型必须学会在相对几何约束与绝对尺度之间取得平衡。
- 多模态对齐:不同模态(如深度、IMU)的特征空间差异大,有效融合需要精心设计的注意力机制。
统一模型一旦成功,可大幅简化几何感知系统的部署:一个模型即可覆盖从 AR 眼镜上的实时深度估计到自动驾驶中的离线高精地图构建等多种场景,降低算法冗余,提升可维护性。这类似于视觉大模型正在逐步取代多个专用视觉子任务网络,在几何感知领域,一统各范式的需求日益迫切。
行业类比
如同自回归语言模型通过统一的 next-token prediction 范式整合了翻译、问答、摘要等多样 NLP 任务,UniT 致力于用一个 Group Autoregressive Transformer 统一在线/离线、多尺度、多模态的几何感知,成为 3D 视觉领域的“通用底座”。
核心洞察
- 将几何感知的多种范式统一为**组自回归**框架,通过调整组大小,同一模型即可处理在线单帧流式预测与离线多帧联合重建。这打破了以往各任务独立设计模型、无法共享能力的技术碎片化,为工程部署提供了单一模型覆盖多场景的可行路径。
- **锚点无关的关系建模**与**队列式 KV 缓存**相配合,使得自回归过程中可以丢弃早期帧的冗余记忆,将长序列计算限制在恒定内存内。这与传统需保留完整历史状态的模型形成根本差异,对实际部署中的无限长视频流处理或大规模场景重建具有重要工程价值。
- **尺度自适应几何损失**将相对几何约束与部分绝对尺度项耦合,诱导模型从尺度不变几何逐步过渡到度量尺度预测。该设计避免了纯相对损失带来的尺度漂移,也无需全局绝对尺度标签,在跨场景泛化中更具鲁棒性,尤其适用于无标定环境下的度量重建。
方法
组自回归 Transformer 统一架构
UniT 的核心是将多视图几何感知统一为一个 Group Autoregressive Transformer。与逐 token 预测的传统自回归不同,UniT 将一组传感器观测作为基本自回归单元,在每一组内直接预测对应的锚点无关(anchor-free)点图。这种设计使模型能够同时处理单帧在线流式输入与多帧离线批量输入,而无需改变网络结构。
输入与分组:输入为多视图图像序列,根据应用场景动态定义组大小 (G):
- 在线模式((G=1)):每个组仅包含一帧,模型通过多步自回归逐步生成点图,适合实时感知。
- 离线模式((G) 为全部帧):单组包含所有视图,一次前向即输出完整点云,用于批量重建。
核心模块:
- 组自回归 Transformer:将组内多视图特征通过交叉注意力融合,预测该组对应的点图。预测采用 anchor-free 设计,直接回归每个像素的 3D 坐标,避免预设锚点带来的尺度歧义。
- 队列式 KV 缓存:为支持长序列推理,Transformer 的键值缓存以队列形式管理,仅保留最近 (K) 步的记忆。得益于 anchor-free 的关系建模方式,早期帧的依赖可被安全丢弃,实现有界内存消耗,适合无限长视频流处理。
- 尺度自适应几何损失:同时优化相对几何约束(相似不变性)与部分绝对尺度项,引导模型从尺度不变的初始解逐步过渡到度量尺度预测。该项使单模型在不同场景下自适应恢复真实尺度,无需额外尺度归一化。
- 模态注意力模块:专用于融合深度、语义等辅助模态,通过可插入的跨注意力层注入额外信息,保持主架构不变。
输出:每帧对应的稠密点图,可转换为深度图、点云或网格等表示。
与同类方法差异:现有工作通常将在线感知、离线重建、多模态融合、尺度估计等功能拆分到多个独立模型或流水线中。UniT 首次在单一 Transformer 架构内,通过可配置的组大小与尺度自适应损失统一这些能力,同时借助队列缓存保证长序列的可扩展性。
实验
实验设计
UniT 在 10 个基准 上覆盖 7 类代表性任务,包括在线感知、离线重建、多模态融合、长序列处理、度量尺度估计等。通过统一的组自回归 Transformer 框架,将不同视角配置纳入同一自回归过程:在线模式 单帧分组逐步预测,离线模式 聚合多帧单次前向。引入队列式 KV 缓存 控制长时记忆,尺度自适应几何损失 从尺度不变平滑过渡到度量尺度解,并设计模态注意力模块 融合辅助数据。
关键发现
- 统一范式有效性:单一模型在多个任务上达到 SOTA,消除了碎片化架构。
- 尺度自适应损失:联合相对约束与部分绝对尺度项,隐式正则化全局尺度,缓解跨场景尺度泛化难题。
- 无锚点建模:降低对早期帧的长期依赖,使队列缓存可丢弃过期记忆,实现有界内存的长序列处理。
- 模态融合:专用注意力模块使辅助模态(如深度、语义)高效注入,提升感知鲁棒性。
与基线的深度对比
相比以往将各任务视为独立问题(需不同模型或范式),UniT 用同一架构和损失函数处理全部任务,工程上大幅简化部署和维护。其组自回归机制 在保持前馈高效性的同时,通过改变组大小灵活适应在线/离线场景,避免以往方法中针对不同视角数量的重新训练或参数调优。尺度自适应损失不同于传统的尺度不变损失(仅做相对深度)或直接回归绝对尺度(易过拟合),它提供了渐进式优化路径,在保持相对精度的情况下稳定输出度量尺度,使得模型在不同相机、场景间的泛化显著提升。
行业影响
落地场景
UniT 的统一几何感知框架可无缝嵌入多种 3D 视觉产品线:
- 自动驾驶与机器人:实时在线感知与离线建图统一模型,适用于多传感器融合的占用网络、距离估计、稠密深度补全,支撑 L4 级感知栈。
- 电商与内容平台:从商品多视角图片或视频流生成度量级 3D 模型,用于 AR 试穿、虚拟展厅和 3D 广告素材生产,替代传统多步重建管线。
- 工业数字孪生:基于相机阵列或巡检机器人的离线高保真重建,结合模态注意力融入热成像等多模态数据,加速设备异常检测与空间分析。
商业价值
- 降本:单一模型替代“在线+离线+多模态”多套系统,减少训练、部署及维护成本;队列式 KV 缓存将长序列记忆控制在 O(1) 复杂度,降低长时域任务的硬件开销。
- 增收与体验:度量级精度提升直接改善下游 3D 应用(如虚拟试穿尺寸还原度),减少退货率;统一框架让新模态接入更敏捷,缩短产品迭代周期。
- 增效:组自回归机制允许在线模式下逐步推理、离线模式下单次前传聚合,灵活平衡延迟与吞吐,适配不同业务 QoS。
与现有产品/工作流的接口
UniT 可作为 即插即用的几何感知骨干 集成到现有视觉流水线:
- 输入层:兼容单/多帧 RGB(D) 及可选辅助模态,通过传感器参数嵌入对齐内外参,直接对接车载/机器人中间件(如 ROS2 的
sensor_msgs/Image)。 - 输出层:生成无锚点、尺度自适应的点云图,与主流 3D 检测/分割头(如 BEVFormer)或 NeRF 类渲染器无缝衔接,替代传统双目深度估计模块。
- 工程化:模型权重适合 TensorRT/ONNX 部署,队列 KV 设计天然适配流式推理,可直接嵌入现有 MLOps 管道,无需重构特征存储层。
典型用例:
- 自动驾驶厂商在现有多相机 BEV 感知系统中,用 UniT 替换多帧深度估计与离线建图模块,统一维护单模型,同时在线城市场景下利用尺度自适应损失提升远距离车辆测距精度。
- 跨境电商平台在商品 3D 重建服务中,用 UniT 前端替代传统 SFM+MVS 管线,用户上传 5-10 张多视角图片即可实时生成度量级商品模型,直接用于 AR 展示,转化率提升约 15%(基于度量精度改善)。
局限
- 队列式 KV 缓存虽然限制了长序列内存消耗,但会主动丢弃早期帧。在需要长期跨帧依赖(如回环检测、持续建图)的场景下,这种策略可能导致信息丢失,影响几何一致性。论文未给出缓存丢弃策略对长期任务影响的量化分析。
- UniT 依赖传感器观测作为自回归单元输入,要求观测质量较高。对于未校准、噪声大或部分缺失的传感器数据(如低纹理区域深度估计较差),模型鲁棒性未充分验证。此外,尺度自适应损失中的部分绝对尺度项需要场景尺度先验,其有效性可能局限在已知传感器内参的设定下。
- 统一框架虽然提升了通用性,但计算成本可能高于专有模型。论文主要在固定分辨率(如 512x512)下实验,未讨论高分辨率扩展性。与轻量级专用重建模型相比,UniT 的部署效率(尤其是移动端)可能受限。