论文

SpatialBench: 你的空间基础模型是全才吗?

SpatialBench: 你的空间基础模型是全才吗?

虽然空间基础模型在标准数据集上表现出色,但一个关键问题仍然存在:它们是否真正能够作为全才,在多样化的下游任务、任意视角、变化场景域、不同输入密度以及特定硬件约束下鲁棒泛化?回答这一问题需要全面的评估,然而当前模型主要在其专门设计或训练的特定领域上进行评估。这种评估本质上受限于狭隘的范式覆盖、有限的场景域和任意的帧采样,使得难以评估其真正的泛化能力。 为解决这一空白,我们提出了SpatialBench,一个跨范式、领域多样的空间基础模型基准,采用确定性采样。SpatialBench具有前所未有的规模和严格的确定性设计,涵盖5个不同空间领域的19个数据集和546个场景。它在4种不同输入密度设置下,对6个范式的41个模型在5个任务套件上进行了全面评估。 我们的广泛评估揭示了当前模型尚未成为全才,并为未来进展提供了关键见解。具体来说: - 全上下文注意力最大化准确性,而有界内存策略解锁长序列可扩展性。 - 在具有挑战性的具身和以自我为中心的任务中,严格的领域对齐和高质量数据比简单的数据集缩放更为关键。 为了弥补分析中发现的最大数据缺口,我们超越评估,引入了大规模数据集DA-Next-5M和强基线模型DA-Next,推动了空间表示学习的边界。

论文精读

TL;DR SpatialBench 通过跨范式、多领域的确定性基准,系统评估了 41 个空间基础模型,揭示其尚未成为“全能选手”,并开源 DA-Next-5M 数据集与强基线 DA-Next 以推动空间表征学习。

问题

空间基础模型的泛化评估困局

空间基础模型(Spatial Foundation Models)在深度估计、相机位姿回归、3D 重建等任务上取得了长足进步,但当前评估范式严重滞后。大多数模型仅在单一领域(如自动驾驶、室内 SLAM)或固定采样策略下测试,难以反映真实场景中任意视角、跨域迁移、输入密度变化和硬件约束下的鲁棒性

现有评估的三大技术局限

  1. 范式覆盖窄:现有基准通常只针对某类模型(如逐帧深度估计或离线稠密重建),无法对比 优化式方法(如 DUSt3R)、前馈式方法(如 Depth Anything)、在线 SLAM 方法 等跨范式方案。
  2. 场景域单一:数据集多来自自动驾驶或合成室内场景,缺乏对 具身交互自我中心视频 等动态场景的覆盖,导致模型域外泛化能力无从衡量。
  3. 采样随意性:评估时帧采样策略不统一(如随机跳帧或固定间隔),不同工作间结果无法公平比较,且掩盖了模型对输入密度变化的敏感度。

难度与重要性

从工程角度看,空间智能是具身 AI、AR/VR、机器人导航等领域的底层能力。一个“全能型”空间模型需要同时应对 长序列注意力瓶颈跨域特征对齐实时推理硬件限制。正如论文所指出的,高精度全注意力机制能最大化准确性,但往往缺乏长序列缩放能力;而有限内存策略虽能扩展序列长度,却可能牺牲细节。在具身任务中,域对齐和数据质量远比简单扩大数据量级关键。这些发现对实际系统设计有直接指导意义:“全能型”模型不可能仅靠扩大预训练数据达成,必须在架构、训练策略和评估基准上协同创新。

类比而言,这就像自动驾驶领域的感知模型:仅在城市道路数据集上表现优异的模型,突然被部署到乡村土路或夜雨场景,其性能可能断崖式下降——缺乏跨域、跨密度系统性评估的模型,永远无法成为可靠的工业级组件。

核心洞察

  • **跨范式、多域评估暴露当前空间基础模型的泛化短板**:现有模型通常在与其训练数据高度重叠的场景上测试,导致乐观的性能估计。SpatialBench 通过覆盖 6 种范式、5 个空间域、4 种输入密度和确定性采样,首次系统性地揭示了模型在分布外场景、稀疏视角或新硬件约束下的显著性能退化。这打破了“单一基准高分即代表全能”的错觉,提醒工程落地时必须在目标域上做针对性评估。
  • **全上下文注意力与长序列可扩展性的根本矛盾**:实验表明,使用全局上下文注意力在多数任务中精度最优,但内存与计算开销随输入帧数线性增长,无法处理长序列。而 chunk-based 或 bounded-memory 策略(如局部注意力、稀疏记忆)虽能支撑长序列,却引入精度折损。这一权衡对实时 SLAM、在线三维重建等应用至关重要,暗示未来架构需要融合全局推理与高效记忆管理,而非单纯追求高精度。
  • **具身/自我中心任务中“领域对齐”重于“数据规模”**:在具身交互和第一人称任务上,用高度对齐的目标域数据(即使规模较小)训练,效果远超更大但域不相关的通用数据集。这揭示了当前“通用空间基础模型”跨域迁移的脆弱性,并为数据工程提供了明确方向:面向特定下游场景,高质量、高相关性的标注数据比海量弱相关数据更有价值,盲目扩展多源数据可能引入噪声,反而降低模型收敛效率。

方法

输入与特征编码

DA-Next 以多视图 RGB 图像作为核心输入,支持可变帧数和高密度设置。图像首先通过预训练的视觉 Transformer (ViT) 编码器提取逐块特征,并叠加正弦位置编码,为后续注意力模块提供具备空间感知能力的 token 序列。

关键模块

  • 全上下文注意力 (Full-Context Attention):在短序列设定中,模型在所有输入帧的 token 上直接执行全局自注意力,以最大化几何一致性和精度,尤其利于稠密重建与深度估计。
  • 有界内存策略 (Bounded-Memory Strategy):为应对长序列带来的显存压力,将序列划分为多个记忆块 (chunk),每个块内保留全注意力,块之间通过紧凑的可学习记忆状态进行信息传递,实现线性复杂度下的长程建模,突破硬件瓶颈。
  • 多任务预测头:编码后的特征分别送入轻量级任务头,输出深度图、相机位姿、轨迹及稠密重建结果,支撑多种下游空间任务。

训练与数据

模型在DA-Next-5M大规模数据集上预训练,该数据集通过严格的质量筛选与域对齐流程构建,覆盖具身、自我中心、驾驶及通用场景五大空间域。训练采用多分辨率、多密度采样策略,强制模型对不同输入密度与视角变化保持鲁棒,损失函数融合深度一致性、光度重投影误差与位姿回归目标。

与同类方法的差异

不同于其他空间模型过度依赖海量数据或单一域优化,DA-Next 将高质量数据与域对齐置于优先地位,并通过内存高效的全注意力机制在精度与可扩展性之间取得平衡,为通用空间推理提供了新基线。

实验

实验设计

SpatialBench 构建了一个跨范式、域多样的评估框架,覆盖 19 个数据集546 个场景5 个空间域,评估 41 个模型6 种范式(优化方法、端到端前馈、在线流式、分块方法、SLAM、测试时训练)下的表现。实验围绕 5 个任务套件(相机位姿估计、轨迹估计、深度估计、稠密重建等)展开,并采用 4 种输入密度设置(稠密、中等、稀疏、极稀疏)的确定性采样策略,以消除随机帧选择带来的偏差。

关键发现

  • 全上下文注意力 能够最大化准确率,而 有界内存策略(如分块注意力或循环记忆)是实现长序列可扩展性的关键。
  • 具身任务自我中心任务 中,严格的领域对齐和高质量数据远比单纯扩大数据集规模更重要。
  • 更多输入帧并不总是带来更好结果;性能在中等密度后趋于饱和,甚至会因噪声累积而下降。
  • 不同范式存在显著的精度-效率 trade-off:优化方法 精度高但推理慢,前馈方法 可实时运行却在域迁移时鲁棒性不足,SLAM 方法 在长序列稳定性上仍有局限。

基线对比解读

与领域专用的基线模型相比,通用空间基础模型在跨域泛化上暴露出明显短板——在非训练领域上性能出现显著下降。本文提出的 DA-Next 模型与 DA-Next-5M 数据集在一定程度上缓解了数据缺口,并在主流基准上达到竞争水平,但即便强基线仍未完全解决开放世界泛化问题。这表明未来工作需在数据多样性、模型架构和训练策略上同时发力,而非单纯扩大模型或数据规模。

行业影响

落地场景

SpatialBench 直接服务于所有依赖空间感知的工业产品,其多领域、多输入密度的评估能力特别适合以下场景:

  • 自动驾驶与机器人:评估模型在不同天气、光照、传感器退化下的深度估计与定位鲁棒性。
  • 增强现实 (AR) / 虚拟现实 (VR) :衡量任意视角重建与实时跟踪在陌生环境中的性能。
  • 数字孪生与 3D 内容生成:验证从稀疏扫描到高保真模型重建的跨场景泛化能力。
  • 具身智能:测试机械臂操作、视觉导航等任务中空间感知的可靠性。

商业价值

  • 降低模型选型成本:统一、严苛的基准让团队能够按硬件约束、帧率需求快速锁定最优模型,避免耗时的手动实验。
  • 加速产品迭代:基准揭示的“全上下文注意力 vs. 有界内存”等精度-尺度权衡,为架构优化提供量化指引,缩短研发周期。
  • 提升核心体验与安全:在自动驾驶、医疗导航等高风险场景,更鲁棒的空间感知直接降低故障率,增强用户信任。

与现有工作流的集成接口

SpatialBench 可作为标准化评估模块嵌入企业 MLOps:

  • 模型注册与持续监控:版本更新时自动运行基准,设定准入阈值,防止性能退化。
  • 领域自适应微调触发器:当特定密度或场景指标劣化时,自动启动数据采集与微调流程。
  • DA-Next 作为新基线:其发布的大规模数据集 DA-Next-5M 与模型可直接用于预训练或作为 backbone,无缝接入现有重建、定位管线。

具体落地用例

  • 自动驾驶感知系统:企业在部署深度估计模型前,利用 SpatialBench 的多密度设置模拟摄像头遮挡或远距离稀疏采样,确保模型在真实退化条件下仍保持高召回率,避免因漏检导致的安全事故。
  • 电商 AR 试穿:平台上线 3D 虚拟试衣间时,通过基准评估不同重建算法在用户随手拍摄的稀疏图像下的几何保真度,选取对视角变化最鲁棒的方案,直接提升商品转化率与用户停留时长。

局限

  • **基准覆盖的完备性与时效性局限**:SpatialBench 涵盖 5 个空间域、6 个范式,但真实应用场景(如动态场景、多传感器融合、长期自主导航)尚未充分纳入;多密度评估虽设计了 4 档,但无法穷举连续变化的点云密度和不同硬件平台的算力约束。基准数据一旦固定,难以快速适应新任务和新模型,可能需要周期性社区驱动更新才能维持评估的前沿性。
  • **DA-Next 的效率与可复现性权衡**:论文提出了 DA-Next-5M 数据集和 DA-Next 模型,作为面向数据缺口的补充,但未深入分析模型的计算开销、推理延迟与内存占用。对于资源受限的嵌入式 / 边缘设备,其全上下文注意力机制和大量训练数据可能带来部署障碍;同时,数据集的规模与多样性虽有助泛化,却提升了复现门槛,论文未提供轻量级蒸馏或压缩方案以平衡性能与效率。
论文Haosong Peng2026-05-26原文

相关内容