Pumpire: 统一的度量距离估计基准
我们提出 Pumpire,一个用于评估图像级与视频级 3D 基础模型度量点对距离估计能力的统一基准,覆盖有深度先验与无深度先验两种设定。 与以往通常将深度和相机内参分开评估、或用几何相似度指标评估点云的做法不同——这些做法无法直接反映模型的逐点距离估计能力——Pumpire 直接从重建几何中评估点对距离。为此,我们收集了大规模且多样化的数据集 pumpire-6k,包含 100 个真实场景,每个场景标注了物理实测的点对距离并含 64 帧,共 6,400 帧。 基于该数据集,我们建立了整体性评估协议,同时覆盖图像级与视频级 3D 基础模型,可直接评估点对距离误差并支持跨设定比较。我们在代表性 3D 基础模型的 29 种基线配置上进行了大量实验,并对结果做了全面分析。 通过提供这一基准,我们着眼于在重建的 3D 空间中感知与估计物理尺度的更基础能力,而此前的评估协议在很大程度上忽略了这一点。项目主页见 https://pumpire.github.io/
论文精读
TL;DR Pumpire 统一基准直接评估 3D 基础模型的度量点对距离估计能力,通过物理实测标注与直接距离误差,弥补以往分离评估深度/内参无法反映真实点对距离的缺陷。
问题
问题背景
当前 3D 视觉基础模型在深度估计、相机位姿恢复与场景重建上进展迅速,但评估体系仍缺乏对点对米制距离这一核心能力的直接度量。
现有方法局限
传统评估协议存在两方面缺陷:
- 深度与内参分离评估:分别计算深度图的 AbsRel、RMSE 或相机内参误差,无法反映最终重建几何中两点间距离的准确性,因为深度误差与位姿误差会相互耦合。
- 几何相似度指标:对重建点云采用 Chamfer Distance、F-score 等,这些指标侧重整体形状对齐,对局部距离失真和全局尺度偏差不敏感,无法给出点对距离误差的直接量化。
此外,现有数据集多依赖合成数据或稀疏深度真值,缺乏真实场景中物理测量的点对距离标注,导致绝对尺度评估缺失。
为什么重要 / 难度
点对米制距离是自动驾驶碰撞判断、机器人抓取、AR 测量等下游任务的基础。模型可能生成视觉合理但尺度错误的重建(例如整体缩放偏差),或在局部区域产生距离失真,带来安全风险。构建此类基准的挑战在于:
- 需要大规模真实场景采集,成本高;
- 物理测量点对距离要求高精度设备与人工标注;
- 统一协议需覆盖图像级与视频级模型,并兼容有无深度先验等不同设置,确保公平对比。
行业类比
类似自动驾驶中检测框与真实物体的平移误差直接关联碰撞风险,点对距离估计能力是决定 3D 重建系统能否在安全关键场景中落地的核心指标。
核心洞察
- Pumpire 首次将评估目标直接对准 3D 重建中的**度量点对距离**,而不是深度误差或点云相似度。 以往基准分别评测深度图、相机内参,或用 Chamfer Distance 等几何相似性指标,这些指标无法直接反映模型在实际任务(如机器人抓取、自动驾驶碰撞判断)中对物理尺度的感知准确性。Pumpire 通过物理测量的点对距离标注,直接量化模型输出的几何形状在真实尺度上的偏差,更贴合下游应用的失败模式。
- Pumpire 提供统一的评估协议,覆盖图像级和视频级 3D 基础模型,并允许有/无深度先验的模型在同一基准上公平比较。 之前的工作往往针对特定模型类型设计评估,图像级模型和视频级模型使用不同数据集和指标,难以横向对比。Pumpire 通过统一的数据集和距离误差指标,使得研究者可以分析多视图信息、深度先验等因素对 metric scale estimation 的贡献,从而为模型选择和改进提供直接证据。
- pumpire-6k 包含 100 个真实场景、6400 帧图像,每个场景标注了物理测量的点对距离。 现有 3D 基准数据集大多依赖合成渲染或稀疏的深度传感器,真实场景中精确到物理尺度的点对距离标注很少。该数据集的构建(包括像素坐标标注管线)不仅为评估提供了可靠依据,也为后续训练或微调模型提供了潜在资源,尤其是针对 metric scale 感知的弱监督学习。
方法
方法概述
Pumpire 是一个统一基准,用于直接评估 度量点对距离估计 能力。其方法流程围绕三个关键模块展开。
- 数据集构建:收集 pumpire-6k 数据集,包含 100 个真实世界场景,每个场景 64 帧,共 6,400 帧。每个场景中标注了通过物理测量得到的点对距离,为评估提供真实物理尺度的 ground truth。
- 评估协议:建立覆盖图像级和视频级 3D 基础模型的统一协议,并支持有/无深度先验两种情况。模型对输入帧进行 3D 重建,然后从重建几何中提取指定点对之间的距离估计值。
- 误差度量与场景难度分割:直接计算点对距离误差,而非依赖深度图或相机内参的间接评估。通过 跨视角一致性 将场景划分为不同难度级别,用于分析模型在不同条件下的表现差异。
输入:单帧或多帧图像,可选深度先验。
关键模块:点对距离物理标注、重建几何的距离提取、跨视角一致性难度划分。
输出:各模型配置在点对距离上的误差指标与跨设置对比分析。
该方法的独特性在于直接量化重建结果与真实物理测量值之间的一致性,直接反映模型对物理尺度的感知能力。
实验
实验设计
- 在 pumpire-6k 数据集上评测 29 个代表性 3D 基础模型配置,覆盖图像级与视频级模型、有无深度先验。
- 数据集包含 100 个真实场景、每个场景 64 帧、共 6,400 帧,标注物理实测点对距离。
- 采用基于 cross-view consistency 的场景难度划分,直接评估 point-pair distance errors。
关键发现
- 直接评测点对物理距离暴露了现有模型在 metric scale perception 上的不足,传统分离评测深度/内参或几何相似度的方法无法反映真实尺度估计能力。
- 多视图时序信息与深度先验对距离估计有重要影响,视频级模型与带深度先验模型表现出不同特性。
- 图像级与视频级模型之间存在明显的 cross-setting 性能差异。
与基线对比解读
- 传统评测 protocol 可能使模型在深度图或点云对齐指标上过拟合,却忽视真实世界的物理尺度。
- Pumpire 通过直接评测 point-to-point distances,将重心从“几何相似”转向“物理准确”,揭示了此前被忽略的盲区。
- 对工程师的启示:在自动驾驶、机器人等需真实距离的应用中,应加入点对距离的直接评测,而非仅依赖现有几何指标。
行业影响
落地场景
Pumpire 直接评估 3D 基础模型的度量点对距离估计能力,适合所有依赖真实物理尺度的 AI 产品。典型场景包括:
- 自动驾驶:验证感知模型输出的 3D 检测框之间距离误差,为安全冗余设计提供量化依据。
- 机器人 / 仓储:抓取、避障、导航任务中,物体间精确距离是运动规划的前提。
- AR/VR 与空间计算:虚拟物体与真实世界的尺度一致性直接影响沉浸感,例如电商 AR 试摆家具时,用户上传房间视频,模型需准确估计家具到墙面的距离。
- 数字孪生 / 建筑信息建模:从图像或视频重建的 3D 场景必须保留可测量的物理尺寸。
商业价值
- 降本:用统一基准替代分散的深度、内参、点云评估,减少模型选型与回归测试成本。Pumpire 的 29 个 baseline 配置让团队快速对标主流 3D 基础模型,避免部署后因尺度不准导致返工。
- 体验提升:在消费级 AR/VR 和电商场景中,精准的度量估计能减少因尺寸不符造成的退货,提高转化率。
- 风险控制:在自动驾驶等安全关键领域,Pumpire 能够提前暴露点对点距离估计的系统性偏差,帮助满足功能安全标准(如 ISO 26262)的定量验证要求。
与现有产品 / 工作流的接口
Pumpire 可作为模型评估层集成到 MLOps 流水线:
- 在 CI/CD 中加入 Pumpire 指标作为准入门禁,对每次模型更新自动跑基准测试。
- 数据集
pumpire-6k和评估协议支持 image- 与 video-level 模型,可与现有深度估计(如 Depth Anything)、多视图重建(如 DUSt3R)工具链互补,统一在度量距离误差维度上比较。 - 输出标准化 JSON 结果,便于接入 Weights & Biases、MLflow 等 experiment tracking 平台,形成持续监测面板。
建议将 Pumpire 作为内部 3D 感知模型发布前的必测基准,尤其当业务涉及物理尺度敏感的应用时。
局限
- - 数据集规模相对有限:pumpire-6k 仅包含 100 个真实场景、6400 帧,远小于 MegaDepth(>10 万图像)或 ScanNet(数千场景)等既有几何数据集。场景类型分布和点对选取策略未在论文摘要中明确,可能偏向室内或特定结构,限制了对室外、远距离或极端遮挡情形的泛化评估。物理测量的人工标注可能引入毫米级误差,且未提供多标注者一致性验证,影响 ground truth 的可靠性。
- - 评估协议对模型输出形式约束较强:Pumpire 要求模型能重建出可查询的几何表示(如点云或深度图),但许多 3D 基础模型仅输出 dense feature 或 task-specific prediction,无法直接参与 point-pair distance 评估。对于 video-level 模型,不同采样帧数和步长会显著影响重建质量,虽然论文提供了采样策略,但各模型输入处理方式(如是否要求固定帧数)仍可能存在差异,导致跨模型比较不完全公平。
- - 缺乏与现有 depth/camera metric 的定量关联分析:论文声称 point-pair distance 比传统 depth 指标更能反映物理尺度感知,但未展示该指标与 AbsRel、RMSE 等常用 depth 指标的统计相关性,也未说明在哪些场景下 point-pair distance 能揭示 depth 指标无法捕捉的缺陷。这使得读者难以判断该基准的独特增量价值,以及从 depth benchmark 切换到 Pumpire 的必要性。