论文

同一场景,两种深度:探析单目基础模型中的几何歧义性

同一场景,两种深度:探析单目基础模型中的几何歧义性

忠实的三维世界表征应考虑分层几何,即单个相机射线可能包含多个可见且几何有效的表面。然而,单目深度估计将此结构简化为每个像素一个标量深度。透明场景使这种歧义可测量:同一条射线可穿过前景玻璃并观察到背景,使监督目标成为标注、数据和训练的一种约定,而非场景固有的真实。学习到的预测器将其深度层偏好暴露为这种约定。 我们引入 MultiDepth-3k (MD-3k),一个稀疏双层有序基准,用于测量深度层偏好和多层空间关系准确性 (ML-SRA)。在 MD-3k 上,领先的深度基础模型在标准 RGB 输入下表现出多样的层偏好,表明相同分层几何在不同模型中可有不同解析。我们进一步发现,拉普拉斯视觉提示 (LVP),一种免训练的频谱输入变换,可以显著改变某些冻结模型报告的层。最强的 RGB/LVP 组合 DAv2-L 达到了 75.5% ML-SRA。 这些结果表明,深度基础模型可能表达了标准 RGB 推理未表达的互补几何假设。我们邀请社区通过歧义感知的视角重新思考深度监督和评估,将多个有效三维解释视为待测量、保存和表达的几何结构。

论文精读

TL;DR 针对透明场景下一条光线对应多个几何表面带来的歧义,提出 MultiDepth-3k 基准,首次量化不同深度基础模型的层偏好,并通过拉普拉斯视觉提示揭示其互补的几何假设,为深度估计的歧义感知评估与表达开辟新视角。

问题

问题背景

单目深度估计旨在从单张 RGB 图像恢复逐像素的绝对或相对深度,是三维视觉的基础任务,广泛用于自动驾驶、增强现实、机器人导航等。当前领域以大规模深度基础模型(depth foundation models)为主导,追求在通用场景下的零样本泛化能力。

现有方法局限

几乎所有主流方法(如 DPT、Depth Anything、Marigold 等)将深度估计建模为单层标量回归,即每个像素仅预测一个深度值。然而,真实世界普遍存在多层几何——一条相机射线可能穿过玻璃、水面等透明表面,同时观测到前景和背景两个有效深度。现有数据集的标注过程强制选择其中一层作为“真值”,由此制造了一个标注惯例(convention),而非场景固有物理属性。模型在训练中只能学习到该惯例下的偏好,丢失了几何模糊性本身的结构信息。同时,评估指标(如 AbsRel、RMSE)完全忽略模型能否正确表达多层空间关系,导致“准确”的深度预测可能违背物理上的层次关系。

为什么这个问题难 / 重要

技术挑战:单目深度估计本质是欠定问题,透明场景进一步引入一对多映射——同一 RGB 输入对应多个几何有效解。训练信号只能提供单一解,迫使模型隐式记忆数据集偏好,丧失了表达几何假设多样性的能力。工业关注度:自动驾驶中,错误理解透过车窗的深度关系可能导致规划失败;AR 眼镜中,多层深度是正确虚实遮挡的前提。若不显式测量并保留这种模糊性,模型将无法可靠部署于含透明、反射等真实边缘情况的场景。

行业类比

该问题类似语义分割中对透明物体类别的忽视:早期分割模型将所有像素强制分配至单一类别,但透明区域同时属于“玻璃”和“背景”,只有显式建模模糊性才能提升下游任务的安全性。

核心洞察

  • 单目深度估计中的“真实深度”并非场景固有属性,而是标注者根据任务惯例选择的一种约定。传统基准将这一约定视为唯一真值,掩盖了透明/反射场景中存在的多义几何——同一像素可能对应多个物理上合理且可视的深度层。该工作通过 **MultiDepth-3k** 基准首次系统量化了这种模糊性,迫使从业者重新审视训练数据的构造假设及其如何被模型吸收为深度层偏好。
  • 大型深度基础模型在标准 RGB 推理下对同一场景的深度层偏好差异显著,但可通过无训练的 **Laplacian Visual Prompting** 等技术在层间切换,表明冻结的模型权重中潜藏着多个互补的几何假设。这突破了将预训练模型视为“单一深度映射器”的静态视角,揭示出模型内部存在可查询的、未表达的深度分布,为场景理解的可控解码提供了新路径。

方法

方法流程:从歧义观测到层偏好评测

输入 为一张包含透明或折射介质(如玻璃)的单目 RGB 图像。这类场景中,单个像素对应的相机射线可能贯穿多个三维表面——例如前景透明物体与后方背景——形成天然的几何歧义。标准深度估计通常将该歧义压缩成单一标量,而本工作保留并量化该歧义。

关键模块与流程

  1. MultiDepth-3k (MD-3k) 基准构建
    在精选的透明场景图像中,为稀疏采样像素点人工标注两个有效深度层:近层(foreground)远层(background)。标注仅提供序数关系(哪层更近),不要求绝对尺度,避免标注歧义并降低采集成本。

  2. 深度层偏好分析
    将任意单目深度基础模型(冻结参数)对 RGB 输入推理,得到逐像素深度值。对每一标注像素,将模型输出与两层 GT 对比,若该输出更接近近层则为“前景偏好”,反之为“背景偏好”。由此刻画每个模型的层偏好分布

  3. 多层空间关系准确率 (ML-SRA)
    定义二元序数指标:在标注像素上,若模型输出的前景深度值小于背景深度值,则视为正确保持了空间前后关系。该指标直接衡量模型对多层几何的约束能力,而非追求与某一层的精细误差。

  4. Laplacian Visual Prompting (LVP)
    一种无需训练的输入级干预:对 RGB 施加拉普拉斯高频滤波,提取边缘轮廓后将其作为视觉提示与原始图像重组(例如谱域融合或额外通道输入),再次送入同一冻结模型。LVP 能改变模型表达的深度层,暴露模型内在的多重几何假设,让原本隐式的偏好变得可控。

输出 包括层偏好统计、ML-SRA 分数,以及通过 LVP 触发的替代深度解。

与同类方法的差异:传统深度评测将几何歧义视为标注噪声或预测误差,努力消除;本方法反而将歧义作为可度量、可保留的几何结构,通过序数两分层标注与偏好指标,让不同模型的隐式约定浮出水面,为单目深度估计提供了歧义感知的评估视角。

实验

实验设计

作者构建了 MultiDepth-3k (MD-3k) 基准,包含 稀疏两层序数标注,每条相机射线均存在前景(玻璃等透明物体)和背景两种有效深度。在 MD-3k 上,评估了多款单目深度基础模型(如 Depth Anything v2、ZoeDepth 等)在标准 RGB 输入下的 深度层偏好多层空间关系准确性 (ML-SRA)。进一步引入 Laplacian Visual Prompting (LVP)——一种无需训练的频谱输入变换,通过高频增强或抑制来影响冻结模型所表达的深度层,从而系统性探测几何歧义下的模型行为。

关键发现

不同深度基础模型在 MD-3k 上表现出 显著的层偏好差异:相同场景下,有的模型倾向输出前景深度,有的倾向背景,证实了透明场景中单目深度估计的 几何歧义是可测量 的。LVP 能有效改变特定模型的输出深度层,且改变方向与变换类型相关(如高频增强更易使模型输出前景)。最佳组合 DAv2-L (RGB/LVP) 达到 75.5% ML-SRA,表明冻结模型本身蕴含多种几何假设,RGB 输入只能表达其中一种,而 LVP 可解锁附假设。

与基线对比解读

传统深度评估仅考虑单层深度误差,忽视歧义场景下的多层合理性。MD-3k 和 ML-SRA 指标首次将 歧义本身作为评测维度,揭示主流模型在标准 RGB 推理下隐藏的互补能力。与简单平均融合或多任务学习不同,LVP 不改动模型权重,仅通过输入端的频谱调制控制输出层,具有即插即用、计算零开销的优势。这一结果挑战了“单目深度估计目标唯一”的预设,呼吁社区在标注、训练和评估中纳入 歧义感知视角,将多层有效深度视为需要保留和表达的几何结构。

行业影响

落地场景

单目深度基础模型 已在自动驾驶、机器人、AR/VR、电商 3D 展示等领域成为核心感知组件。本工作揭示的 几何歧义(一条射线对应多个有效深度层)在透明物体场景(玻璃幕墙、车窗、亚克力货架)中普遍存在。由此可泛化到:

  • 自动驾驶 对透明障碍物(玻璃建筑、车窗反光)的深度估计
  • 仓储机器人 抓取透明容器或货架隔层
  • AR/VR 中虚拟物体与透明表面的正确遮挡
  • 电商 3D 重建 对半透明商品(香水瓶、眼镜)的建模
  • 影视后期 深度合成时的层分解需求

商业价值

降本:减少因深度歧义导致的下游任务失败成本。例如自动驾驶中误将玻璃幕墙估计为天空深度,可能导致碰撞风险;机器人抓取透明盒子时深度错误会损坏物品。通过 MultiDepth-3k 基准筛选或微调模型,可降低此类故障率。

体验提升:AR 眼镜若能正确输出多层深度,可实现更真实的虚拟叠加(如车窗上显示导航,而非错误穿透玻璃)。电商 3D 展示中透明商品的正确分层可提升交互真实感。

数据标注增效:引入 歧义感知的标注规范(如标注前后两层深度)可减少人工判断成本,同时为模型训练提供更丰富的监督信号。

与现有产品 / 工作流的接口

  • 评估管线集成:将 MD-3k 作为深度模型选型的标准测试集之一,插入 CI/CD 流程,自动生成层偏好报告。
  • 推理时提示:利用 Laplacian Visual Prompting (LVP),无需重新训练即可使冻结模型切换深度层输出,可封装为推理前处理模块。
  • 训练增强:若需要模型本身具备歧义表达能力,可将 ML-SRA 作为辅助损失,或使用双深度真值进行多任务训练,直接加载于现有 Depth Anything / Marigold 等 foundation model 的微调管道。

具体落地 Use Case

  1. 全球电商平台的 3D 商品展示
    某跨境电商平台上线“3D 预览”功能,用户可旋转透明水瓶、玻璃杯。现有重建算法深度模糊导致瓶壁厚度丢失或背景穿透。接入 MD-3k 筛选最优深度教师模型,利用 LVP 自动生成前后两层深度图,指导 NeRF 重建出正确的透明层结构,降低退货率并提升用户停留时长。

  2. 自动驾驶系统供应商的感知栈升级
    某 L4 自动驾驶公司夜间测试时,多次因透过玻璃幕墙看到室内光源而造成深度估计错误,触发不必要的急刹车。集成 MD-3k 评估现有深度模块,发现当前模型偏好背景层,改为 LVP 提示后强制输出前景玻璃层,直接部署为安全驾驶策略的输入,减少误判频次,降低接管率。

局限

  • **MultiDepth-3k** 基准仅涵盖稀疏的两层序数标注,无法反映真实场景中可能出现的多层连续深度层(如多层半透明介质、流体),也无法量化模型在更复杂层间空间关系下的表现。基准规模(3000个样本)与场景多样性有限,主要面向室内外玻璃等简单透明体,对高度反光、半透明或不规则折射表面的泛化性尚不明确。这限制了将结论推广到通用透明场景深度估计的可靠性。
  • **Laplacian Visual Prompting (LVP)** 是一种频谱输入变换,虽无需训练即可改变部分冻结模型的层偏好,但提示强度需手工选择,且对少数模型(如 Depth Anything V2)的层切换效果有限,甚至可能导致输出崩塌。实验仅关注 DAv2-L 单一大型模型,未系统探索 LVP 在不同架构、不同尺度或微调模型中的鲁棒性,其与可训练提示方法的对比也缺失,为实际部署留下不确定性。
  • 论文未评估歧义感知输出在下游任务(如三维重建、新视角合成)中的实际增益,仅展示了定性生成案例。当前的多层深度基准评估与现有密集深度预测体系割裂,缺乏统一的歧义感知评测协议,可能导致社区难以直接采纳。此外,模型层偏好受训练数据标注习惯影响较大,但论文未深入分析不同训练数据标注准则如何塑造层偏好,限制了从数据层面解决歧义的方法设计。
论文Xiaohao Xu2026-06-28原文

相关内容