Unlocking Dense Metric Depth Estimation in VLMs
视觉-语言模型(VLM)在2D任务(如定位和描述)中表现出色,但在3D理解方面仍存在局限。其关键限制在于仅依赖文本监督,这难以约束细粒度视觉感知,并阻碍了稠密几何的恢复。现有方法要么从外部视觉模型蒸馏几何信息(导致误差累积),要么通过低效的逐像素查询或粗略的token级输出进行直接预测。 本文提出 DepthVLM,一个简单而有效的框架,将单个VLM转换为原生稠密几何预测器,同时保留其多模态能力。通过向LLM主干附加轻量级 深度头(depth head),并在统一的视觉-文本监督范式下采用两阶段训练策略,DepthVLM能在单次前向传播中生成全分辨率深度图与语言输出。我们还引入了一个统一的室内外度量深度基准,格式兼容VLM。 实验表明,DepthVLM显著优于现有VLM,推理效率更高,并超越了领先的纯视觉模型。它还改进了复杂的3D空间推理,向着真正统一的基础模型迈进。所有代码和检查点将公开发布。
论文精读
TL;DR DepthVLM 为 VLM 添加轻量深度头,通过统一视觉-文本训练,单次前向即输出深度图,大幅提升 3D 空间推理并保持多模态能力。
问题
问题背景
当前 VLM(Vision-Language Models)在 2D 视觉推理和描述任务上表现卓越,但三维空间理解仍明显薄弱。业界正寻求让单一模型同时掌握语言交互与密集几何感知,以支撑 AR/VR、自动驾驶 和 具身机器人 等应用。
现有方法局限
- 蒸馏式方案:从外部深度模型(如 DepthAnything)提取几何信息再注入 VLM,存在 误差累积 风险,且增加系统复杂度。
- 直接预测方案:部分方法尝试用 per-pixel query 逐像素查询深度,计算效率极低;另一些仅在粗糙的 token 级 输出深度,无法生成高分辨率密集深度图。
核心症结在于 VLM 的训练范式以 text-only supervision 为主,对细粒度视觉感知约束不足,难以从语言 token 中恢复密集几何结构。
为什么这个问题难且重要
- 技术挑战:VLM 的 LLM backbone 天然缺乏重建密集信号的机制,强行附加深度预测容易破坏原有 多模态对齐。
- 工程价值:若能以轻量头 + 统一训练范式,让单模型在一次前向传播中同时输出语言和全分辨率深度图,将大幅简化感知栈,并提升 3D 空间推理 的准确度——例如在机器人导航中,模型既要理解指令又要感知场景几何。
- 业界对 统一基础模型 需求强烈,任何能够无损融入密集几何的方案都可能推动下一代 VLM 架构变革。
论文作者指出:"A key limitation is their text-only supervision paradigm, which under-constrains fine-grained visual perception and prevents the recovery of dense geometry."
行业类比
这类似于自动驾驶感知中,用单个 BEVFormer 同时输出语义分割与深度,而非串联多个专用模型,降低了延迟与系统耦合风险。
核心洞察
- **LLM 中间特征直接用于密集预测** DepthVLM 将轻量深度头附加于 VLM 的 LLM backbone 之上,利用 LLM 的中间特征直接生成全分辨率深度图,而非像以往工作那样依赖外部纯视觉模型蒸馏或逐像素查询 token。这一设计避免了蒸馏带来的误差累积,同时因共享 LLM 特征,推理效率远高于需要单独视觉 backbone 的方案。这启示我们:LLM 学习到的视觉表征已隐含丰富几何信息,通过合适的解码结构即可解锁密集预测任务,为构建真正统一的视觉-语言-几何基础模型提供了简洁高效的架构范式。 **两阶段训-推一致范式防止灾难性遗忘** DepthVLM 采用两阶段训练策略:第一阶段联合大规模图文数据与深度数据预训练,保证语言能力与初步几何感知;第二阶段仅用高质量深度数据微调,同时保留语言监督以防止能力退化。与常见多任务训练不同,该方法在引入新密集预测任务时,无需修改原始 VLM 的训练目标或架构,仅通过灵活的训-推一致范式,即可在单次前向中同时输出文本与深度图。这为实际工程中扩展 VLMs 至更多感知模态(如深度、法向)时,如何平衡新能力与旧能力提供了可复用的训练策略与数据混合方案。
方法
输入与特征提取
输入包含一张图像和可选的文本指令。图像首先通过冻结的视觉编码器(如 SigLIP)提取局部和全局特征,经线性投影层映射到 LLM 的 token 嵌入空间,与文本 token 拼接后送入 LLM 骨干。这种设计保留了 VLM 原有的多模态对齐能力。
关键模块:轻量深度头
深度头 是一个独立的轻量解码器(如基于卷积的上采样网络),挂载在 LLM 的中间层或最终隐藏状态上。它将高维 LLM 特征逐步上采样至输入分辨率,输出单通道度量深度图。训练时深度头与 LLM 骨干解耦,仅引入少量参数,避免影响语言能力。
两阶段训练策略
- 阶段一(视觉-语言对齐):冻结深度头,仅使用多模态指令数据微调视觉编码器和投影层(或全参数微调 VLM),沿用标准下一 token 预测损失。此阶段确保基础对话和推理能力不受损害。
- 阶段二(几何注入):解冻深度头,在混合数据集上联合优化。视觉监督结合尺度不变对数损失和梯度损失,以对齐真实度量深度;文本监督仍为交叉熵损失。通过动态权重平衡两种损失,使模型同时输出精准深度图和高质量文本。数据涵盖室内、室外场景的密集深度真值及对话数据,提升泛化性。
输出方式
单次前向推理即生成:LLM 自回归输出文本响应,深度头并行输出全分辨率度量深度图。无需后处理或多次查询,效率显著优于逐像素特征匹配方法。
与同类方法的差异
相比于从外部深度模型(如 Depth Anything)蒸馏几何先验的方案,DepthVLM 端到端学习避免了误差累积和额外模型开销;相较于在 token 空间内输出粗糙深度的 VLM,它直接预测密集图并保持高分辨率;同时,深度头与 LLM 的轻耦合设计使其在继承 VLM 通用多模态能力的同时,具备了原生密集几何预测的能力。
实验
实验设计
DepthVLM 的实验旨在验证以下核心命题:通过在 VLM 的 LLM 骨干上附加一个轻量级 深度头,并采用统一的视觉-文本监督,模型能否在不牺牲多模态能力的前提下,原生输出全分辨率密集深度图。
为此,作者构建了一个 室内-室外统一度量深度基准,采用 VLM 兼容格式,以公平评估不同 VLMs 和专用深度模型。对比基线包括:
- 现有 VLMs(如直接微调或使用逐像素查询的方法)
- 领先的 纯视觉深度估计模型(如 DPT、ZoeDepth 等)
- 通过外部视觉模型蒸馏几何信息的方案
评估维度覆盖深度预测精度(标准度量指标)、推理效率(吞吐量/延迟),以及 3D 空间推理 能力(例如基于语言查询的深度关系判断)。训练采用两阶段策略:第一阶段冻结 VLM 大部分参数仅训练深度头,第二阶段联合微调整个模型以平衡视觉与语言任务。
关键发现
- 深度精度大幅领先:在统一基准上,DepthVLM 的深度估计精度 显著优于 所有对比的 VLMs,且首次在 VLMs 上实现了与纯视觉模型相当甚至超越的水平。
- 推理高效:相较于需要逐像素查询或多次前向的 VLM 方案,单次前向即可同时生成语言输出和全分辨率深度图,推理开销接近纯视觉模型。
- 3D 推理增强:在复杂的 3D 空间关系推理任务上,本方法表现出色,表明密集几何预测与语言理解可以在单一模型内相互促进。
- 多模态能力保持:融合深度头后,模型在标准 VLM 基准(如 captioning、grounding)上的性能未发生退化。
基线对比深度解读
与现有 VLM 深度方案的本质差异:
- 之前的工作多依赖 外部专用深度模型 提供几何监督或后处理,这不仅引入 误差累积,还导致系统复杂、难以端到端优化。DepthVLM 将深度预测内化为 VLM 的原生输出通道,消除了模型间的信息损耗。
- 另一些方法试图通过 逐像素 vision-language query 或 粗粒度 token 回归 直接输出深度,但效率低下或分辨率受限。DepthVLM 的设计借鉴了检测/分割头在 LLM 上的附着方式,以极小的计算代价(轻量卷积头) 实现了高分辨率预测,且不干扰 LLM 原有的自回归推理。
工程启示:
- 轻量头设计 的可插拔性使该范式易于迁移至不同 VLM 架构(如 LLaVA、Qwen-VL)。
- 两阶段训练 是平衡新旧任务的关键:先保护语言能力膨胀新参数,再联合对齐可最大限度减少遗忘。
- 统一的室内-室外基准揭示了当前 VLMs 在几何理解上的普遍短板,为后续模型迭代提供了明确方向。
整体看,DepthVLM 为图像理解基础模型的最终统一(2D 感知 + 3D 几何 + 语言推理)迈出了关键一步,其训练和推理效率具备实际部署潜力。
行业影响
落地场景
DepthVLM 让通用 VLM 原生具备密集度量深度估计能力,可直接输出与语言推理对齐的 full-resolution 深度图。这为需要 3D 感知的产品和业务打开了低摩擦的集成路径:
- 自动驾驶与机器人:利用单目前向图像实时生成度量深度,辅助障碍物检测、可行驶区域分割与路径规划,减少对昂贵 LiDAR 的依赖。
- 增强现实(AR)与虚拟现实(VR):在移动设备上实现高效的单帧深度预测,提升虚拟物体与真实环境的遮挡一致性、光照估计和物理交互精度。
- 电商与内容平台:基于单张商品图片快速生成 3D 深度信息,支持 AR 试穿、3D 商品展示、沉浸式广告,无需专业扫描设备。
- 3D 空间推理与问答:与语言输出联合进行场景理解,可用于智能安防、空间导航、教育可视化等场景的空间锚点生成。
商业价值
DepthVLM 在成本、体验与收入三条线上均有明确提升:
- 降本:将深度估计融入已有的 VLM 推理流程,仅附加一个 轻量级深度头,避免引入额外视觉骨干网络或离线蒸馏管线,减少硬件和工程维护开销。
- 体验提升:度量深度(metric depth)可直接用于物理准确的交互,让 AR 应用更加逼真,自动驾驶决策更可靠。相比 token-level 或粗粒度深度,密集 full-resolution 输出大幅提升下游任务的精度上限。
- 增收可能:为电商、社交、媒体等平台提供从 2D 到 3D 的内容增强能力,带来新交互形态和广告形式,提高用户时长与转化率。
与现有产品/工作流的接口
集成方式低侵入、可渐进:
- 模块化即插即用:DepthVLM 的深度头可直接挂载到主流 LLM backbone(如 LLaMA 系列),与视觉编码器、投影层协同,无需修改原有 VLM 权重或训练流程。
- 统一推理 Pass:单次前向传播同时输出文本和深度图,保持原有 VLM API 接口不变,只需在输出中增加
depth_map字段。 - 与现有 3D 管线衔接:输出的度量深度可直接送入 SLAM、NeRF、3D 重建等下游模块,替换传统双目或深度传感器的数据流。
- 训练数据兼容:作者提供的 统一室内外度量深度基准 和混合数据管理策略可直接复用,降低数据工程门槛。
原文指出:DepthVLM “significantly outperforms existing VLMs with higher inference efficiency, surpasses leading pure vision models”,且代码与模型将开源,降低了企业试用和二次开发的风险。
具体 Use Case:自动驾驶感知与 AR 购物
- 自动驾驶感知 stack:现有方案通常需专用深度网络(如 MiDaS、DPT)与检测/分割模型级联,计算开销大、延迟高。DepthVLM 可在一个端到端 VLM 中同时完成目标检测、场景描述和度量深度估计,减少模型串行次数。比如,在实时推理时,视觉 token 输入 LLM 后,深度头直接输出对应的密集深度图,用于鸟瞰图(BEV)特征构建或 occupancy 预测,与现有规划模块无缝对接。
- AR 虚拟试穿:电商平台用单张衣物图片生成 3D 模型时,往往需手动标注深度或使用多视图重建。DepthVLM 可利用预训练视觉语言知识,从单帧商品图直接推理出准确的像素级深度,进而驱动布料物理模拟,使虚拟试穿效果更逼真,并保持与语言描述一致的风格理解。
局限
- **训练数据依赖与泛化边界**:DepthVLM 采用混合数据源和两阶段训练,但度量深度估计性能仍高度依赖训练数据的多样性与标注质量。室内外场景、不同传感器(LiDAR、RGB-D)带来的域差异显著,模型在面对新环境、异常光照或复杂透明表面时可能出现退化。统一基准 DepthVLM-Bench 虽覆盖室内外,但其规模与多样性可能不足以完全评估开放世界的鲁棒性。在实际部署中,需进一步验证跨域泛化能力及模型对数据分布偏移的敏感性,这对安全关键应用尤为重要。
- **多任务干扰与能力保持权衡**:DepthVLM 通过统一监督和课程学习,尝试在 VLM 中加入稠密几何预测而不损害原有视觉语言能力。然而,附加的深度头仍可能对 LLM 骨干的表示造成干扰,导致某些多模态任务(如细粒度 grounding、复杂推理)的性能下降。论文未对 VLM 原始基准进行全面回溯测试,仅给出部分定性示例,难以量化能力衰退程度。如何确保单模型内 2D 理解与 3D 重建的质量平衡,避免负迁移,仍是开放挑战。
- **推理效率与架构通用性**:DepthVLM 实现单次前向输出深度图和语言 token,效率提升显著。但该方法依赖 decoder-only 的 LLM 骨干,对于 encoder-decoder 等其他 VLM 架构的适配性未知。轻量级深度头虽参数少,输出全分辨率深度图仍需额外解码计算,可能影响低延迟在线应用。此外,深度预测质量与 LLM 规模、视觉编码器类型的关系未充分探索,限制了架构选择的最优性指导,实际部署时需平衡精度与开销。