论文

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

多模态大语言模型(MLLMs)在二维语义理解上表现出色,但缺乏内在的三维感知能力,导致在视频帧间无法保持几何与空间一致性。针对大规模三维数据的稀缺问题,提出 GeoVR 框架,仅利用二维视频序列学习几何表征,有效重构 MLLMs 的语义隐空间以解锁空间智能。 GeoVR 并非采用浅层特征混合,而是通过从预训练三维基础模型中蒸馏几何知识来重塑 MLLMs 的内部表征。这由多目标学习策略实现,包含四个互补的几何目标: 1. 估计帧间相机姿态以嵌入视角动态; 2. 回归密集深度图以锚定物理距离; 3. 预测度量尺度因子实现真实世界校准; 4. 蒸馏多尺度三维特征以对齐中间特征空间。 在这些显式物理与几何约束的引导下,模型内部表征自然形成强三维感知能力。在空间推理基准上的广泛实验表明,GeoVR 达到了最先进性能,为基础模型赋予空间智能建立了新范式。

论文精读

TL;DR GeoVR 从 3D 基础模型蒸馏几何知识,仅用 2D 视频就将多模态大模型的语义空间重构为具备 3D 意识,显著提升空间推理能力,无需依赖大规模 3D 数据。

问题

Multimodal Large Language Models (MLLMs) 在 2D 语义理解(如图像描述、视觉问答)上表现优异,但当任务涉及动态视角的视频或需要物理空间推理时,它们常出现不稳定的预测。这是因为 MLLMs 的内部表征缺乏对三维几何的稳定感知,无法在帧间保持空间一致性。

现有方法主要存在两方面局限:

  • 表征空间偏重语义:传统 MLLMs 的预训练只使用 2D 图像/视频与文本,其潜在空间仅优化语义对齐,忽略了对相机位姿、深度、尺度等物理约束的编码。导致模型在面对视角变化时,无法建立跨帧的刚体变换与深度关系,几何一致性差。
  • 3D 知识引入方式浅层:先前尝试如特征混合或附加3D token,仅在表层注入几何信息,未能从内部重塑 MLLM 的表征结构,语义与几何知识未能深度融合,对高层空间推理提升有限。

该问题的难点与重要性在于:

  1. 数据瓶颈:大规模 3D 标注(如点云、深度真值)获取成本极高,而海量 2D 视频数据易于收集,如何仅凭 2D 序列蒸馏出有效的几何表征是经济可行的技术路径。
  2. 多目标平衡:模型需同时满足相机位姿估计、稠密深度回归、尺度校准和特征对齐等显式几何约束,且不能破坏原有的语义理解能力,训练设计复杂。
  3. 产业需求迫切:具身智能、自动驾驶、AR/VR 等领域要求模型具备实时空间感知,赋予基础模型 3D 意识是打通虚拟与物理世界的先决条件,相关研究正成为多模态学习的新焦点。

类比来看,这如同给一个仅通过照片理解世界的平面视觉系统,附加一套从监控视频中自主恢复三维场景结构的“空间引擎”,使其在导航或交互时不再因视角变化而迷失。

核心洞察

  • **从2D视频中蒸馏3D几何先验,无需显式3D标注即可重塑MLLM的语义潜在空间**。 与现有方法直接注入3D特征或依赖昂贵3D数据不同,GeoVR通过多目标学习将预训练3D基础模型的几何知识迁移到2D语义空间中,使MLLM在只看到2D像素的情况下自然形成深度、位姿和尺度等物理约束。这种表示层面的重塑比附加单独几何模块更高效,解决了大模型大规模3D预训练的数据瓶颈。
  • **四重互补几何目标协同训练,实现跨帧三维一致的世界建模**。 以往工作通常孤立地处理单帧深度或相对位姿,GeoVR同时约束相机位姿动态、稠密深度、度量尺度和多尺度特征对齐,迫使MLLM在不同视点下维持场景的欧几里得结构。这种联合约束使得模型内部的几何表征不再是零散的猜测,而是可跨帧迁移的全局一致三维理解,显著提升了视频时空推理的鲁棒性。

方法

输入与整体流程

GeoVR 接收视频片段作为输入,利用 MLLM 自身的视觉编码器提取逐帧 2D 特征,同时并行调用一个冻结的3D 基础模型教师(如 3D 重建或点云预训练网络)获取多尺度几何特征作为监督信号。训练过程无需任何显式 3D 标注数据,仅依赖视频帧间的运动视差和光度一致性。

关键模块与多目标学习

框架在 MLLM 内部特征空间中并行施加四个几何约束,逐步重塑其表示:

  • 相机位姿估计:在视觉 token 序列上附加一个轻量 head,回归相邻帧间的相对位姿(旋转+平移),迫使模型理解不同视角下的场景变换关系。
  • 密集深度图预测:对每帧独立预测像素级深度,通过回归真实几何深度的伪标签(由 3D 教师或运动恢复结构初始化)来锚定物理距离。
  • 度量尺度校准:预测一个全局尺度因子,将归一化深度映射到真实度量单位,解决纯视觉方法常见的尺度歧义问题。
  • 几何表示对齐:在 MLLM 的中间特征层与教师网络的多尺度 3D 特征之间施加蒸馏损失,直接拉近两者的特征分布,使 MLLM 内部隐式编码 3D 结构信息。

以上四个目标以加权求和方式联合训练,不需要修改原始 MLLM 的架构,仅在训练时增加少量预测头。推理时,这些辅助头可丢弃,而模型已内化几何感知能力。

输出与空间智能

经过多目标几何蒸馏后,MLLM 的潜在空间被重构,表现出跨帧的几何与空间一致性,在空间推理任务(如 3D 定位、深度排序、视角不变的理解)上显著优于仅用 2D 语义训练的基线。

与同类方法的差异

与现有工作如 3D-LLM 直接注入点云特征或 LL3DA 利用 3D 场景图不同,GeoVR 完全基于 2D 视频学习,通过内部特征蒸馏而非表面特征混合重塑 MLLM 的表示空间,使其在缺乏 3D 数据的情况下也能获得强几何感知能力。

实验

实验设计

GeoVR 通过多目标学习将 预训练 3D 基础模型 的几何知识蒸馏至 MLLM,仅使用 2D 视频序列作为输入。训练包含四个互补的几何目标:

  • 估计帧间相机姿态以编码视角动态
  • 回归密集深度图以锚定物理距离
  • 预测 度量尺度因子 实现真实世界校准
  • 对齐多尺度 3D 特征以重塑中间表示空间

模型在多个 空间推理基准 上评估,并与现有 MLLM 方法对比,验证其几何感知能力。

关键发现

GeoVR 成功将 3D 感知 注入 MLLM 的语义潜在空间,使模型内在表示在视频帧间保持几何与空间一致性。即使未曾使用大规模 3D 数据,仅靠 2D 视频和几何蒸馏,模型也能在动态视点变化场景下展现出鲁棒性。这种 隐式 3D 重构 源于多目标学习的协同作用:相机姿态估计提供帧间运动线索,深度图回归赋予场景结构,度量尺度校准连接像素与真实距离,特征对齐迫使中间层编码 3D 信息。实验表明,模型不仅在下游任务中达到 SOTA,其内部表示也自发形成了对 3D 场景的理解。

基线对比与解读

与仅用语言监督预训练的 2D MLLM 相比,GeoVR 的核心差异在于 物理约束驱动 的表示学习。传统模型依赖语义对齐,缺乏对空间一致性的显式建模,在需要跨帧推理的任务中表现脆弱。GeoVR 通过蒸馏 3D 基础模型的特征,将深度、尺度和姿态等物理量作为训练信号,迫使 MLLM 的中间层反映场景几何。这种 深度蒸馏+姿态估计+尺度校准 的组合超越了过往浅层特征融合方案,从本质上改变了模型对视频的理解方式——不再是将帧视为孤立图像,而是将视频视为连续 3D 场景的采样。由此,其在空间推理基准上的领先幅度验证了提供几何先验对基础模型空间智能的必要性。

行业影响

落地场景

GeoVR 为多模态大语言模型注入 3D 感知 能力,可直接改进对空间一致性要求高的产品。典型场景包括:

  • 视频平台内容理解:自动识别视频中物体相对位置与物理违规(如人物漂浮),提升审核与推荐质量。
  • AR/VR 应用:实时构建环境几何,支撑虚拟物体与真实世界自然交互。
  • 机器人操作:理解自然语言指令中的空间关系(“把杯子放在桌子左边”),增强泛化能力。
  • 自动驾驶:视频问答中精确推理距离与运动轨迹,提高解释性。

商业价值

  • 降本:用大量已有 2D 视频替代昂贵的 3D 扫描数据训练空间智能模型,大幅降低数据采集与标注开销。
  • 增收:在 电商虚拟试穿/家居摆设 中,提升商品与场景的几何匹配精度,减少因空间不适配导致的退货,提高转化率。
  • 体验提升:为智能助手、教育应用提供 物理真实的空间对话,增强用户粘性与满意度。

与现有产品/工作流的接口

模型输出 相机位姿、深度图、尺度因子与对齐的 3D 特征,可作为轻量级几何编码器插入现有多模态推理管线。集成方式如:

  1. LLaVA-NeXT 或 Video-LLaMA 的视频处理分支中,用 GeoVR 编码器替换原有 2D 编码器,提供帧级几何表征。
  2. 通过 API 将视频帧送入 GeoVR 服务,下游 MLLM 接收增强的 token 嵌入,无需改动语言模型部分。

具体落地用例

  • 电商家居 AR:用户上传房间视频,GeoVR 重建 3D 空间,推荐合适尺寸的家具并实时渲染,确保摆放效果符合物理约束,避免悬浮或穿模。
  • 自动驾驶视频监控:车舱助手分析行车记录视频,回答“前方危险物距离多远?” GeoVR 提供度量深度,支撑安全决策。

局限

  • **对 3D 基础模型的依赖**:GeoVR 的知识蒸馏高度依赖预训练的 3D 基础模型(如 DUSt3R)提供相机姿态、深度图和 3D 特征监督,这些教师模型的精度与泛化能力直接影响蒸馏效果。当视频内容超出教师模型的分布(如低纹理、动态模糊或极度非朗伯表面),伪标签噪声会注入几何表示,导致空间推理退化。此外,若未来出现更优的 3D 模型,当前蒸馏框架可能需要重新适配,这引入了外部演进风险。
  • **视频数据的需求与训练开销**:方法虽声称仅需 2D 视频,但其多目标学习需要帧间相机外参、稠密深度图和度量尺度真值,这些信号通常仍需通过 SfM 或深度传感器离线获取,并非纯粹的无监督。视频序列的批处理、多尺度特征对齐和四头损失计算显著增加训练时间和 GPU 内存,可能限制在更大规模 MLLM 上的部署。此外,模型在静态图像上的零样本 3D 感知能力未充分验证,对单帧输入的泛化存在不确定性。
  • **评估范式与真实场景的差距**:实验主要集中在标准空间推理基准(如 3D 问答、视觉定位)上,这些基准的物体分布和交互方式相对单一。实际空间智能系统往往需要处理动态场景重建、物理交互推理或跨多个不连续视角的长期一致性,而 GeoVR 的评估未涵盖这些复杂维度。另外,度量尺度因子的预测仅在有限室内外场景中测试,其工程鲁棒性(如对尺度歧义场景的失效模式)仍需更多消融分析和野外验证。
论文Haibo Wang2026-06-04原文

相关内容