论文

Towards Consistent Video Geometry Estimation

Towards Consistent Video Geometry Estimation

本文提出 ViGeo,一个前馈基础模型,用于从视频序列恢复空间密集且时间一致的几何信息。ViGeo 基于纯 transformer 架构,无需任务特定修改,支持流式、全序列和长视频推理。核心设计是动态分块注意力,在训练时暴露于双向和因果时序上下文,测试时无需重新训练即可调整注意力模式。为提升监督质量,我们还引入一种基于补全的数据细化框架,训练视频深度补全教师模型,利用稀疏带噪标注和视频/多视角上下文,生成密集、时序连贯且几何可靠的训练目标。除深度和点图外,ViGeo 还预测表面法线。仅使用公开数据集训练,ViGeo 在在线、离线及长视频深度估计、表面法线估计和视频点图估计上达到最先进性能。

论文精读

TL;DR **ViGeo** 是统一前馈 Transformer 基础模型,通过**动态分块注意力**与**补全式数据精炼**,从单/多视频中恢复时空一致的稠密深度、表面法向量与点云,支持流式与长视频推理,仅用公开数据即达 SOTA。

问题

视频几何估计是计算机视觉的基础任务,支撑着机器人导航、增强现实、自动驾驶与视频编辑等应用,这些场景不仅要求逐帧空间精度,更需要跨长时间序列的 时序一致性

现有方法的局限

当前主流方案各自面临瓶颈:

  • 逐帧单目深度估计(如 MiDaS、DPT)缺乏跨帧约束,易产生抖动与不一致,无法直接用于三维重建。
  • 基于优化的多视角重建(如 COLMAP)依赖特征匹配与捆绑调整,在弱纹理、动态区域容易失效,且计算开销大,难以实时。
  • 时序深度模型(如 ST-CLSTM 或基于光流的传播)虽引入时间建模,但大多采用固定的因果或双向注意力,无法灵活应对在线/离线场景转换;且训练时依赖的 GT 深度通常来自稀疏或噪声标注(如激光雷达投影、SfM 稀疏点),监督信号质量不足,直接限制了模型上限。
  • 视频深度补全方法(如基于单帧或双帧的补全)缺乏长程视频上下文,难以生成真正时序连贯的稠密深度。

为什么该问题既难又重要

困难在于同时满足 空间精度长程时序一致推理可扩展性

  1. 长时间视频中,即使微小的 per-frame 误差也会累积,导致轨迹漂移与几何崩塌。
  2. 真实场景缺失稠密、准确的真值,现有监督信号多为稀疏点云或噪声 SfM 重建,模型容易学到偏差。
  3. 实际部署要求单一模型能自适应在线流式推理与离线全序列推理,而无需针对每种模式重新训练。

业界对其关注度极高——从 AR 设备的实时场景理解到自动驾驶的长序列建图,能否从单目视频中稳定恢复几何,直接决定了后续感知与交互的可靠性。

类似 面向视频的 NeRF/3DGS 重建 需要帧间一致性时,若前端的深度/点图估计存在时序抖动,后端的 radiance field 优化将难以收敛,这正是 ViGeo 试图填补的环节。

核心洞察

  • 动态分块注意力 (dynamic chunking attention) 让单一模型同时具备流式、全序列与长视频推理能力,无需重新训练或架构调整。与多数方法针对在线/离线场景分别设计或用滑动窗口、因果掩码固定模式不同,ViGeo 在训练时混合双向与因果时序上下文,测试时自适应分块大小,以统一架构覆盖多种部署需求,显著提升模型泛用性与推理灵活性。
  • 完成式数据精炼框架 (completion-based data refinement) 利用视频深度补全教师模型,从稀疏、有噪标注中生成密集且时序一致的几何监督,从而提升训练目标质量。传统方法或依赖昂贵的高精度真值采集,或直接使用稀疏/合成深度导致不可靠监督;ViGeo 通过引入多视图/视频上下文约束,让教师模型自主产生稠密、几何上更可靠的伪标签,在仅使用公开数据集的情况下达到 SOTA,大幅降低了高质量监督构建的成本与数据依赖。

方法

整体流程

ViGeo 以视频帧序列为输入,通过一个纯 Transformer 架构(无任务特定修改)统一支持流式、全序列及长视频推理,最终同时输出稠密深度图、相机坐标系下的点云图及表面法线

动态分块注意力

核心创新点是动态分块注意力(Dynamic Chunking Attention)。训练时,模型在分块后的帧段上随机切换双向注意力(捕获全局时序上下文)与因果注意力(模拟在线推理),迫使网络同时学习离线与在线模式。测试时,模型无需重新训练即可适配不同的注意力模式:

  • 全序列双向注意力:离线高精度模式
  • 流式因果注意力:实时低延迟模式
  • 分块滑动窗口 + 块间因果注意力:长视频处理模式

这种设计让模型在保持时序一致性的同时,具备了推理时的计算复杂度可控的优势。

补全式数据精炼框架

为解决真实标注稀疏且噪声多的问题,ViGeo 引入补全式数据精炼(Completion-Based Data Refinement)。该框架先训练一个视频深度补全教师模型,它以稀疏、带噪声的 SfM 标注(如 COLMAP 点云)为条件,利用视频多视图上下文生成稠密、时序一致且几何可靠的伪真值。ViGeo 随后以这些伪真值作为监督信号进行训练,有效提升输出质量。

训练目标

模型以回归方式学习,损失函数组合了深度、点云坐标及法线的L1 损失,并通过多任务同时优化,迫使网络学习内在几何关系。训练仅使用公开数据集。

与同类方法的差异

不同于依赖离线优化(如 COLMAP)或单帧重复推理的既有方案,ViGeo 首次在同一个前馈模型中同时实现了在线与离线视频几何估计,并通过数据精炼机制克服了稀疏标注的局限,无需任何特定任务的结构修改即可取得多任务领先结果。

实验

实验设计

ViGeo 在多个公开视频深度/几何估计数据集上展开评测,覆盖 在线推理离线整段推理长视频处理 三种场景,任务包括深度估计、点图估计、表面法线估计。模型基于统一的 Transformer 架构,未加入任务特定模块,使用 动态分块注意力 实现注意力模式的灵活切换。评估指标涵盖空间精度(AbsRel, RMSE)和时域一致性度量,并与主流视频深度估计方法直接比较。

关键发现

  1. 动态分块注意力 是核心使能技术:模型训练时同时接触双向与因果注意力,推理时可无重训练切换模式,从而兼容流式和整段推理。
  2. 完成式数据精炼 大幅提升训练监督质量:由视频深度补全教师从稀疏噪声标注生成密集、时间一致、几何可靠的伪真值,有效缓解标注稀缺问题。
  3. 统一多任务 能力:同一模型直接输出深度图、点图和法线图,无需多分支或额外调优。
  4. 在所有评测设定下,ViGeo 均达到 SOTA 性能,尤其长视频一致性显著优于以往方法。

与基线对比

相比此前需要单独设计时序融合模块(如 ConvLSTM、光流引导)的方法,ViGeo 凭借注意力机制本身完成时空建模,结构更简洁,精度和一致性反而更高。消融实验表明,移除动态分块注意力会导致时域一致性明显下降;去除数据精炼流程则训练效果大幅衰退,验证了监督质量的关键作用。此外,ViGeo 一次训练便可应用于在线/离线不同设定,而多数基线方法需针对推理模式重训练或微调,凸显了统一模型的工程优势。

行业影响

落地场景

ViGeo 提供了从普通视频中恢复时空一致三维几何的能力(深度图、点云图、表面法线),直接赋能多种产品与业务:

  • AR/VR 与混合现实 : 实时生成环境深度与法线,让虚拟对象与真实场景的光影、遮挡交互更自然。
  • 视频编辑与特效 : 自动提取序列深度,用于景深合成、3D 粒子追踪、一致性贴图等后期制作。
  • 自动驾驶与机器人 : 作为纯视觉的稠密几何估计器,补充 LiDAR 盲区或传感器缺失时的空间理解,提升导航鲁棒性。
  • 电商与内容平台 : 从商品旋转视频或 UGC 短视频中重建 3D 资产,驱动 AR 试穿、虚拟展厅等交互。

商业价值

ViGeo 通过统一模型降低多任务部署成本,从三条线释放商业回报:

  • 降本 : 传统视频 3D 重建依赖多步离线优化(如 COLMAP+ 深度估计融合),计算与人工成本高。ViGeo 单次前馈即可输出稠密几何,大幅缩短处理时间;其动态分块注意力支持流式处理,无需为在线/离线场景分别部署模型。
  • 增收 : 高质量、时序一致的几何估计,可提升内容生成工具(如 AI 视频剪辑)的产出质量,吸引付费订阅;在电商场景,3D 商品展示能提高转化率。
  • 体验提升 : 短视频平台可基于可靠深度实现实时背景替换、3D 贴纸等特效,增强用户粘性;AR 导航应用因几何一致而减少跳变,提升沉浸感。

与现有产品/工作流的接口

ViGeo 以纯视觉 Transformer 设计,便于集成:

  • 输入 : 支持任意帧数视频,可通过标准视频流接口传入。
  • 输出 : 逐帧深度图、点云图(相机坐标系)和表面法线图,格式可适配常见的 float32 / .exrnpy,直接对接 Blender、Nuke、After Effects 或自定义渲染管线。
  • 集成方式 :
    • 离线批处理 : 作为 CI/CD 环节的几何提取插件,替换现有 MVS 或双目深度估计模块。
    • 在线推理 : 利用因果注意力模式进行流式预测,通过 Python/C++ API 嵌入实时视频处理 SDK,输出时序稳定的几何流,供上层应用消费。
  • 与传感器融合 : 点云输出可直接投影至 LiDAR 或 IMU 坐标系,作为视觉里程计的补充。

具体落地用例

  1. 电商 3D 商品重建 : 商家用手机环绕拍摄商品视频,上传至平台后,ViGeo 实时输出时序一致的点云图,经简单后处理(泊松表面重建)生成带纹理的 3D 模型。相比传统摄影测量法,无需人工校准或密集匹配,速度提升 10 倍以上,模型成本降低 70%+。
  2. 短视频平台特效引擎 : 创作者上传舞蹈视频后,特效工具利用 ViGeo 流式输出的深度和法线,在人物周围生成动态光影和 3D 粒子,所有效果随相机运动稳定附着,不抖动。这比基于单帧深度估计的方案(帧间闪烁)在视觉一致性上显著提升,可成为专业创作者订阅服务的卖点。

ViGeo 以单一模型覆盖多任务、多推理模式,降低工程维护开销,有望成为视频几何基座模型的关键组件。

局限

  • **依赖补全教师模型**:ViGeo 的训练监督来自基于补全的深度精炼教师,教师模型本身依赖于稀疏标注和多视图上下文。在稀疏标注极度缺失或视频中出现剧烈运动模糊、强光照变化时,教师生成的伪真值可能包含误差,进而影响学生模型的几何准确性。虽然作者声称精炼框架提升了监督质量,但教师模型的可靠上限仍未充分论证,对于高精度应用(如三维重建)可能引入系统性偏差。
  • **长视频效率与泛化**:尽管动态分块注意力支持长视频处理,但分块大小与感受野的权衡需要手动设定;在数千帧级别的流式应用中,注意力缓存的内存开销和计算成本仍然是工程部署的瓶颈。此外,模型仅在公开数据集(如ScanNet、KITTI)上训练,对任意手持拍摄、运动非刚体或多镜头切换等开放域场景的泛化能力缺少系统评估,在工业级应用中可能需要大规模微调。
  • **与专用架构的差距**:ViGeo 统一了在线、离线及长视频推断,但在极端低延迟场景(如AR眼镜实时SLAM)下,其前馈Transformer的设计可能不及精心优化的轻量级RNN或状态空间模型(如Mamba)。同时,表面法线预测高度依赖深度图的几何连续性,在深度边缘模糊的区域法线质量会明显退化,而论文未提供法线估计的独立精度与现有专用法线估计方法的直接对比,其实际优势需要更多验证。
论文Zhu Yu2026-05-28原文

相关内容