论文

视频生成模型作为几何学习者

视频生成模型作为几何学习者

近期基于生成模型的几何估计方法通常改编预训练的图像扩散模型,并将任务视为图像条件下的生成。利用现成的图像扩散模型,它们要么(i)独立训练任务特定的几何模型(用于深度和表面法线估计),错失了探索这些几何目标内在相关性的机会;要么(ii)联合微调修改后的图像扩散主干(例如,改变自注意力),这通常需要大量标注数据。 为以原则性方式克服这些限制,我们重新利用预训练的视频生成模型,将其作为统一的、数据高效的几何估计框架,创新性地将任务形式化为下一帧预测。我们的方法 GeoNeXt 继承了视频模型中自然结构化的知识和更丰富的先验,并进一步适配它们以实现图像与几何目标的联合建模(图像 <- 几何),从而更数据高效且有效地学习几何。 大量实验验证了我们的方法在跨多样数据集的零样本单目深度估计和表面法线估计上的性能,超越了先前任务特定的和统一的生成式竞争者,同时使用的训练数据大幅减少。值得注意的是,我们的方法可与在超过 100 倍数据上训练的判别式最先进方法相媲美,甚至在几个基准上表现突出。

论文精读

TL;DR 复用预训练视频生成模型,将几何估计转化为下一帧预测任务,联合输出深度与法向,仅需极少标注数据即可超越此前生成式方法、逼近百倍数据训练的判别式SOTA。

问题

问题背景: 单目 3D 几何估计(深度与表面法线)是 3D 视觉基础任务,在自动驾驶、3D 重建、逆向渲染等场景有广泛应用。近年来,生成式范式将几何估计视为图像条件下的生成任务,利用大规模预训练扩散模型提升零样本泛化能力。

现有方法局限:

  • 任务特定独立训练:分别训练深度模型和法线模型,割裂了 depth 与 surface normal 之间的几何一致性(例如 normal 可视为 depth 梯度的规范化),无法共享跨目标的结构先验。
  • 联合微调图像扩散骨干:通过修改自注意力机制实现联合建模,但图像扩散先验与几何输出存在显著模态差异,通常需要大量配对标注数据才能有效适配,数据成本高。

为什么这个问题难/重要: 单目几何恢复本身病态,需从单张图推断 3D 结构,依赖强先验。不同几何目标虽相互关联,但联合建模难以直接优化,且现有生成式方法对标注数据需求量大,制约了实际部署。工业界高度关注数据效率与零样本泛化,尤其在缺乏大规模 3D 标注的低资源场景。

行业类比: 类似 世界模型 将下一帧预测用于学习物理规律,GeoNeXt 把几何估计转化为 next-frames prediction,用视频生成先验替代昂贵的 3D 监督,为低标注场景提供新思路。

核心洞察

  • 将几何估计重新表述为视频模型中的下一帧预测任务,可以复用视频生成模型从大规模视频数据中学习到的时序一致性和三维结构先验。与图像扩散模型仅从单帧条件生成几何图不同,这种形式天然要求模型理解帧间几何对应关系,从而在仅使用少量标注几何数据微调时,就能获得有效且鲁棒的深度和表面法线估计,数据效率远超现有生成式方法。
  • 通过把深度和表面法线编码为连续的“未来帧”,GeoNeXt 能够在单一视频生成骨干中统一建模多个几何目标,利用它们之间的内在相关性实现联合学习。相比此前方法要么为每个任务独立训练专用模型,要么需要修改图像扩散模型的自注意力结构并依赖大量标签,这种视频原生多帧预测方式无需架构改动,即可让模型在联合训练中共享特征,并显著降低对标注数据的依赖,同时达到与使用超过 100 倍训练数据的判别式方法相当甚至更优的零样本泛化性能。

方法

输入与生成范式

GeoNeXt 以单张 RGB 图像作为输入,将其视为视频的第一帧;需要估计的 深度图 和 表面法向图 被编码为后续帧。方法将几何估计重新定义为 next-frames prediction,从而复用预训练视频扩散模型中的时序结构先验。

关键模块

  • Latent space transformation: 将原始图像与几何目标映射到预训练视频生成模型的 latent space,使几何图与 RGB 帧共享统一表示,便于联合建模。
  • Adapted denoising U-Net: 在预训练视频扩散模型的 U-Net 基础上进行适配,保留原有时序自注意力与空间注意力,同时微调使其能够接收图像帧并预测后续几何帧。通过少量标注数据微调,模型学习 image ↔ geometry 的条件生成。
  • Joint modeling: 深度与法向在同一扩散过程中联合预测,利用几何目标间的内在相关性提升一致性。

输出与推理

推理时,给定单张图像,模型通过迭代去噪生成对应的深度图和法向图帧,无需额外后处理即可输出两种几何模态。

与同类方法差异

不同于此前基于图像扩散模型的方法要么独立训练各几何任务、要么需要大量标注数据微调修改后的骨干网络,GeoNeXt 借助视频生成模型的自然时序归纳偏置,在极少训练数据下实现统一、高效的深度与法向联合估计。

实验

实验设计

  • 在多个公开数据集上进行零样本单目深度估计与表面法线估计。
  • 对比基线包括:任务特定生成模型、统一生成模型、判别式 SOTA 方法。
  • 评估强调训练数据效率,判别式基线训练数据量多于本方法 100 倍以上。

关键发现

  • GeoNeXt 使用极少量标注数据即可超越所有生成式竞争对手(包括任务特定与统一方法)。
  • 与训练数据多 100 倍以上的判别式 SOTA 方法性能相当,并在若干基准上实现超越。
  • 联合建模深度与表面法线有助于捕捉几何目标的内在关联,提升数据效率。

对比解读

  • 相比独立训练任务特定模型,GeoNeXt 通过视频生成模型中的下一帧预测统一框架,共享结构化先验,避免重复学习通用视觉特征。
  • 相比修改图像扩散模型的自注意力进行联合微调,GeoNeXt 无需大量标注数据,得益于视频模型天然的时序一致性先验。
  • 该方法展示了视频生成模型作为几何学习器的潜力,为低数据场景下多任务几何估计提供了高效路径。

行业影响

落地场景

GeoNeXt 将预训练视频生成模型用作几何估计器,零样本预测单目深度与表面法线,可快速嵌入以下产品/业务:

  • 自动驾驶与机器人:实时从摄像头图像恢复深度图,辅助障碍物检测与 SLAM,降低对昂贵 LiDAR 的依赖。
  • AR/VR 与电商:商品图片一键生成 3D 几何信息,用于虚拟试穿、3D 商品展示。
  • 内容创作平台:短视频/图片编辑工具可自动生成深度图,实现背景虚化、3D 特效插入。

商业价值

  • 降本:利用预训练视频模型,训练数据需求大幅减少(相比判别式模型 100× 以上),显著降低标注与训练成本。
  • 体验提升:零样本泛化能力强,跨数据集无需重新训练即可获得可靠深度/法线,加快产品迭代。
  • 增收:作为即插即用的几何感知模块,可为现有视觉产品增加差异化功能,如 AR 试穿、智能修图。

与现有工作流集成

GeoNeXt 可封装为轻量推理服务,输入单张 RGB 图像,输出深度图和法线图,通过 REST API 或 SDK 接入现有 CV 流水线。在需要精细化的领域,可用少量领域数据微调,部署于边缘设备或云端 GPU。与现有图像扩散模型管线兼容,可作为预处理步骤,为 NeRF、3D 重建等下游任务提供几何先验。

典型应用案例

  1. 电商商品 3D 建模:商家上传商品图片,系统自动估计深度与表面法线,生成可交互 3D 模型,用于 AR 试穿/摆置,提升转化率。
  2. 移动端视频编辑:内容平台集成 GeoNeXt,用户拍摄视频后实时提取深度图,实现电影级景深虚化或添加 3D 贴纸,增强创作体验。

局限

  • **推理计算开销较高**:GeoNeXt 基于扩散生成模型,推理时需要多步去噪采样(通常几十步),相比单步判别式模型(如 DPT、ZoeDepth)延迟显著增加。论文未报告推理时间与显存占用,但这是生成式几何估计方法普遍面临的实际部署瓶颈,可能限制其在自动驾驶等实时场景中的应用。
  • **对预训练视频模型依赖较强**:方法性能高度依赖所选视频生成模型的质量与预训练数据分布。若视频模型在特定场景(如室内/室外、不同相机内参、动态物体)存在偏差,几何估计可能随之退化。论文仅在几个公开数据集上验证,未系统分析不同视频模型架构或预训练数据集对结果的影响。
  • **联合建模深度与法线的潜在干扰**:将深度和表面法线作为相邻帧拼接送入同一生成框架,虽然能探索几何相关性,但二者分布差异较大,可能导致相互干扰。尤其在纹理缺失或深度不连续区域,法线估计误差可能放大深度边界误差,缺乏显式几何一致性约束。
论文Haosen Yang2026-08-28原文

相关内容