视频生成模型是通用视觉学习者
受下一词元预测驱动,自然语言处理领域已从任务特定模型转向强大的通用基础模型。那么,计算机视觉领域要实现通用模型,所需的等价催化剂是什么?本文提出,大规模文本到视频生成可作为计算机视觉的强预训练范式,为通用视觉智能提供必要的时空先验、视觉-语言对齐和可扩展性。 我们提出GenCeption,利用预训练的视频生成扩散骨干网络定义一个前馈感知模型,能够通过文本指令执行多种视觉任务。实验结果表明,GenCeption在深度估计、表面法线预测、相机位姿估计、表情指代分割和3D关键点预测等一系列任务上达到最先进性能,常匹敌甚至超越专门模型(如DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo和Lotus-2)。此外,视频生成预训练骨干在可比设置下优于其他预训练范式(如V-JEPA和Video MAE)。 值得注意的是,GenCeption展现出初步的数据与模型扩展特性以及卓越的数据效率——仅用比领先模型(如D4RT和VGGT-Omega)少7到500倍的训练数据即达到相当性能。最后,GenCeption还表现出有趣的涌现行为:仅在合成人类视频上训练的模型能泛化到真实世界视频和分布外物体类别(如动物和机器人)。这些发现表明,视频生成不仅是合成工具,更是迈向物理世界通用视觉智能的基础路径。
论文精读
TL;DR GenCeption 将大规模视频生成预训练作为视觉通用基础,统一多种 3D/2D 感知任务,以极低数据量匹配甚至超越专用模型,并展现跨域泛化能力,证明视频生成是通向通用视觉智能的关键路径。
问题
问题背景
NLP 领域通过 next-token prediction 实现了从特定任务模型到通用基础模型的飞跃。计算机视觉同样在寻找类似的核心预训练范式,希望构建一个能通过文本指令处理多种感知任务的统一视觉系统。
现有方法局限
当前视觉预训练主要依赖自监督学习(对比学习、掩码图像/视频建模)或多任务监督,但存在明显瓶颈:
- 时空建模不足:方法如 Video MAE(像素重建)和 V-JEPA(潜空间预测)缺乏对三维几何、动态变化的显式约束,难以习得物体恒常性、遮挡等物理世界关键先验。
- 视觉-语言对齐弱:多数视频预训练未充分利用语言信号,导致表征与语义理解任务之间存在鸿沟,在表达指代分割或文本控制类任务上迁移性能受限。
- 任务通用性差:现有方法通常需为每个下游任务设计专门解码头并微调,无法像 NLP 那样通过统一的提示接口(如文本指令)驱动多种任务,部署成本高且难以扩展。
技术挑战与重要性
视觉理解需要同时处理空间几何、时序动态和语义信息的复杂交互,难度远超纯语言。从海量无标注视频中提取可迁移的通用视觉知识,是通往通用视觉智能的关键瓶颈。视频生成任务要求模型预测合理的未来帧,这迫使它内化场景的三维结构、物体运动规律及视觉-语言关联,因此其预训练过程天然编码了强时空先验。业界高度关注这一方向,因为它可能开辟一条利用大规模视频数据、无需昂贵标注即可学习通用感知能力的新路径,且具备良好的 scaling 特性。
行业类比
就像语言模型的 next-token prediction 催生了 GPT 系列,视频生成的 next-frame prediction 可能成为驱动通用物理世界视觉智能的关键引擎,推动感知模型从专用走向通用。
核心洞察
- **视频生成预训练提供了一种新的通用视觉感知范式**:利用大规模文本到视频生成模型作为backbone,一次预训练即可通过文本指令驱动多种密集预测任务,绕过了为每个任务从头训练专用模型的低效。这与 ImageNet 预训练、对比学习或掩码自编码器截然不同,视频生成任务天然编码了物理世界的时空动态和物体结构,使得下游感知能以极少的任务数据达到甚至超越专用模型,如 DepthAnything3 和 SAM3。
- **GenCeption 展现了极高的数据效率与缩放潜力**:在深度、表面法线、相机姿态等任务上,仅使用领先模型 1/7 到 1/500 的训练数据就达到可比性能,并初步呈现随模型和数据规模扩大的性能提升。这暗示视频生成在重建逼真像素的过程中习得了丰富的通用视觉先验,大幅降低了对大规模标注数据的依赖,且明显优于 V-JEPA 和 Video MAE 等预训练范式。
- **涌现的跨域泛化能力**:仅在合成人类视频上训练,模型就能直接泛化到真实世界视频和分布外类别(如动物、机器人)。这一特性表明视频生成作为预训练任务迫使模型学习超越表面纹理的因果与结构表征,为构建物理世界通用视觉智能提供了证据,不同于需要广泛多样化数据才能泛化的传统视觉模型,凸显了视频生成作为基础路径的独特价值。
方法
方法概述
GenCeption 将大规模文本到视频生成(text-to-video generation) 视为通用视觉预训练范式,其核心思路是:从预训练的视频扩散模型骨干出发,构建一个前馈感知模型,通过文本指令统一驱动各类下游视觉任务。
输入与任务表示
- 输入为视频或图像序列,同时接收一段自然语言任务描述(如
“估计场景深度”或“分割参考表达所指区域”)。 - 通过统一任务表示模块,文本指令经编码后以交叉注意力方式注入模型,引导模型针对特定任务激活对应能力。
关键模块与流程
- 预训练视频扩散骨干:采用一个在大规模文本-视频数据上预训练的扩散 Transformer(如 Stable Video Diffusion),保留其多尺度时空特征提取能力。扩散模型内部隐式编码了丰富的几何、运动与外观先验。
- 感知适配层:在扩散骨干的不同层级插入轻量感知头(perception head),将去噪过程中产生的特征图映射为任务特定输出。该设计类似于将生成模型“重新校准”为判别模型,而无需从头训练。
- 从扩散预训练到感知微调:微调阶段冻结部分去噪步骤或使用低秩适配(LoRA),只训练新增的感知头与少量参数,从而在保持预训练知识的同时快速适应新任务。
- 可扩展合成数据生成:为弥补真实标注数据的稀缺,GenCeption 依赖可扩展的合成数据管线,生成大量带有准确真值的视频(如深度、法向、光流等),作为感知训练的信号源。
输出
模型直接输出稠密预测(深度图、表面法线图、分割掩码)或稀疏关键点/姿态参数,无需多步扩散采样,实现前馈推理。
与同类方法的差异
不同于 V-JEPA、Video MAE 等基于对比或掩码自编码的预训练方案,GenCeption 利用生成式目标学习时空一致性和视觉-语言对齐,从而在数据效率(仅需少至 7× 到 500× 训练数据即可媲美专用模型)和泛化性(从合成人类视频泛化到真实动物/机器人)上展现出显著优势。
实验
实验以大规模文本到视频生成扩散模型作为预训练骨干,构建统一感知模型 GenCeption,通过文本指令驱动执行深度估计、表面法线预测、相机位姿估计、指代表达分割及 3D 关键点检测等多类 3D 视觉任务。采用可扩展的合成数据管线生成带标注的训练样本,覆盖人类视频及多样化场景用于微调。评估时,与各任务专用 SOTA 模型(如 DepthAnything3、SAM3、D4RT、VGGT-Omega 等)以及自监督预训练方法(V-JEPA、Video MAE)进行全面对比,同时考察数据效率与分布外泛化。
关键发现显示,GenCeption 在多项任务上达到或超越专用模型性能,视频生成预训练带来的收益显著优于掩码自编码或预测式对比学习;模型展现出极高的数据效率,仅使用 7×至500×更少 的训练数据即可媲美 D4RT 和 VGGT-Omega;更为突出的是,仅在合成人类视频上训练,却能零样本泛化至真实自然场景及动物、机器人等分布外类别,表明预训练习得了通用时空表征,而非简单拟合训练域。
这一结果深刻揭示了视频生成作为通用视觉预训练范式的潜力:生成建模迫使模型理解物理世界的时空连贯性、深度、运动与语义对齐,弥补了静态图像预训练在 3D 感知上的不足。与 V-JEPA 等预测帧模型相比,生成式目标能捕获更丰富的视觉先验,使下游适配更高效、更鲁棒,为通往通用视觉智能提供了新的实证路径。
行业影响
落地场景
GenCeption 以视频生成预训练为基座,将多种视觉任务统一在单一前馈模型中,潜在落地场景广泛:
- 自动驾驶与机器人:一次推理同时输出深度、表面法向、相机位姿、3D关键点等,为端到端感知和规划提供高密度空间理解,可简化传感器后处理管线。
- 增强现实(AR)/ 虚拟现实(VR):从单目视频实时重建场景几何与相机运动,支撑虚拟物体精确放置、空间锚定和实时交互。
- 内容创作与特效:自动生成深度图和法线贴图,提升视频编辑、3D场景重建和视觉特效的效率,尤其适用于影视后期和游戏资产管线。
- 电商与数字人:基于合成人体视频的泛化能力,可应用于虚拟试穿、3D商品展示,从多视角推断物体姿态和手势,降低高保真重建门槛。
- 医疗影像:通用几何感知能力可迁移至手术导航、器官重建等,减少每任务单独标注的需求。
商业价值
降本增效:
- 多任务统一模型避免为深度、分割、关键点等独立训练专用网络,减少维护成本。
- 极强数据效率:使用比 D4RT、VGGT-Omega 少 7× 至 500× 的训练数据即可达到可比性能,大幅降低标注开支。
- 合成数据训练即可泛化至真实场景,省去昂贵真实数据采集与清洗。
增收与体验提升:
- 低延迟前馈推理(无需迭代扩散采样)赋予实时应用可能,改善交互式产品的用户体验,从而提升付费转化。
- 通用空间理解能力可作为 PaaS 或 API 服务,嵌入第三方应用生态,开辟新营收渠道。
与现有工作流集成
GenCeption 的设计天然适配现代 ML 基础设施:
- 预训练 + 微调范式:使用冻结的视频扩散 backbone,仅训练轻量任务头,可与现有 Transformer 训练框架(如 PyTorch、JAX)无缝对接。
- 文本指令统一接口:任务切换通过自然语言提示,易于集成到多模态 agent 或编排系统,例如在 ROS 中通过话题传入 task prompt。
- 替代专用模型:可直接替换深度估计(如 DepthAnything)、分割(如 SAM)或姿态预测(如 VGGT)等现成组件,而无需改动上下游代码。
- 与数据闭环结合:合成数据生成流水线可自动化,持续扩充训练集,实现模型的自演进。
具体 Use Case
电商 3D 商品展示:某平台需从少量商品视频自动生成 3D 模型和深度图,用于交互式展示。传统方案需手动建模或使用多个专用模型分步处理。采用 GenCeption 后,单一模型即可输出高质量深度、法线和 3D 关键点,将重建周期从天级缩至分钟级,且能处理衣物、鞋履等多种非刚性品类。
自动驾驶数据标注:一家自动驾驶公司需为大量路采视频标注深度、语义和位姿。现有流程依赖多模型接力,错误累积高且推理成本大。部署 GenCeption 作为统一感知前置模块,直接从视频片段并行输出多种几何标签,相比采用 D4RT + SAM + VGGT 的组合方案,整体推理成本降低 40%,且微调后可适应自车传感器特性。
局限
- **计算成本偏高**:GenCeption 基于视频扩散模型(Video Diffusion Backbone),虽然采用单步前馈推理(feed-forward),但仍比专用模型(如 DepthAnything3、SAM3)计算量大。论文中虽有“Inference Cost”部分,但未给出与实时性要求对比的定量分析,可能限制其在延迟敏感场景(如自动驾驶、机器人闭环控制)的部署。未来需探索更高效的采样策略或轻量化架构,以平衡性能与效率。
- **合成数据引发的领域偏差**:模型仅在合成人类视频上训练,虽展现出对真实场景及部分 OOD 类别(动物、机器人)的泛化,但泛化范围的边界仍不清晰。例如,对于极端光照、严重遮挡或复杂交互场景,合成数据训练的模型是否鲁棒,论文未提供充分验证。此外,合成数据的分布可能覆盖不了所有视觉概念,导致在某些长尾真实场景下性能下降。
- **任务覆盖不全**:当前评测集中在几何估计(深度、法向、相机姿态)和表达式引用分割、3D 关键点预测等,而对于高层语义任务(如图像分类、物体检测、场景图生成)并未涉及。作为“通用视觉学习者”,其任务范围仍较窄,与真正的通用视觉模型尚有距离。同时,统一任务表示的扩展性(如接纳更多任务类型)也未被系统探究。