VideoMDM:从2D监督走向3D人体运动生成
我们提出 VideoMDM,一种基于扩散的框架,可直接从单目视频中提取的精确2D姿态训练3D人体运动先验,无需任何3D真值。预训练的 2D-to-3D lifter 提供近似3D姿态序列作为有噪教师:这些序列被扩散,模型在3D空间中去噪,并通过重投影预测结果并与精确关键点比较,在2D空间进行监督。 在温和假设下,深度加权2D重投影损失在期望上等价于直接3D监督。我们将标准3D运动正则化器——速度一致性(velocity consistency)和过参数化表示对齐(over-parameterized representation alignment)——适应到此2D场景。与仅在推理时从2D提升到3D的方法不同,VideoMDM 在训练期间学习连贯的 3D运动流形。 在 HumanML3D 数据集上,VideoMDM 几乎缩小了与全3D监督的 MDM 的差距(FID 0.88 vs 0.54);在真实视频数据集 Fit3D 和 NBA 上,该方法生成的运动被人类一致偏好,并取得了强劲的定量结果。
论文精读
TL;DR VideoMDM 仅用单目视频的 2D 姿态训练 3D 运动扩散模型,通过深度加权重投影损失使 2D 监督在期望下等价于直接 3D 监督,无需 3D 真值即接近全监督性能。
问题
问题背景
3D人体运动生成是动画、虚拟角色和具身智能的关键技术,当前主流生成模型(如MDM、MLD)依赖大量3D动捕数据,但数据采集成本高、场景受限,难以覆盖开放域运动。业界关注从2D视频学习3D运动先验,以利用海量在野视频数据。
现有方法局限
- 训练数据瓶颈:3D数据集(如HumanML3D)规模远小于2D视频,且受限于动捕设备,难以拓展到运动、舞蹈等场景。
- 推理期提升的缺陷:主流方案先训练2D生成模型,再在推理时用预训练提升器(如MHFormer)得到3D姿态。这没有在训练中建模3D运动流形,导致时序不连贯、物理不合理,且无法端到端利用原始2D视频的丰富信息。
- 2D监督下正则化缺失:直接使用2D重投影损失训练3D生成模型,缺乏有效的3D先验约束,易产生深度歧义所致的抖动、关节断裂。现有3D运动正则项(如速度一致性、骨骼长度约束)难以直接适配到2D监督框架。
技术挑战与重要性
核心难点在于单目2D姿态的深度歧义——无数3D配置可投影到相同2D关键点,仅靠2D损失无法唯一确定3D运动;同时,运动生成还需全局时序一致性,逐帧2D预测可能加剧波动。VideoMDM 的突破在于:通过深度加权重投影损失在期望上等价于3D监督,并将3D运动正则项适配到2D设置,从而在训练中学习到连贯的3D运动流形。这一范式使利用几乎无限的2D视频训练3D生成模型成为可能,极大降低数据成本与场景泛化门槛。
行业类比
类似NeRF 从2D图像合成新视角时无需3D监督,仅靠多视图一致性端到端优化;VideoMDM 将此理念迁移到时序人体运动生成,用单目2D关键点序列“烘焙”出3D运动流形,为低成本3D内容创作开辟新路径。
核心洞察
- VideoMDM 证明了在期望意义下,深度加权的2D重投影损失等价于直接3D监督,从而突破了对3D真值的依赖。这一理论结果使得从海量无标注单目视频中学习3D人体运动先验成为可能,而此前方法大多将2D监督仅用于推理阶段的运动提升或作为辅助,无法在训练阶段塑造完整的3D运动流形。
- 通过“噪声教师”范式,VideoMDM 利用预训练的2D到3D提升器提供粗糙但多模态的3D猜测,学生扩散模型经由去噪和重投影反馈进行精炼,在不损失多样性的前提下超越了教师分布。此过程避免了对GAN等不稳定对抗训练的依赖,同时可泛化至完全无3D标注的真实视频数据集(如NBA),实现了3D生成模型训练的实用化。
方法
VideoMDM 的训练流程从单目视频中提取的2D 关键点序列出发,无需任何真实的 3D 动作标注。
输入与预处理
- 利用现成的 2D 姿态估计器从视频帧中获取准确的 2D 关节坐标。
- 通过一个预训练的 2D-to-3D lifter(基于现有单目 3D 姿态估计方法)将 2D 序列提升为带有噪声的近似的 3D 姿态序列,作为后续扩散过程的初始化。
关键模块与训练策略
- 扩散过程:模型在 3D 空间中工作。将 lifter 输出的近似 3D 序列前向加噪,再由去噪网络预测去噪后的 3D 动作。去噪网络采用 MDM(Motion Diffusion Model)类架构。
- 深度加权的 2D 重投影损失:核心创新在于监督信号来自准确的 2D 关键点,而非 3D 真值。将去噪得到的 3D 姿态重投影到 2D,与原始 2D 输入比较,并按每个关节的估计深度加权。作者证明,在温和假设下,这种损失在期望上等价于直接使用 3D 真值的监督,使得模型能从 2D 数据中学会合理的 3D 几何。
- 2D 自适应运动正则化:为弥补缺少 3D 真值导致的动作不自然问题,引入两种正则化项:
- 2D 速度一致性损失:约束相邻帧间 2D 投影点的速度平滑性,鼓励自然的时间演化。
- 动作表示对齐:利用过参数化表示(如 SMPL 姿态参数与骨架关节)之间的冗余性,要求其为同一 3D 动作提供一致的 2D 投影,增强表示一致性。
- 训练方案:整个训练只使用 2D 标签和 lifter 提供的噪化 3D 估计,端到端学习 3D 运动流形。
输出与推理
训练完成后,模型能够直接从文本描述或无条件地生成多样且自然的 3D 人体动作序列,并可通过改变引导条件控制生成。
与同类方法的差异
不同于仅在推理阶段将 2D 提升为 3D 的方法,VideoMDM 在训练过程中就构建了内在一致的 3D 运动流形,因而生成的 3D 动作在几何一致性和自然度上显著更优。
实验
实验设计
VideoMDM 在三个数据集上验证:HumanML3D(合成数据,带 3D ground truth 用于参考比较)、Fit3D 和 NBA(真实单目视频,仅 2D 关键点标注)。任务涵盖 text‑to‑3D motion、unconditional 3D generation 以及直接 从真实视频训练生成模型。基线包括:仅在推理时使用 2D‑to‑3D lifter 的方法、直接使用 lifter 输出作为 3D 监督的扩散模型,以及标准 3D 监督的 MDM。评估指标包括 FID、多样性 和 人类偏好 调研。
关键发现
- 在 HumanML3D 上,VideoMDM 的 FID 达到 0.88,几乎追平全 3D 监督 MDM 的 0.54,大幅超越其他 2D 监督基线。
- 在真实视频 Fit3D 和 NBA 上,模型学会了生成人类评委一致偏好的动作,定量结果也显著优于仅 lift 的 pipeline。
- 消融实验验证了 深度加权重投影损失 与 2D 速度正则化 的关键作用:去掉深度加权会使训练崩溃,而去除运动正则化会导致生成动作失真。
基线对比解读
VideoMDM 的核心优势在于训练阶段即构建连贯的 3D 运动流形,而非仅在推理时提升 2D 姿态。传统方法将 lifter 输出的近似 3D 序列作为 ground truth 直接训练,会引入系统性偏差;VideoMDM 利用扩散模型在 3D 空间去噪,并用可微重投影在 2D 准确关键点上监督,同时通过运动正则化保持时序一致性。这种设计让模型从带噪的 3D 教师中提炼出准确的 3D 运动先验,因此在 HumanML3D 上几乎消灭了 2D 监督与 3D 监督的性能鸿沟,在真实视频上则摆脱了对 lifter 分布的过拟合,生成动作的自然度和多样性均更优。
行业影响
落地场景
VideoMDM 通过 仅需单目视频 2D 姿态标注 训练 3D 人体运动生成模型,消除了对昂贵 3D 动捕数据的依赖。这使以下产品 / 业务直接受益:
- 虚拟人 / 数字人动画:生成自然走、跑、舞蹈等动作,用于虚拟主播、游戏 NPC、影视预演。
- AR/VR 交互:实时生成身体动作驱动虚拟化身,改善沉浸式社交与协作体验。
- 运动分析:从体育视频学习动作分布,辅助训练分析或伤愈评估。
- 电商虚拟试穿:生成模特走秀、转身等动作,丰富商品展示。
商业价值
- 降本:无需多视角相机系统或惯性动捕服,仅用普通相机拍摄视频即可构建训练数据,数据获取成本降低 1-2 个数量级。
- 增收:内容生产方(如游戏工作室、短视频平台)可快速生成大量动作资源,缩短制作周期,加速内容上线变现。
- 体验提升:在用户生成内容(UGC)场景中,允许用户用单目视频驱动 3D 形象,降低创作门槛,提升用户留存与互动。
与现有产品 / 工作流的接口
- 数据管线:只需集成 2D 姿态提取器(如 OpenPose、MediaPipe)和相机参数估计模块(视频中易得),即可从视频自动构建 {2D 关键点序列 + 相机} 训练对。
- 推理部署:训练得到的扩散模型可导出为 ONNX 或 TorchScript,集成到实时动画引擎(如 Unity、Unreal Engine)的动画蓝图,通过文本或示例条件控制生成。
- 互补性:与已有的 3D 人体参数模型(如 SMPL)或 2D→3D lifting 网络共存,VideoMDM 提供更丰富、连贯的运动先验,可替换传统动作混合或拼接模块。
具体落地用例
- 短视频平台的虚拟人舞蹈生成:创作者上传一段自拍跳舞视频,平台用 VideoMDM 从 2D 姿态中学习个人动作风格,随后用户输入节拍或文本(如“嘻哈舞”),即可生成新人物的 3D 舞蹈动画,直接用于虚拟化身视频输出。
- 电商 3D 商品展示:商家拍摄模特试穿服装的正面视频,无需多角度拍照。VideoMDM 学习该服装下的身体运动分布,生成模特走秀、旋转等动作序列,驱动 3D 人体模型自动展示商品动态效果,提升转化率。
局限
- **依赖预训练2D-to-3D提升器的质量**:VideoMDM使用预训练提升器生成的带噪声3D姿态作为训练目标,提升器本身在复杂姿态、遮挡或罕见视角下可能产生较大误差,这种误差会通过2D重投影损失间接传播至模型,导致学到的3D运动流形出现系统性偏差。论文虽通过重投影监督缓解噪声,但当提升器失败时,2D监督可能不足以纠正深度歧义,尤其在没有丰富上下文帧的情况下。
- **深度加权等价的假设在现实场景中可能不成立**:理论证明的重投影损失等价3D监督依赖于对深度估计误差的高斯假设和准确的相机参数估计,但在真实视频(如Fit3D、NBA)中,相机内参及焦距、人体绝对深度估计不准、多视角不一致等问题会破坏该等价性,尤其当深度估计的噪声非高斯或有偏时。这种脆弱性可能导致从实验室到野外场景的性能衰减。
- **生成多样性受限于源数据覆盖度**:在真实视频(如NBA、Fit3D)上训练时,模型只能从有限的2D姿态序列中学到运动流形,其多样性无法超越数据集的分布。与使用大规模3D动捕数据的方法相比,VideoMDM可能难以生成罕见或极端动作,且缺乏对多人交互、手部细节等更复杂运动模式的显式建模。实验未展示在脱离提升器分布时的泛化能力,如跨数据集零样本生成。