论文

BLARM: 通过融合潜在刚性运动基元从视频驱动 3D 物体动画

BLARM: 通过融合潜在刚性运动基元从视频驱动 3D 物体动画

BLARM 是一种前馈式视频驱动 3D 网格动画方法。给定单目视频和静态物体网格,BLARM 预测时间连贯的动画网格,其运动与视频一致。 与依赖显式绑定或直接回归高维顶点运动不同,本文采用一组紧凑的学习式时变刚性运动分量和时不变顶点-分量蒙皮权重来表示动画。这种表示无需骨架、笼子、蒙皮权重或绑定注释,即可形成低维变形空间。 BLARM 的架构通过分解的时空注意力将几何导出的变形隐变量与视频特征条件化,然后解码由预测蒙皮权重混合的刚性变换。训练时结合轨迹重建损失、熵正则化和运动感知对比学习,使其能够从单目视频中恢复紧凑且可解释的运动结构,同时生成准确且时间稳定的动画。

论文精读

TL;DR BLARM 从单目视频驱动静态 3D 网格,用可学习刚体运动基元与蒙皮权重替代显式骨架,免 rig 前馈生成时序连贯且可解释的动画。

问题

问题背景

动态 4D 资产生成 是图形学与数字内容创作的核心方向。生成式模型已能产出高质量静态 3D 物体,但使其“动起来”仍缺少成熟方案:动画需保持几何外观、时间一致性,并支持低成本编辑与控制。

现有方法局限

现有视频驱动动画方法主要存在三类问题:

  • 直接回归顶点轨迹:输出维度高,易产生抖动与伪影,且难以捕捉刚性结构运动;
  • 依赖显式 rig / 骨架:需要人工设计骨骼、cage 或皮肤权重,成本高且难以泛化到任意物体;
  • 基于运动子空间:通常需要离线优化或标注数据,无法前馈推理,且混合形状难以从单目视频中稳健恢复。

为什么难 / 重要

单目视频 缺少深度与遮挡信息,从 2D 观测推断 3D 网格运动是不适定问题;网格顶点数量大,直接建模高维形变易过拟合;时间一致性要求跨帧平滑,同时希望得到可解释的刚性部件结构。业界对自动化 4D 资产生成需求强烈,游戏、影视、虚拟人等领域需要无需大量手工 rigging 的动画管线。

行业类比

类似于 NeRF / 3D Gaussian Splatting 用神经场替代传统摄影测量重建,BLARM 试图用学习到的刚性运动基元 替代手工 rigging,让“视频驱动 3D 动画”像静态 3D 生成一样可规模化。

核心洞察

  • BLARM 的核心创新在于用可学习的刚体运动基元混合来表示网格动画,而非显式 rig 或直接顶点回归。与依赖骨架或 cage 且需要手工标注的方法相比,该表示无需任何 rigging 注释;与直接回归高维顶点轨迹的方法相比,通过少量基元和时不变的蒙皮权重将变形空间降至低维,在保持时间一致性的同时还能恢复紧凑且可解释的运动结构。这一思路将动画问题转化为学习基元变换和混合权重的优化问题,更易于训练和泛化。
  • 训练目标组合(轨迹重建、熵正则化、运动感知对比学习 (motion-aware contrastive learning))是 BLARM 能够学到紧凑且有意义运动基元的关键。仅用轨迹重建损失可能导致基元冗余或过拟合;熵正则化强制基元使用稀疏化,避免所有基元同时激活;运动感知对比学习则通过挖掘相似运动轨迹的样本对,鼓励相似动作对应相似的基元组合,从而提升在未见视频上的泛化性和时间稳定性。这种多任务损失设计与纯回归 baseline 形成明显差异。

方法

方法概述

BLARM 采用前馈网络,输入单目视频帧与静态三角网格,输出与视频动作对齐的逐帧变形网格。核心是将动画建模为少量 时变刚体运动原语 的混合,而非直接回归顶点位移。

输入与特征提取
  • 视频经过预训练视觉编码器提取帧级特征;网格通过几何编码器得到变形潜码(deformation latents)。
  • 通过 分解时空注意力(factorized spatial-temporal attention)将视频特征注入几何潜码,因式分解处理空间与时间维度,避免全量时空注意力计算开销。
运动表示
  • 学习 K 个 刚性运动分量,每个分量在每一帧预测一个刚体变换(旋转+平移)。
  • 同时预测一组 时间不变的顶点到分量权重(类似蒙皮权重),将顶点与各分量软关联。
  • 最终顶点位置由各分量变换后的位置按权重混合得到,形成低维变形空间。
解码与训练
  • 解码器从条件化潜码输出每帧刚体变换和蒙皮权重。训练时采用三种损失:
    1. 轨迹重建损失:约束顶点轨迹与视频推断的运动一致(可能通过光流或2D投影监督)。
    2. 熵正则化:促使蒙皮权重稀疏,使每个顶点主要受少数分量影响,增强可解释性。
    3. 运动感知对比学习:构造轨迹描述子,对相似运动样本拉近,不同运动拉远,提升时序一致性和泛化。
差异点

与依赖显式骨骼或笼子的方法不同,BLARM 通过端到端学习自动发现刚体运动原语,无需任何 rig 标注即可驱动任意网格动画。

实验

实验设计

实验在三个视频驱动网格动画基准上评估 BLARM:ActionBench(人体动作)、Motion80(多样物体运动)、Consistent4D(4D 一致性)。评估指标分为几何误差与外观误差两类,并与基于显式 rigging 的方法、直接回归顶点运动的方法进行对比。训练损失包括轨迹重建损失、熵正则化(促进蒙皮权重稀疏)和运动感知对比学习(增强运动区分度)。

关键发现

BLARM 无需显式骨骼、cage 或蒙皮权重标注,通过一组学习的时变刚体运动基和时不变顶点-基蒙皮权重表示动画。该低维变形空间在几何精度和时序稳定性上表现良好,同时从单目视频中恢复出紧凑、可解释的运动结构。熵正则化鼓励基元激活稀疏,对比学习利用轨迹描述符进行运动感知的样本挖掘,进一步提升了运动表示的判别性。

与基线对比解读

相比直接回归高维顶点运动,BLARM 通过刚体运动基的加权混合避免了过拟合和抖动,同时保持了变形灵活性。相较于需要显式 rig 或 cage 的方法,其学习到的蒙皮权重无需人工标注,且能自动发现合理的运动分解。实验结果表明,这种混合表示在多样物体类别上均能产生准确的动画,验证了其通用性。

行业影响

落地场景

BLARM 可直接嵌入 电商商品展示、游戏资产生成、虚拟试穿 与 UGC 内容平台。例如:商家上传一段真实旋转/摆动商品视频与对应静态 3D 模型,BLARM 前馈输出连贯动画,替代手工绑定;内容平台允许用户用手机视频驱动虚拟角色或道具,无需 rig 知识。

商业价值

  • 降本:跳过传统 rigging、蒙皮权重绘制,推理时生成动画,单资产成本从数小时降至分钟级。
  • 增收:动态商品展示可提升用户停留与转化;UGC 工具降低创作门槛,扩大内容供给。
  • 体验:动画时序稳定,减少抖动,适用于 AR 预览与实时交互。

与现有工作流接口

模型输出标准 mesh 动画,可导出 glTF/FBX,导入 Blender、Unity、Unreal 等 DCC 或引擎。推理侧为前馈网络,可封装为 GPU 微服务,输入 video + mesh 输出 animated mesh。训练需视频-轨迹配对与对比学习,但部署无需额外标注。

局限

  • **刚性运动基元**(rigid motion primitives)本质上是刚体变换的线性混合,因此难以准确表示高度**非刚性变形**(如布料褶皱、肌肉伸缩、软体形变)。虽然论文通过熵正则化试图获得紧凑基元,但该表示仍受限于混合刚体变换的线性空间,无法处理拓扑变化或局部剧烈变形,在模拟复杂物体时可能导致几何失真或运动细节丢失。这与基于隐式神经场或完全自由形变的方法相比,表达能力有所不足。
  • 训练依赖**配对的视频-网格动画数据**,此类数据获取成本高,通常来自合成渲染或受限捕捉环境,导致模型在面对真实单目视频时可能存在 domain gap。此外,论文未在大规模多样化真实视频上验证,跨类别泛化能力存疑。视频中的深度歧义、遮挡、运动模糊也会影响预测的准确性,这些因素在现有实验设置中可能未充分评估。
  • 方法需要输入的**静态对象网格**作为模板,不能同时从视频重建几何与动画,因此无法直接应用于只有视频而没有对应 3D 模型的场景。这限制了其在开放式视频驱动动画任务中的应用,而一些最新工作试图联合重建与动画。另外,推理时还需对网格进行预处理(如特征提取),增加了工程复杂度。
论文Pradyumn Goyal2026-08-31原文

相关内容