Helix4D: 复杂4D网格生成
当前视频转4D方法在处理复杂拓扑变化、透明材料、薄结构和内表面时存在困难。我们提出Helix4D,一个动态网格生成框架,通过继承Trellis2的富有表现力的表示,将其从图像到3D扩展到视频条件4D生成。 我们的设计源于两个关键问题:(a) 如何使Trellis2的帧局部注意力在帧间共享信息,同时保留其在稀有案例(如透明物体和内表面)上的预训练质量;(b) 如何在不破坏预训练能力的情况下,将时间信息注入纯3D位置编码。针对(a),我们提出滑动窗口跨帧注意力,并锚定第一帧:第一帧由基础Trellis2模型生成,通过跨帧注意力让模型继承Trellis2在稀有案例上的质量。针对(b),我们提出4D时间编码,将冗余的低频空间RoPE频带重新用于时间,从而将编码从3D扩展到4D,无需额外参数。 在ActionBench和我们自建的复杂动态集上的大量实验表明,Helix4D能有效生成高质量动态网格。
论文精读
TL;DR Helix4D 将 Trellis2 适配为视频到 4D 生成,通过跨帧注意力锚定第一帧保持罕见案例质量,并复用空间 RoPE 频带作为时间编码,实现复杂动态网格生成。
问题
视频到 4D(动态 3D)生成是视觉与图形学的核心前沿,旨在从单目视频重建可运动的 3D 模型,直接服务于动画、虚拟现实与机器人仿真。
现有方法大致分为三类:
- 推理时优化:需对每个视频单独优化,计算开销大,泛化性弱。
- 多视图视频重建:依赖多相机同步输入,单目场景下质量骤降。
- 前馈扩散模型:将图像到 3D 扩散模型扩展到时域,但在 复杂拓扑变化(如流体、形变)、透明材质、薄结构 上表现不佳,根源在于帧间注意力孤立、时间信息注入粗暴,破坏了预训练模型对罕见情况的建模能力。
关键难点在于 如何在不牺牲预训练高保真 3D 表示的前提下,有效融合时间一致性。以 Trellis2 为代表的帧局部注意力虽能处理透明、内表面等罕见案例,但其 3D 位置编码缺乏时域感知,直接引入额外时间参数易导致灾难性遗忘。此外,动态 mesh 生成要求同时保持拓扑可塑性、运动连贯性与表面材质真实感,这对模型的时间建模能力提出极高要求。业界对高品质动态 3D 内容的需求日益迫切(如影视特效、数字孪生、具身智能训练),推动该方向成为研究热点。
类比:将静态 3D 生成扩展为 4D 生成,如同让 Stable Diffusion 直接输出连贯视频——并非简单堆帧,而是需要在保留单帧美学质量的前提下,学会物体间的合理运动与时序演变。
核心洞察
- 静态 3D 先验与视频时序融合:Helix4D 不是从头设计视频到 4D 的模型,而是将强大的静态 3D 生成基础模型 Trellis2 升级为支持多帧联动。通过引入滑动窗口交叉帧注意力并锚定第一帧输出,模型在透明材质、薄结构等罕见情况下仍能保持预训练时的高保真度,同时实现跨帧动态一致性。这种继承式扩展策略直接针对现有视频到 4D 方法在复杂拓扑变化和内部表面上的脆弱性,为重用和适配大规模 3D 先验提供了高效范式。
- 零参数代价的时序位置编码:Helix4D 将空间 RoPE 中原本冗余的低频频段重新分配给时间维度,构建 4D 时序编码。该操作无需引入额外可训练参数,也不改变网络结构,却能无缝地将纯 3D 位置编码扩展到 4D,且不破坏原有空间几何感知能力。相较于需要额外计算图或参数的时间嵌入方案,这种基于频率重用的方法更轻量、更兼容,为其他跨维度生成任务的可插拔适配打开了新空间。
方法
输入与骨干模型
Helix4D 以单目视频帧序列作为输入,直接生成动态 3D 网格(4D 网格)。它继承 Trellis2 在图像到 3D 生成上的强大表达能力,将原本处理单帧的 帧局部注意力(frame-local attention)Transformer 扩展为多帧一致性生成框架。Trellis2 擅长生成透明材质、内部表面等罕见结构,但其逐帧独立处理会丧失时间连贯性。
关键模块
- 滑动窗口跨帧注意力与第一帧锚定:在每一层 Transformer 块中,为每个帧引入对邻近帧和首帧的注意力。第一帧 由冻结的
Trellis2单独生成并作为高质量锚点(anchor),其key/value特征被注入后续所有帧的注意力计算。邻近帧之间的交互通过 滑动窗口 控制计算量,使得模型既能继承Trellis2的精细生成能力,又能捕捉运动与拓扑变化的时间上下文。 - 4D 时空位置编码:将
Trellis2原本用于 3D 空间的 RoPE(旋转位置编码)中冗余的低频波段重新分配给 时间维度,构造 4D 时空 RoPE。这一改动无需任何额外参数,既保留了预训练 3D 空间编码的语义,又为模型注入了时间感知能力。
输出
模型直接输出每一帧的 3D 网格,形成时间连贯的动态网格序列,可处理复杂拓扑变化、薄结构和透明物体。
与依赖推理优化或多阶段重建的方法不同,Helix4D 以 前馈方式 完成了从视频到 4D 网格的生成,通过复用预训练权重的轻量扩展,在保留
Trellis2罕见案例生成质量的同时,实现了稳定的动态建模,且无需额外训练参数。
实验
实验设计
在 ActionBench 及自建 Helix4DBench 上系统评估,后者专门针对复杂动态场景。对比基线覆盖四类主流视频到4D方法:
- 推理时优化 (如 [45,14,38,1])
- 多视图视频重建 (如 [28,24,34,15,8])
- 形状与运动分离生成 (如 [41,7,2])
- 图像到3D扩散前馈扩展 重点考察 拓扑变化、透明材质、薄结构、内部表面 等困难条件下的动态网格质量。
关键发现
- 跨帧注意力 + 第一帧锚定 机制让模型有效继承 Trellis2 预训练优势,对透明物体和内部表面等罕见情况保持高质量生成。
- 4D时序编码 复用低频空间 RoPE 频带注入时间,零新增参数,避免破坏原有3D能力。
- 模型在动态拓扑变化下仍维持帧间一致性,生成网格具备高度时空连贯性。
与基线对比深度解读
- 相比推理时优化,Helix4D 为前馈式,生成速度更快且免去逐例微调的不稳定性。
- 优于多视图重建方案:后者常因透明/内部结构导致多视图冲突,难以生成完整动态网格。
- 分离式方法缺乏精确几何约束,Helix4D 端到端生成在几何精度与运动一致性上优势明显。
- 相对于扩展图像到3D的前馈方法,创新的 跨帧注意力 与时序编码设计显著提升其对复杂动态的适应力。
行业影响
落地场景
Helix4D 可直接用于影视动画预演、游戏资产管线、AR/VR 内容生成及机器人仿真。其核心能力是从单目视频生成带有时序一致的动态 3D 网格,尤其擅长处理透明材质、薄壁结构、内表面及拓扑变化,这些是传统方法难以覆盖的 corner case。例如动画师可快速将概念视频转为可编辑的动态模型,大幅缩短原型迭代周期。
商业价值
- 降本:替代传统逐帧人工建模与动画 K 帧流程,将 4D 资产生产成本压缩至分钟级,尤其减少稀缺特效师投入。
- 体验提升:生成高保真动态模型可直接用于 UGC 平台(如短视频道具、虚拟化身),提升用户创作自由度和互动沉浸感。
- 增收:为电商 3D 商品展示、游戏皮肤市场等提供自动化动态资产供应,加速内容上线并扩大 SKU 覆盖。
与现有产品/工作流的接口
Helix4D 输出显式三角网格,可与主流 DCC 工具(Blender, Maya, Unreal Engine)无缝衔接,无需额外的隐式表面提取步骤。其 first-frame anchor 机制保证首帧与单张图片生成模型 Trellis2 的静态质量一致,可融入现有图像到 3D 流水线:
- 使用 Trellis2 生成高质静态首帧网格;
- 将视频片段输入 Helix4D,以该首帧为锚点对齐后续帧,生成动态序列;
- 导出带时序的网格序列到动画软件进行微调或直接用于引擎驱动。
具体落地 use case:
- 电商动态商品展示:卖家上传商品转动/折叠视频,自动生成可交互的 4D 模型,支持用户任意旋转缩放、查看内部结构(如背包里层、透明容器),降低退货率。
- 虚拟人动画制作:通过单目视频捕捉复杂服装动态(如裙摆飘扬、半透明纱裙),快速生成带材质和拓扑变化的动态网格,代替昂贵的光学动捕与物理仿真。
局限
- 依赖单一预训练模型:Helix4D 深度继承 Trellis2 的图像到 3D 能力,虽然通过第一帧锚定和跨帧注意力保护了预训练质量,但也将 Trellis2 在复杂拓扑、薄结构等场景的残留失败直接带入 4D 管线。若基础模型产生瑕疵,后续帧难以纠正,且跨帧注意力只能在一个有限滑动窗口内传播信息,当物体发生大幅旋转或遮挡时,远距离时间相干性可能丢失。
- 4D 编码的能力边界:将低频空间 RoPE 频带重用于时间编码虽然无额外参数,但可能只能捕获粗糙的时序演化。对于快速动作、高频变形或非刚性运动的细节,这种隐式时间表示可能不足。论文仅在 ActionBench 和自建数据集上验证,这些数据的运动复杂度是否覆盖了真实动态场景仍存疑,泛化到开放式视频输入时可能出现时序模糊或抖动。
- 动态网格的固有局限性:生成的是固定拓扑的网格序列,虽然在每帧生成时保持了几何一致性,但无法处理显式的拓扑改变(如物体分裂、融合)。论文承认对透明材料、内表面等情况的改进,但本质上还是依靠逐帧生成与后处理,真实 4D 重建中的遮挡、光照变化等问题并未直接建模,与隐式表示或 NeRF 类方法相比,在自由视角渲染和细节保真上可能仍有差距。