论文

Helix4D: 复杂4D网格生成

Helix4D: 复杂4D网格生成

当前视频转4D方法在处理复杂拓扑变化、透明材料、薄结构和内表面时存在困难。我们提出Helix4D,一个动态网格生成框架,通过继承Trellis2的富有表现力的表示,将其从图像到3D扩展到视频条件4D生成。 我们的设计源于两个关键问题:(a) 如何使Trellis2的帧局部注意力在帧间共享信息,同时保留其在稀有案例(如透明物体和内表面)上的预训练质量;(b) 如何在不破坏预训练能力的情况下,将时间信息注入纯3D位置编码。针对(a),我们提出滑动窗口跨帧注意力,并锚定第一帧:第一帧由基础Trellis2模型生成,通过跨帧注意力让模型继承Trellis2在稀有案例上的质量。针对(b),我们提出4D时间编码,将冗余的低频空间RoPE频带重新用于时间,从而将编码从3D扩展到4D,无需额外参数。 在ActionBench和我们自建的复杂动态集上的大量实验表明,Helix4D能有效生成高质量动态网格。

论文精读

TL;DR Helix4D 将 Trellis2 适配为视频到 4D 生成,通过跨帧注意力锚定第一帧保持罕见案例质量,并复用空间 RoPE 频带作为时间编码,实现复杂动态网格生成。

问题

视频到 4D(动态 3D)生成是视觉与图形学的核心前沿,旨在从单目视频重建可运动的 3D 模型,直接服务于动画、虚拟现实与机器人仿真。

现有方法大致分为三类:

  • 推理时优化:需对每个视频单独优化,计算开销大,泛化性弱。
  • 多视图视频重建:依赖多相机同步输入,单目场景下质量骤降。
  • 前馈扩散模型:将图像到 3D 扩散模型扩展到时域,但在 复杂拓扑变化(如流体、形变)、透明材质、薄结构 上表现不佳,根源在于帧间注意力孤立、时间信息注入粗暴,破坏了预训练模型对罕见情况的建模能力。

关键难点在于 如何在不牺牲预训练高保真 3D 表示的前提下,有效融合时间一致性。以 Trellis2 为代表的帧局部注意力虽能处理透明、内表面等罕见案例,但其 3D 位置编码缺乏时域感知,直接引入额外时间参数易导致灾难性遗忘。此外,动态 mesh 生成要求同时保持拓扑可塑性、运动连贯性与表面材质真实感,这对模型的时间建模能力提出极高要求。业界对高品质动态 3D 内容的需求日益迫切(如影视特效、数字孪生、具身智能训练),推动该方向成为研究热点。

类比:将静态 3D 生成扩展为 4D 生成,如同让 Stable Diffusion 直接输出连贯视频——并非简单堆帧,而是需要在保留单帧美学质量的前提下,学会物体间的合理运动与时序演变。

核心洞察

  • 静态 3D 先验与视频时序融合:Helix4D 不是从头设计视频到 4D 的模型,而是将强大的静态 3D 生成基础模型 Trellis2 升级为支持多帧联动。通过引入滑动窗口交叉帧注意力并锚定第一帧输出,模型在透明材质、薄结构等罕见情况下仍能保持预训练时的高保真度,同时实现跨帧动态一致性。这种继承式扩展策略直接针对现有视频到 4D 方法在复杂拓扑变化和内部表面上的脆弱性,为重用和适配大规模 3D 先验提供了高效范式。
  • 零参数代价的时序位置编码:Helix4D 将空间 RoPE 中原本冗余的低频频段重新分配给时间维度,构建 4D 时序编码。该操作无需引入额外可训练参数,也不改变网络结构,却能无缝地将纯 3D 位置编码扩展到 4D,且不破坏原有空间几何感知能力。相较于需要额外计算图或参数的时间嵌入方案,这种基于频率重用的方法更轻量、更兼容,为其他跨维度生成任务的可插拔适配打开了新空间。

方法

输入与骨干模型

Helix4D 以单目视频帧序列作为输入,直接生成动态 3D 网格(4D 网格)。它继承 Trellis2 在图像到 3D 生成上的强大表达能力,将原本处理单帧的 帧局部注意力(frame-local attention)Transformer 扩展为多帧一致性生成框架。Trellis2 擅长生成透明材质、内部表面等罕见结构,但其逐帧独立处理会丧失时间连贯性。

关键模块

  • 滑动窗口跨帧注意力与第一帧锚定:在每一层 Transformer 块中,为每个帧引入对邻近帧和首帧的注意力。第一帧 由冻结的 Trellis2 单独生成并作为高质量锚点(anchor),其 key / value 特征被注入后续所有帧的注意力计算。邻近帧之间的交互通过 滑动窗口 控制计算量,使得模型既能继承 Trellis2 的精细生成能力,又能捕捉运动与拓扑变化的时间上下文。
  • 4D 时空位置编码:将 Trellis2 原本用于 3D 空间的 RoPE(旋转位置编码)中冗余的低频波段重新分配给 时间维度,构造 4D 时空 RoPE。这一改动无需任何额外参数,既保留了预训练 3D 空间编码的语义,又为模型注入了时间感知能力。

输出

模型直接输出每一帧的 3D 网格,形成时间连贯的动态网格序列,可处理复杂拓扑变化、薄结构和透明物体。

与依赖推理优化或多阶段重建的方法不同,Helix4D 以 前馈方式 完成了从视频到 4D 网格的生成,通过复用预训练权重的轻量扩展,在保留 Trellis2 罕见案例生成质量的同时,实现了稳定的动态建模,且无需额外训练参数。

实验

实验设计

ActionBench 及自建 Helix4DBench 上系统评估,后者专门针对复杂动态场景。对比基线覆盖四类主流视频到4D方法:

  • 推理时优化 (如 [45,14,38,1])
  • 多视图视频重建 (如 [28,24,34,15,8])
  • 形状与运动分离生成 (如 [41,7,2])
  • 图像到3D扩散前馈扩展 重点考察 拓扑变化透明材质薄结构内部表面 等困难条件下的动态网格质量。

关键发现

  1. 跨帧注意力 + 第一帧锚定 机制让模型有效继承 Trellis2 预训练优势,对透明物体和内部表面等罕见情况保持高质量生成。
  2. 4D时序编码 复用低频空间 RoPE 频带注入时间,零新增参数,避免破坏原有3D能力。
  3. 模型在动态拓扑变化下仍维持帧间一致性,生成网格具备高度时空连贯性。

与基线对比深度解读

  • 相比推理时优化,Helix4D 为前馈式,生成速度更快且免去逐例微调的不稳定性。
  • 优于多视图重建方案:后者常因透明/内部结构导致多视图冲突,难以生成完整动态网格。
  • 分离式方法缺乏精确几何约束,Helix4D 端到端生成在几何精度与运动一致性上优势明显。
  • 相对于扩展图像到3D的前馈方法,创新的 跨帧注意力 与时序编码设计显著提升其对复杂动态的适应力。

行业影响

落地场景

Helix4D 可直接用于影视动画预演游戏资产管线AR/VR 内容生成机器人仿真。其核心能力是从单目视频生成带有时序一致的动态 3D 网格,尤其擅长处理透明材质、薄壁结构、内表面及拓扑变化,这些是传统方法难以覆盖的 corner case。例如动画师可快速将概念视频转为可编辑的动态模型,大幅缩短原型迭代周期。

商业价值

  • 降本:替代传统逐帧人工建模与动画 K 帧流程,将 4D 资产生产成本压缩至分钟级,尤其减少稀缺特效师投入。
  • 体验提升:生成高保真动态模型可直接用于 UGC 平台(如短视频道具、虚拟化身),提升用户创作自由度和互动沉浸感。
  • 增收:为电商 3D 商品展示、游戏皮肤市场等提供自动化动态资产供应,加速内容上线并扩大 SKU 覆盖。

与现有产品/工作流的接口

Helix4D 输出显式三角网格,可与主流 DCC 工具(Blender, Maya, Unreal Engine)无缝衔接,无需额外的隐式表面提取步骤。其 first-frame anchor 机制保证首帧与单张图片生成模型 Trellis2 的静态质量一致,可融入现有图像到 3D 流水线:

  1. 使用 Trellis2 生成高质静态首帧网格;
  2. 将视频片段输入 Helix4D,以该首帧为锚点对齐后续帧,生成动态序列;
  3. 导出带时序的网格序列到动画软件进行微调或直接用于引擎驱动。

具体落地 use case

  • 电商动态商品展示:卖家上传商品转动/折叠视频,自动生成可交互的 4D 模型,支持用户任意旋转缩放、查看内部结构(如背包里层、透明容器),降低退货率。
  • 虚拟人动画制作:通过单目视频捕捉复杂服装动态(如裙摆飘扬、半透明纱裙),快速生成带材质和拓扑变化的动态网格,代替昂贵的光学动捕与物理仿真。

局限

  • 依赖单一预训练模型:Helix4D 深度继承 Trellis2 的图像到 3D 能力,虽然通过第一帧锚定和跨帧注意力保护了预训练质量,但也将 Trellis2 在复杂拓扑、薄结构等场景的残留失败直接带入 4D 管线。若基础模型产生瑕疵,后续帧难以纠正,且跨帧注意力只能在一个有限滑动窗口内传播信息,当物体发生大幅旋转或遮挡时,远距离时间相干性可能丢失。
  • 4D 编码的能力边界:将低频空间 RoPE 频带重用于时间编码虽然无额外参数,但可能只能捕获粗糙的时序演化。对于快速动作、高频变形或非刚性运动的细节,这种隐式时间表示可能不足。论文仅在 ActionBench 和自建数据集上验证,这些数据的运动复杂度是否覆盖了真实动态场景仍存疑,泛化到开放式视频输入时可能出现时序模糊或抖动。
  • 动态网格的固有局限性:生成的是固定拓扑的网格序列,虽然在每帧生成时保持了几何一致性,但无法处理显式的拓扑改变(如物体分裂、融合)。论文承认对透明材料、内表面等情况的改进,但本质上还是依靠逐帧生成与后处理,真实 4D 重建中的遮挡、光照变化等问题并未直接建模,与隐式表示或 NeRF 类方法相比,在自由视角渲染和细节保真上可能仍有差距。
论文Jiraphon Yenphraphai2026-05-25原文

相关内容