论文

OuroWorld: 让任意 3D 世界化作多样、无限循环的 3D Cinemagraphs

OuroWorld: 让任意 3D 世界化作多样、无限循环的 3D Cinemagraphs

近期 3D 世界模型 能生成照片级真实、可探索的场景,但时间始终静止。OuroWorld 是一个无需 mask 的框架,可将任意静态 3D Gaussian Splatting 场景转化为 3D cinemagraph:一种可从任意视角无缝循环、运动生动多样的动态场景。其流程由 vision-language model 推断合理动态,并引导 video model 合成参考视频,再将其提升并补全为多视角视频。 为从不完美的监督中学习,我们提出 Inconsistency-Robust Periodic 4DGS:其中 Fourier-series deformation field 通过构造保证循环性,而以参考视角为锚点的 Grounded Drift Field 吸收跨视角不一致。与以往局限于类流体运动的 Eulerian 方法不同,该方法能捕捉一般形变、物体运动与光照变化。 我们提出无需真值的评估,覆盖生动性、自然性、循环接缝一致性与场景质量。在 39 个重建与生成场景上,OuroWorld 优于所有基线,并在用户研究中赢得 70.8%-99.0% 的对比胜率。项目主页:https://ouroworld.userwei.com

论文精读

TL;DR OuroWorld 无需 mask 即可将任意静态 3D Gaussian Splatting 场景转化为动态、多样、无缝循环的 3D cinemagraph,通过 Fourier 形变场保证周期循环,用户研究胜率最高达 99%。

问题

背景与问题

静态 3D 场景重建已相当成熟,但生成动态可循环的 3D 世界仍是开放难题。

现有方法局限

  • 多数方法依赖 mask 指定运动区域,非 mask-free,自动化程度低。
  • 基于 Eulerian 的变形只能表示流体运动,无法处理物体形变、刚体运动或光照变化。
  • 多视角运动监督存在不一致性,导致跨视角闪烁或几何畸变。
  • 循环通常由后处理或正则项约束,缺乏硬性保证,接缝处可见跳变。

为什么难且重要

核心难点在于没有 ground-truth 动态标注,需依赖 VLM 和视频模型提供弱监督,但单视图视频的运动可能违反 3D 几何一致性;同时要求任意视角下循环无缝,对 4D 表示提出极高要求。解决该问题可大幅降低动态 3D 内容创作门槛,对游戏、虚拟制作、数字孪生等场景有实际工程价值。

行业类比:类似 2D cinemagraph 将静态照片局部动态化,本技术可将重建的静态 3D 场景自动转化为可探索的动态环境,相当于为 3D 资产添加程序化动画。

核心洞察

  • **周期性变形场与接地漂移场结合,解决伪监督下的时空一致性。** OuroWorld 使用 Fourier 级数参数化形变场,从构造上保证运动循环,这与以往 Eulerian 方法仅能处理流体运动不同;同时引入锚定在参考视角的 Grounded Drift Field 吸收多视角生成视频间的不一致,使模型能从噪声伪标签中学习。这种设计将“循环约束”和“跨视角一致性”解耦,避免了直接优化残差导致过拟合。
  • **免 mask 的全自动动态化管线降低 3D 场景激活门槛。** 利用 VLM 推断场景中可能发生的动态,驱动视频模型生成参考视频,再提升为多视角,无需任何运动 mask 或人工标注。对比先前方法(如 Gaussians-to-Life 需 2D mask 或用户指定运动区域),OuroWorld 让任意静态 3DGS 场景一键生成多样且可循环的动态,对大规模内容生成和 UGC 场景实用价值高。
  • **无真值评估协议为生成式 3D 动态任务提供基准。** 提出 vividness、naturalness、loop seam coherence、scene quality 四维指标,并设计用户研究;在缺乏 ground-truth dynamics 的前提下量化 cinemagraph 质量,填补了生成式 4D 场景评价空白。该方法在 39 个场景上取得 70.8%-99.0% 的用户偏好胜率,证明了评估的有效性和模型的优势。

方法

输入与动态生成

输入为任意静态 3D Gaussian Splatting 场景,无需任何运动掩码或手动标注。首先采用 视觉语言模型 推断场景中合理的动态类型(如树叶摇晃、水流、旗子飘动等),生成对应的动态文本提示。该提示引导一个视频生成模型合成一段循环参考视频(reference video),保证首尾帧一致,为后续提供运动先验。

多视角视频构建

将参考视频通过深度估计等步骤提升为动态点云,再基于点云驱动多视角视频生成。利用视频修复(video inpainting)技术补全不同视角下的缺失内容,得到多视角循环视频集合。这些合成视频可能存在跨视角不一致,但作为后续优化的监督信号。

Inconsistency-Robust Periodic 4DGS 优化

为从有缺陷的多视角视频中学习动态场景,提出 Inconsistency-Robust Periodic 4DGS,包含两个关键模块:

  • Periodic Deformation Field:基于傅里叶级数建模每个 3D Gaussian 的形变轨迹,通过构造保证运动在时间上无缝循环,避免训练长视频出现跳变。
  • Grounded Drift Field:锚定在参考视角,为每个高斯引入可学习的漂移向量,吸收多视角视频间的内容不一致,使最终 4D 表示在任意视角下保持空间一致。

训练时执行 Scene-View Consistent Optimization,结合扩散模型细化,逐步提升视觉效果。输出是一个可交互渲染的 4D 场景,支持任意视角、任意时刻观察,运动种类多样且可无限循环。

与先前 Eulerian 方法仅能表达流体类运动不同,本方法通过 Lagrangian 变形场可捕捉一般物体形变、刚体运动和光照变化,通用性更强。

实验

实验设计

OuroWorld 在 39 个重建与生成场景 上进行评估,覆盖 Mip-NeRF 360、HY-World 2.0、Marble、Lyra 2.0 等数据集。基线包括 Gaussians-to-Life、3D Cinemagraphy、3D-MOM、LoopGaussian。由于缺少 ground truth,论文提出无监督评估维度:vividness、naturalness、loop seam coherence、scene quality,并结合用户研究。

关键发现

  • OuroWorld 在所有基线上表现最佳,用户研究胜率 70.8%–99.0%。
  • 方法支持 一般形变、物体运动 与 光照变化,突破了之前 Eulerian 方法仅限流体运动的限制。
  • Fourier 级数变形场 通过构造保证循环无缝,Grounded Drift Field 有效吸收跨视角不一致,实现任意视角下的动态一致性。

与基线对比

  • 相比 Gaussians-to-Life 等需要 mask 或固定运动先验的方法,OuroWorld 为 mask-free,可处理任意 3D Gaussian Splatting 静态场景。
  • 在 loop seam coherence 上,周期性约束避免了伪影;在 naturalness 上,借助 VLM 推理的动态先验使运动更合理。
  • 工程启示:无监督评估协议可推广至动态场景生成任务,且 Fourier 周期场设计可借鉴到其他 4D 表示。

行业影响

落地场景

OuroWorld 可把静态 3D Gaussian Splatting 场景转为无限循环 3D cinemagraph,适用于电商 3D 商品展示、游戏/影视场景预览、虚拟展厅、数字孪生环境增强。无需 mask,自动推理合理动态(窗帘飘动、水面波纹、光照变化),适合快速生成动态背景或产品氛围视频。

商业价值

主要价值在 内容制作降本 与 体验提升。传统动态 3D 场景需手工动画或物理模拟,OuroWorld 以单参考视频驱动 + 多视图补全,自动生成可循环 3D 动态,减少美术与动画人力成本。无限循环无缝衔接提升沉浸感,可服务于广告素材 A/B 测试、实时交互展示,提高用户停留与转化。对已有静态 3D 资产(如扫描重建场景)进行“激活”,延长资产生命周期。

与现有工作流接口

输入为任意 3DGS 场景,输出为 4DGS(动态 Gaussian),可集成到现有 NeRF/3DGS 渲染管线。核心包括 Periodic 4DGS 变形场与 Grounded Drift Field,训练后导出标准 3DGS 播放器或 WebGL 查看器。推理链路:VLM 生成 dynamics prompt → 视频模型生成循环参考视频 → 多视图视频生成 → 4DGS 拟合。可与 Luma AI、Polycam、Three.js 等工具链结合,作为动态 3D 资产生成模块。

具体 use case

  • 电商 3D 商品展示:品牌上传静态 3D 扫描的商品场景,OuroWorld 自动添加环境动态(窗帘、植物摆动、光线变化),生成循环展示视频用于商品详情页或广告素材,提升点击率。
  • 游戏/虚拟制作:独立开发者或中小团队为静态场景添加氛围动态(风吹草动、水面、粒子),无需专业动画师,缩短原型迭代周期,降低动态场景制作门槛。

局限

  • **依赖外部生成模型先验**:OuroWorld 动态的合理性和多样性高度依赖 VLM 对场景的理解和视频生成模型的能力。如果 VLM 推断错误(例如把水面误判为地面),或者视频扩散模型生成的动态不自然、违反物理规律,后续的 4DGS 优化会将这些错误固化为 3D 动态。此外,当前框架缺乏用户交互控制,无法指定特定区域的运动类型或强度,限制了在需要精细编辑的应用中的可用性。
  • **多视角一致性无法完全保证**:Grounded Drift Field 通过锚定参考视图吸收跨视角不一致,但多视角视频生成本身仍然是一个欠约束问题。对于遮挡边界、透明/反射表面以及极端视角,不同视角生成的视频可能存在语义矛盾(例如同一物体在不同视角运动方向不同)。即使优化后,这些不一致可能导致渲染时出现伪影或闪烁,尤其当用户自由改变视角时。论文没有提供定量指标直接衡量多视角一致性,这可能掩盖部分失败案例。
  • **计算开销与可扩展性**:整个流程包含 VLM 推理、参考视频生成、多视角视频生成和 4DGS 优化,涉及多个大规模扩散模型的前向传递,计算成本高且耗时。对于 39 个场景的实验,可能使用了大量 GPU 资源,但论文未报告单场景端到端生成时间。这限制了该方法在实时或交互式内容创作场景中的应用,且难以扩展到大规模城市场景或高分辨率输出。
论文You-Zhe Xie2026-10-08原文

相关内容