论文

WorldSculpt: 从有根据的视频生成组合式世界

WorldSculpt: 从有根据的视频生成组合式世界

我们研究如何为包含数百个物体的杂乱场景生成组合式 3D 表示。目标是将场景表示为共享世界坐标系中一组独立物体网格的集合,以满足游戏、AR/VR、仿真和机器人等下游应用需求。这一任务在密集杂乱场景中颇具挑战性:物体相互严重遮挡,每个视角仅暴露局部几何。 基于几何的方法通常将场景重建为单一表示,并在被遮挡区域留下不完整的几何;而现有基于生成先验的组合方法大多局限于相对简单的场景。我们证明,通过将强大的单物体 3D 生成先验适配到多视角观测,可以组合式地生成包含数百个物体的复杂场景。我们以 Pixal3D 为例,扩展其多视角条件路径,使物体生成基于多个有姿态的观测。尽管模型仅在规范空间的单物体上微调,它无需任何场景级训练即可泛化到严重遮挡的大场景,证明了该范式的可行性与可扩展性。 我们进一步引入 UE-MeshyScene,一个包含数百个物体、逐物体标注和真实网格的逼真杂乱场景基准。在单物体、受控多物体和 UE-MeshyScene 评估中,我们的方法持续优于先前方法,且随着场景复杂度和遮挡增加,优势更大。最后,我们通过将生成的 3DGS 世界(如 Marble 和 HY-World 2.0)转换为组合式网格场景,展示了更广泛的适用性。

论文精读

TL;DR WorldSculpt 将单对象 3D 生成先验适配到多视图条件,在严重遮挡的杂乱场景中重建出数百个独立对象网格,无需场景级训练,并发布 UE-MeshyScene 基准。

问题

问题背景

组合式 3D 场景生成是 3D 视觉与生成模型的前沿方向,目标是将杂乱场景表示为多个独立物体 mesh 的集合,支持游戏、AR/VR、仿真与机器人等下游应用。

现有方法局限

  • 几何重建方法 (如 NeRF/3DGS) 通常输出单一场景表示,对遮挡区域无法恢复完整几何,物体之间互相遮挡导致不可见部分缺失。
  • 组合式生成方法 依赖生成先验,但现有工作大多只在简单场景(物体少、遮挡轻)上有效,难以扩展到数百个物体的密集杂乱环境。
  • 缺乏大规模、带逐物体标注和真值 mesh 的密集场景数据集,阻碍了系统评估。

为什么难/重要

  • 技术挑战:密集场景中物体严重互相遮挡,任一视角只暴露部分表面;多视角信息需要融合且保持物体身份一致性;从单物体先验泛化到场景级组合重构要求模型具备强归纳偏置。
  • 业界关注:真实应用(游戏资产自动生成、AR/VR 内容创建、机器人仿真环境搭建)急需可编辑、可交互的物体级 3D 表示,单一隐式表示难以匹配工业管线(如引擎导入、碰撞检测)。

行业类比

这类似于从视频流中自动提取可编辑的 3D 资产集合,如同将一段拍摄杂乱房间的视频直接转换为多个独立的、带材质和几何的物体模型,便于后续在游戏引擎中重新布局。

核心洞察

  • 通过将单对象 3D 生成先验与多视角观测条件相结合,可以在不进行任何场景级训练的情况下,为包含数百个物体的密集杂乱场景生成合成式网格表示。这一思路突破了传统方法在严重遮挡下只能输出不完整几何或仅适用于简单场景的局限,证明单对象先验具备足够的泛化能力来补全多视角下不可见的部分。
  • 锚点对齐的对象规范化(anchor-aligned object canonicalization)配合排列不变的视图聚合,使得多视角、严重遮挡的观测能够被映射到统一的规范空间,从而让单对象生成模型可以处理真实场景中的物体级重建。该设计将复杂的场景级问题分解为多个单对象生成任务,与之前依赖场景级训练或整体重建的方法相比,显著提升了可扩展性和鲁棒性。

方法

输入与目标

输入是一组带位姿的多视角观测图像,目标是为场景中每个对象生成独立的 mesh 模型,并放置在共享世界坐标系中。

关键模块

  1. 对象级规范对齐:对每个检测到的对象,选择 anchor view,定义 canonical cube,将多视角观测裁剪并投影到统一规范空间,形成 canonical observations,解决跨视角尺度 / 位姿不一致问题。
  2. 多视角条件生成:采用 Pixal3D 作为单对象 3D 生成先验,新增多视角条件通路。通过 multi-view feature lifting 将 2D 特征提升到 3D 表示,再用 permutation-invariant view aggregation 聚合不同视角特征,最后注入生成先验,引导对象形状与纹理生成。
  3. 训练策略:仅在单对象规范数据上微调,使用 random-view training 和 conditioning-view augmentation 提升对任意视角组合的鲁棒性。

输出与组合

推理时对场景中每个对象独立生成 mesh,利用对象位姿将其变换到共享世界坐标系,形成完整组合式 3D 场景。

与现有场景级生成方法不同,本方法不依赖任何场景级训练数据,仅用单对象先验即可扩展至数百对象且严重遮挡的场景。

实验

实验设计

  • 提出 UE-MeshyScene 基准,包含密集杂乱场景、数百个对象、逐对象标注与 ground-truth 网格。
  • 评估覆盖三个层级:单对象规范空间、受控多对象场景、以及 UE-MeshyScene 大规模场景。
  • 方法以 Pixal3D 为基础,增加多视图条件通路,利用多姿态观测 grounding 对象生成。

关键发现

  • 模型仅在单对象规范空间微调,却可泛化至数百对象的严重遮挡场景,无需场景级训练。
  • 在单对象、受控多对象、UE-MeshyScene 三项评测中一致优于既有基线,且场景复杂度与遮挡程度越高,增益越明显。
  • 方法还支持将生成的 3DGS 世界(如 Marble、HY-World 2.0)转换为组合网格场景,展现更广适用性。

基线对比解读

  • 几何重建方法通常将场景视为单一表示,遮挡区域几何不完整;本文范式以单对象 3D 生成先验加多视图条件,逐对象生成再组合,有效补全被遮挡部分。
  • 已有组合式方法受限于简单场景,而本文通过强先验的泛化能力扩展到数百对象,且无需场景级训练,证明可扩展性。
  • 与直接在场景级训练的方法相比,该范式训练成本低、数据需求少,更易迁移到新场景。

行业影响

落地场景

WorldSculpt 直接面向需要组合式3D场景 的产品线:游戏引擎(如 Unreal Engine / Unity) 的自动关卡生成、AR/VR 空间计算应用、机器人仿真环境构建、自动驾驶场景重建与增强。例如,电商平台可利用多角度商品图片自动生成独立部件网格,支持用户拆解/组合查看 或 AR 摆放;内容平台可将用户上传的杂乱房间视频转化为可编辑的对象级3D资产,用于虚拟拍摄或互动广告。

商业价值

主要降本在于大幅减少人工3D建模与场景布置 工作量。传统流程中,一个含数百物体的杂乱场景需建模师数天甚至数周手工创建,而 WorldSculpt 从多视图观测直接生成组合式网格,且无需场景级训练,可规模化扩展。同时,生成结果保持对象独立性与完整几何(即使在严重遮挡下),提升了下游应用的可编辑性与物理仿真精度,带来体验提升和新的内容形态(如可交互的产品展示、个性化虚拟空间)。

与现有产品/工作流的接口

该方法可作为神经重建与3D资产管线 的前置或后置模块:

  • 与 3D Gaussian Splatting (3DGS) 等表示结合,将隐式场景转换为显式对象网格,见论文中 Marble / HY-World 2.0 转换 demo;
  • 输出为标准网格格式(如 OBJ / FBX),可直接导入 Blender、Unreal Engine 或机器人仿真器(Isaac Sim / Gazebo);
  • 通过多视图条件注入 兼容任意具备位姿的相机序列,可集成到现有 SfM / SLAM 流程后处理;
  • 提供 项目主页 与 代码,便于算法团队快速验证与二次开发。

典型集成示例:自动驾驶仿真平台从真实街景视频流提取对象级网格,用于生成对抗性/长尾场景,提升感知模型鲁棒性;企业服务中,为数字孪生工厂构建可更新的设备级组合3D模型。

局限

  • **物体间交互与全局布局约束弱**。方法为每个对象独立生成,虽然共享世界坐标系,但未显式建模对象间支撑、碰撞、遮挡关系。在生成数百个物体的密集场景时,可能出现穿模、悬空或重复实例尺度不一致。输出为独立 mesh 集合,缺乏场景级后处理,下游游戏、仿真等应用需要额外物理校验或布局优化。与显式场景图或关系建模方法相比,WorldSculpt 在复杂交互场景的语义合理性上仍有差距。
  • **极端遮挡与检测依赖**。对于几乎完全被遮挡的物体,多视图条件提供的可见像素极少,模型主要依赖单对象先验补全,几何形状与类别可能偏离真实。此外 anchor-aligned canonicalization 依赖前置的物体检测/分割,若检测遗漏或定位偏差,误差会传播至生成阶段。论文在 UE-MeshyScene 上验证,但该数据集为合成渲染,真实场景的光照、材质、相机噪声及传感器误差未充分涵盖,跨域泛化能力存疑。
  • **缺乏场景级训练与全局一致性**。模型完全在单对象 canonical 空间微调,未使用任何场景级数据进行训练,因此跨对象一致性(如光照方向、纹理风格、尺度比例)主要依靠多视图对齐间接约束,在大规模场景中可能出现局部不协调。对生成式 3D 世界(如 3DGS)的转换依赖其渲染质量,若原始世界存在伪影或空洞,转换结果也会受影响,实际部署前需额外清理步骤。
论文Muyao Niu2026-09-04原文

相关内容