论文

WorldAct: 将整体3D世界激活为可交互的以物体为中心的场景

最近基于生成场景合成的3D世界建模系统(如 Marble 能够创建连贯且可探索的3D环境,但其输出通常是静态的整体资产,编辑性和物理交互能力有限。这限制了它们在沉浸式内容创建和具身模拟中的应用,因为生成的虚拟世界需要被主动修改和操控。 为了解决这一挑战,我们提出了 WorldAct 框架,将静态生成的3D世界转换为可编辑和可交互的场景。WorldAct 利用多模态智能体引导场景分解,识别可操作物体,重建几何对齐的物体级网格以支持交互,并通过3D修补恢复残余背景。得到的场景支持 物体级编辑、碰撞感知操控 和具身任务执行,同时保持全局场景连贯性。 实验表明,WorldAct 比原始生成场景支持更丰富的交互场景,为实现可编辑和交互式3D世界模型提供了一条实用路径。

论文精读

TL;DR WorldAct 把生成式 3D 世界的静态整体场景“激活”为可交互的对象级场景,让每个物体都能单独编辑与模拟操作,实现从只能看到可交互的跨越。

问题

问题背景

生成式 3D 世界建模(如 Marble)已能根据文本或图像提示合成大规模、空间连贯的虚拟环境,成为数字内容创作与具身仿真的基础工具。

现有方法局限

当前系统输出的场景多为整体化静态资产(monolithic static assets),存在明显局限:

  • 缺乏对象级结构:场景以不可分的隐式或体素表示存储,无法独立编辑或操作单个物体;
  • 无物理交互能力:不支持碰撞检测、刚体模拟等,难以接入仿真引擎;
  • 背景与前景强耦合:移除或修改对象时,无法自然补全缺失区域。

这导致生成的世界虽视觉可观,却在电影预览、游戏开发、机器人训练等需要动态编辑与交互的场景中难以实用。

为何困难且重要

该问题的技术挑战在于:

  1. 自主可操作对象发现:需无监督或弱监督地判别场景中哪些物体应具备交互属性;
  2. 几何一致性恢复:从整体表示中提取对象网格后,背景空洞需通过 3D 修补 保持多视角一致;
  3. 物理就绪的重建:输出网格必须满足碰撞检测等实时模拟要求,而非仅用于视觉渲染。

业界对可编辑 3D 世界模型的需求愈发迫切——从虚拟制片到 具身 AI 训练,都要求生成环境从“能看”升级为“能动”。若无法打通交互闭环,生成式 3D 将止步于场景预览,难以融入生产管线。

行业类比

与此前 2D 抠图 使照片层分离编辑类似,WorldAct 可为整体 3D 场景添加“对象感知层”,使之成为面向物理交互的可编程世界。

核心洞察

  • **静态世界激活范式** 提供了一条有别于端到端可交互生成的技术路径。现有工作如 **Marble** 等生成式 3D 世界建模系统产出的是不可编辑、无物理交互的整体资产,直接限制了其在具身仿真与沉浸式编辑中的应用。而 **WorldAct** 不修改生成器本身,仅在后处理阶段将“冻结”的视觉素材转化为由独立网格对象构成的、支持碰撞检测与动态编辑的场景。这种解耦思路让任何新涌现的 3D 世界模型都能快速获得交互能力,无需重新训练生成管道,显著降低了从可视化探索转向可操作环境的技术门槛。
  • **多模态 agent 驱动的场景解析闭环** 将高层语义判断与底层 3D 重建操作统一于一个自主决策流程。**WorldAct** 中的 agent 并非仅执行一步分割,而是通过视觉与语言联合推理发现可交互对象,再规划 **3DGS** 分割、网格重建、背景修复及对象生成等一系列几何计算步骤。这区别于以往依赖预定义类别库或手动标注的分解方案,agent 可利用通用知识(如“椅子能坐下”“杯子能拿起”)自动识别交互候选,并调度相应工具。其将具身交互所需的物理先验注入重建过程,使得最终输出的对象级场景天然适配碰撞感知操控与具身任务执行,为面向交互的 3D 内容创建提供了一种可扩展的自动化范式。

方法

输入与总体目标

WorldAct 以静态生成的 3D 世界(如 Marble 输出的单体高斯泼溅场景)为输入,这些场景虽空间连贯但缺乏对象级编辑与物理交互能力。框架的核心目标是将其解构为对象中心的可交互场景,并保留全局场景一致性。

核心模块与流程

整体管线分三个阶段执行:

1. 场景分解(Scene Decomposition)
  • 多模态智能体驱动:通过视觉-语言模型(VLM)分析多视角渲染图,自动识别场景中可交互的实体(如家具、物品),并生成结构化语义描述与区域掩码。
  • 对象级 3DGS 分割:利用智能体的语义指导,对原始 3D 高斯泼溅(3DGS)表征进行实例级分割,将选中对象的高斯点云从背景中剥离,提取为独立的对象单元。
2. 场景修复(Scene Restoration)
  • 背景补全:移除对象区域后,周围空洞需通过 3D 修补(3D inpainting) 技术恢复为合理背景。该模块保证背景的视觉连贯性,同时保持原场景的渲染质量。
  • 智能体驱动的对象生成:对被移除的每个对象,多模态智能体 指导一个 对象级 3D 生成网络 重建出几何对齐的网格(mesh)模型。生成过程利用智能体提供的语义约束,确保新对象在形状、位姿上与原始场景匹配,并具备可交互的物理属性(如碰撞体)。
3. 场景组装(Scene Assembly)

将修复后的背景场景与重建的对象网格组合,形成对象中心场景表示。每个对象均可独立选中、移动、缩放、删除,并支持碰撞检测与物理仿真,同时整体场景的渲染效果与原静态场景相当。

输出与应用

最终输出的场景支持三类交互:

  • 对象级编辑:移动、替换对象,且背景自动适配。
  • 碰撞感知操作:基于网格的物理交互,如抓取、放置。
  • 具身任务执行:可部署具身智能体进行导航、物品操作等模拟。

与同类方法的差异

相比现有 3D 世界生成系统(如 Marble)仅产出静态单体资产,WorldAct 首次引入 分解-修复-组装 的思维链,结合多模态智能体的语义理解与几何重建,在不改变原生成管线的前提下,将静态世界转换为可编辑、可交互的对象中心场景,为沉浸式内容创作和具身仿真提供了实用的后处理范式。

实验

实验设计

  • 输入场景:以 Marble 等生成式世界模型合成的静态 3D 世界为输入,涵盖多种室内/室外布局。
  • 基准对比:原始生成场景(单体、不可编辑、无物理交互)。
  • 评估维度
    1. 重建质量:分解后的物体网格与原始场景的几何一致性。
    2. 交互能力:物体级编辑、碰撞感知操控、具身任务执行的成功率。
    3. 用户研究:参与者对场景编辑与交互自然度的主观评分。
  • 评估方法:定量重建指标(论文未在摘录中给出具体数值) + 用户调研。

关键发现

  • 多模态 agent 有效发现可交互物体WorldAct 的 agent 能准确识别场景中的关键物体,并生成语义一致的分割掩码。
  • 几何对齐的物体重建:分解出的物体级 3DGS 表示转换为网格后,保持了与原始场景的空间对准,支持后续物理仿真。
  • 背景修复保持全局一致性:通过 3D inpainting 补全物移除后的空洞区域,场景整体观感不受破坏。
  • 交互能力根本性增强:转换后的场景首次支持移动、旋转、替换物体,以及基于物理的碰撞反馈和具身任务,原始静态场景完全不具备这些能力。
  • 场景连贯性:重建场景在视觉质量和布局上与原始世界高度一致,未引入明显伪影。

与基线的对比解读

原始生成世界仅作为“可浏览的资产”,而 WorldAct 将其激活为交互就绪的物体中心场景

  • 从静态到动态:让生成式世界模型从内容展示走向内容操作,直接赋能沉浸式内容创作和具身智能仿真。
  • 工程设计启示:将 多模态 agent(VLM)与几何重建管线(3DGS 分割 + 网格重建 + 背景 inpainting)结合的架构,为其他生成式 3D 表示(如 NeRF、mesh)的交互化升级提供了可复用的范式。
  • 局限性:实验中未报告定量重建指标(如 PSNR、Chamfer Distance),对比仅限于定性交互差异,未来需要补充数值对比论证重建精度。

行业影响

落地场景

WorldAct 可赋能 3D 内容创作平台游戏引擎具身智能仿真。在电商领域,商品 3D 展示从静态观察升级为对象级交互(拆解、组装、物理模拟),提升用户决策信心。游戏开发中,程序化生成的大世界经 WorldAct 分解为独立实体,用于碰撞检测与脚本化动态事件。机器人训练场景也可从纯视觉复原转为富含可抓取物的交互环境,加速 sim-to-real 数据生成。

商业价值

核心价值在于 资产复用与流程加速。传统管线中,生成式 3D 资产输出为不可拆分的单体网格,需大量人工才能用于交互。WorldAct 将自动分解与修复引入后期,将编辑周期从数小时降至分钟级。对电商而言,可交互 3D 展示相比静态图片能提升转化率与停留时长;对仿真供应商,通用交互化后端能降低定制开发成本,支撑更多下游任务(如 VLN、机械臂操控),拓展市场容量。

与现有产品 / 工作流的接口

框架输出为标准对象级网格(object-level meshes) 与恢复的背景,易于导入 NVIDIA OmniverseUnreal EngineBlender。通过提供 Python SDK 或 CLI 工具,可嵌入生成资产管线:例如在 Marble 等 3D 世界生成器后置,自动转为 USDglTF 格式的场景。辅助 Agent 接口支持自定义可交互物体列表,与现有 3D 标注工具资产管理器 对接。在电商侧,可与商品建模流水线结合,将扫描得到的单体网格自动分解为部件并填充背景,直接上线到 Web 3D 查看器。

局限

  • **依赖底层生成模型质量**:WorldAct 的分解与重建效果直接受限于输入 3D 世界的几何与外观质量。如果生成场景存在模糊区域、漂浮物或光照不一致,**代理驱动的可交互物体发现**和 **3DGS 分割**可能产生错误边界,导致对象级网格丢失细节或残留伪影。此外,背景修复(3D inpainting)在遮挡面积较大或纹理重复区域容易产生模糊填充,影响全局一致性。对于非标准化场景(如高度抽象或非刚性物体),框架的泛化能力尚未验证。
  • **代理决策的可靠性与可扩展性**:使用多模态代理(如基于 VLM 的规划)识别“可交互物体”隐含了对常识推理的依赖,这可能导致判断偏差——例如将装饰性物体误判为可交互,或忽略功能上可操作但视觉不显著的部件。代理的 prompt 设计和上下文窗口限制了同时处理的对象数量,难以直接扩展到包含数十个物体的复杂场景。此外,代理驱动的物体生成步骤若未能精确对齐物理属性(如质量、摩擦系数),后续物理交互的真实性会打折扣。
  • **对象级编辑的物理一致性边界**:虽然 WorldAct 宣称支持碰撞感知操作和具身任务,但当前工作主要关注几何重建与分割,未对物体材质属性、关节约束或动力学参数进行显式建模。例如,移除一个支撑物或改变物体姿态后,场景的稳定性与交互合理性可能被破坏。与端到端可编辑生成模型(如 CAD 式参数化生成)相比,该方法更接近后处理修复方案,编辑操作的灵活性和鲁棒性受限于初始重建精度,且实时交互性能(如帧率、碰撞检测开销)在论文中未充分量化评估。
论文Jichen Hu2026-05-15原文

相关内容