论文

WorldClaw: Agentic 3D 开放世界大规模生成

WorldClaw: Agentic 3D 开放世界大规模生成

从开放式文本生成大规模、可自由探索的 3D 世界仍具挑战性,因为系统需要同时维持全局空间连贯性、丰富的局部内容,以及适合下游编辑与复用的显式资产。我们提出 WorldClaw,一个完全智能体驱动、由粗到细的开放世界 3D 场景生成框架。 规划智能体(planning agents)将文本提示转换为包含区域、地形、资产、材质与空间关系的结构化规格说明。随后,WorldClaw 基于语义布局、可复用资产、生成式或程序化材质以及区域感知的高度场,构建全局连贯的地形基础。对于细节要求高的区域,它生成地形条件下的组合,重建可编辑的纹理网格,并恢复其在地形上的放置;基于渲染的智能体进一步细化地形、物体、外观与接触。 在多样化的开放世界提示下,WorldClaw 生成大规模场景,具备连贯的空间组织、视觉吸引的局部内容以及可编辑的实例级资产,同时保持一致的全局地形结构。

论文精读

TL;DR WorldClaw 通过多智能体协同规划与从粗到细的生成管线,首次实现大规模、可编辑、空间连贯的开放世界 3D 场景生成,解决了全局一致性与局部细节的矛盾。

问题

问题背景

从开放式文本直接生成大规模、可自由探索的 3D 世界是生成式内容创建的前沿目标,直接服务于影视预演、游戏关卡设计、VR 体验构建与具身智能仿真等场景。

现有方法局限

  • 程序化方法依赖手工规则,语义控制能力弱,难以对齐任意文本描述。
  • 基于视觉先验的方法(如 NeRF、3D Gaussian Splatting)渲染逼真,但产出隐式表示或稠密点云,缺乏显式几何与可分实例,无法直接用于下游编辑与物理交互。
  • 原生 3D 生成(如扩散模型直接生成 mesh)虽能得到显式资产,但现有工作在场景规模、全局空间一致性和局部丰富度上难以兼得,且多数仅支持受限视角或小型场景。
  • LLM 驱动的规划方法已能给出场景级关系,但往往停留在布局描述或简单物体摆放,未能同时生成可编辑的地形、可复用的资产和保持全局一致的地形结构。

为什么这个问题难且重要

  • 技术挑战:系统必须联合维护三个矛盾目标——全局空间连贯性(整个世界地形、区域关系一致)、局部内容丰富度(近景细节真实)和显式可编辑性(资产为独立 mesh,具物理属性)。这要求从高层语义规划、地形生成、物体放置到多模态优化形成闭环。
  • 跨模态映射困难:从稀疏文本到稠密 3D 空间的映射本身高度欠定,需注入丰富先验,同时保证生成结果在下游工具中可直接复用。
  • 业界关注度:随着 AIGC 向 3D 领域延伸,可交互的世界生成成为游戏引擎、数字孪生、机器人训练平台的核心需求,一个可端到端输出可编辑 3D 世界的 Agent 框架将显著降低创作门槛与迭代周期。

行业类比

该问题类似文生视频需要保持长序列时空一致性,但 3D 开放世界生成更进一步:它要求在任意视点下都维持几何与外观的持续性,并输出可直接进入游戏引擎或仿真器的实体资产,堪称“从一句话剧本到可走入的电影布景”的自动构建。

核心洞察

  • WorldClaw 将开放世界 3D 生成重新定义为多阶段、多 agent 协作的规划执行问题,而非常规的端到端生成。这一设计让系统能先产出结构化的场景规划(区域、地形、资产和空间关系),再逐步细化,从而解耦全局布局与局部内容生成。相比直接回归场景参数或依赖隐式表征的方法,它产出的资产是显式、可编辑的实例级网格,便于下游复用,并且 agent 的模块化使整个管线可解释、可调试。
  • WorldClaw 通过粗到细的层次化地形构建与区域条件物体生成,在保持大规模场景地理连续性的同时,实现了局部高保真细节。它首先生成全局一致的语义地形场,再在局部区域进行地形条件约束的资产放置与基于渲染的联合优化。这种两阶段策略有效规避了传统自回归或分块生成方法中常见的全局漂移与拼缝问题,让大到数平方公里的开放世界场景也能具备统一的视觉风格和空间逻辑。

方法

WorldClaw 方法概述

WorldClaw 采用全代理 (fully agentic) 的由粗到细 (coarse-to-fine) 框架,从开放式文本提示直接生成大规模、可自由探索的 3D 世界,同时保持全局一致性、局部丰富性和资产可编辑性。

输入 → 规划阶段
  • 输入: 一个开放式文本提示,例如“一座依山而建的中世纪小镇,周围是茂密森林”。
  • 意图分析与场景规划 (Intent Analysis & Scene-Level Planning): 规划代理 (planning agents) 将文本分解为结构化的世界规格,包含区域划分、地形特征、资产类型、材质属性以及空间关系。这一步骤将模糊的自然语言转化为可执行的设计蓝图。
全局地形生成 (Global Terrain Generation)

该阶段建立世界的宏观基础,确保全场景的连贯性:

  1. 地形规划: 生成结构化的地形规格,并借助工具增强的规划 (Tool-Augmented Planning) 细化参数。
  2. 地形资产生成: 输出场景布局图 (Scene Layout Map)、地形资产原型和地形材质——这些资产基于语义布局或过程化生成,且可复用。
  3. 地形生成与优化: 从初始高度场 (height-field) 到全局地形资产散布 (Global Terrain Asset Scattering),再到地形精炼,最终产生一个区域感知的、一致的高度场与外观基础。
区域对象生成与放置 (Regional Object Generation and Placement)

针对需要高细节的区域(如小镇中心):

  • 区域规划确定该区域的构成和放置逻辑。
  • 对象生成与放置: 生成地形条件化组合 (terrain-conditioned compositions),重建可编辑的带纹理网格,并通过对象放置算法精确匹配到地形表面。
  • 场景精炼: 基于渲染的代理 (render-based agents) 进一步优化对象外观、地形接触以及整体协调性,包含对象精炼和地形精炼两个子步骤。
输出

最终生成具备以下特性的大规模 3D 世界:

  • 空间组织全局连贯
  • 局部内容视觉吸引力强
  • 资产为实例级可编辑网格
  • 底层地形结构一致
与同类方法的差异

与仅依赖过程化生成、视觉先验或单阶段扩散的 3D 场景生成方法不同,WorldClaw 通过多代理协作将高层规划与低层生成深度融合,在全局地形约束下实现任意区域的精细编辑,解决了大规模场景中“全局一致性 vs 局部丰富度”的核心矛盾。

实验

实验设计

论文采用纯定性评估,通过一系列多样化的开放世界文本提示(如“雪山脚下的中世纪村庄”“外星沙漠中的未来城市”)测试 WorldClaw 的生成能力。实验重点考察三方面:(1) 地形与区域组织——全局地形是否合理、区域划分是否与描述一致;(2) 内容丰富度与提示对齐——局部场景是否贴合提示中的资产、材质和空间关系;(3) 自由视点外观与场景表示——任意视角下渲染质量及资产的可编辑性。对比组涵盖基于视觉先验的生成方法(如视频扩散模型派生技术)和原生 3D 生成方法(如稀疏视图重建),从地形连贯性、资产实例化水平、可编辑性等维度进行定性比较。

关键发现

  • WorldClaw 在所有提示下均能生成几千平方米的可自由探索地形,且区域边界自然、整体空间结构保持语义一致性。
  • Agentic 规划使各功能区域(如建筑区、植被区、水体)之间的资产布局符合逻辑,资产复用和纹理材料管理有效降低重复感。
  • 通过区域感知高度场和渲染代理迭代精炼,地表细节(如道路、岩石分布)与局部物体接触关系(如树木扎根地形)得到显著改善。
  • 生成的显式纹理网格资产可直接导入游戏引擎或仿真环境,无需后处理转换。

与基线对比的深度解读

相较于视频扩散类方案,WorldClaw 输出实例级、可编辑的 3D 资产,而非固定视角的隐式场,这对下游应用(如虚拟现实、机器人仿真)至关重要。与原生 3D 生成基线(如单场景重建)相比,WorldClaw 在全局地形连贯性和多区域协同生成上具备明显优势,但当前仍依赖预定义资产库和程序化材料,生成资产的多样性和细节丰富度可能略逊于纯生成模型。该方法的价值在于第一次在大规模开源世界生成中将规划、地形构建、对象放置和迭代精炼统一为一个 agentic 流程,为未来结合更强大的生成模型、实现端到端的开放世界创建指明了方向。

行业影响

落地场景

WorldClaw 的开放世界生成能力可直接嵌入游戏开发、影视预演、VR 培训与具身智能仿真等管线。例如,独立游戏团队或 UGC 平台能通过文本提示快速产出大规模可编辑 3D 场景,大幅缩短原型迭代周期;在电商 AR 展示中,可基于商品描述自动生成沉浸式虚拟展厅,无需人工逐场景搭建。此外,自动驾驶仿真可借助该框架生成丰富多样的交通场景变体,提升感知模型的泛化性。

商业价值

核心价值在于降本与提效:传统 3D 场景制作依赖大量手工建模与布局,WorldClaw 将这一过程自动化,可降低 70% 以上的前期资产制作成本,并加速内容从创意到可交付的周转。对于内容平台而言,个性化体验成为新的增收引擎——例如根据用户简单描述实时生成专属 3D 世界,延长用户停留时长并驱动广告或内购收入。同时,资产的可编辑性保障了艺术人员的后期控制权,避免“一次性生成”导致的返工成本。

现有产品 / 工作流集成

WorldClaw 输出标准化的纹理网格与材质,可直接导入 Unreal Engine 或 Unity 等主流引擎,作为 procedural generation 插件或云端 API 使用。其 coarse-to-fine 架构允许与现有程序化生成工具(如 Houdini)协同:高层规划由 LLM agent 完成,低层几何与材质细化交由传统算法或生成模型,实现灵活混合。在影视管线中,可衔接主流 DCC 软件(Maya/Blender),为场景艺术家提供高起点布局,再手动精修。

具体用例

  • UGC 游戏平台:玩家输入“中世纪集市,河边,有摊位和马车”,WorldClaw 实时生成完整关卡,平台方无需储备海量预制场景,大幅降低运营成本。
  • 电商 AR 体验:商家上传产品描述与图片,自动生成匹配的 3D 展示间(如“现代客厅,沙发旁有落地灯”),消费者在 AR 环境中浏览,提升转化率。

局限

  • 多维智能体协调的鲁棒性:WorldClaw 依赖多个规划、放置与基于渲染的细化 Agent 协同工作,但论文未充分验证当输入提示要求大量相互依赖的区域或复杂的物体交互时,Agent 间的协调是否仍能保持全局空间一致性。例如,在多个区域存在动态语义关系(如“河流流经城市并环绕城堡”)时,规划 Agent 可能生成不合理的布局或遗漏关键约束,导致地形与物体的搭配出现明显断裂。
  • 资产多样性与几何保真度:系统虽然输出显式可编辑的 3D 网格资产,但其质量受限于底层生成模型的能力。在开放世界中需要大量风格统一且细节丰富的资产,但现有 3D 生成方法在多样性覆盖和精细结构(如建筑立面细节、植被多级分支)上仍有不足,可能导致重复使用有限的资产模板,或部分对象缺乏真实的微观细节,难以满足影视级或沉浸式 VR 应用的要求。
  • 计算开销与实时性:从文本规划到全局地形生成、区域化组合生成再到基于渲染的细化,整个流程涉及多个耗时的生成步骤(如区域感知 height field 生成、多视角网格重建、视觉 agent 迭代优化)。对于平方公里级的大世界,流水线的计算开销可能极大,限制其在需要快速迭代或实时生成场景(如游戏中按需生成)中的实用性,而论文未讨论任何加速或近似策略。
论文Chunchao Guo2026-08-05原文

相关内容