VibeWorlding: 多模态智能体能否端到端构建 3D 开放世界?
从用户查询构建交互式 3D 开放世界至关重要。然而,现有方法主要在理想化、简单的查询上进行评估,难以系统分析和比较多模态智能体如何理解用户意图、使用 3D 工具、推理文本和视觉 3D 世界信息。为此,我们提出 VibeWorlding,一个用于基准测试和训练 vibe worlding 智能体的统一框架:该多模态智能体可以在多轮智能体-环境交互过程中自主推断用户意图、规划场景布局、调用 3D 工具并反思多模态反馈。 为了支撑该框架,我们首先构建 VWE-BENCH,包含 2,616 个高质量 3D 资产、323 个人工标注的种子 3D 世界、6,828 条逆向合成的多模态用户查询,分为带真实标签的已验证查询和带精心设计评分标准的未验证查询。此外,我们开发 VibeWorlding-Gym,一个联合多模态强化学习(RL)后训练框架,集成:(1) 一个沙盒环境,将资产检索、编辑和图像渲染统一为 MCP 工具;(2) 一个基于评分标准的验证器,结合物理可行性和意图满足性验证,既支持公平的模型评估,也支持可扩展的多模态 RL 奖励服务。 实验表明,当前前沿 MLLM 远未解决 vibe worlding 智能体任务,甚至 GPT-5.5 和 Qwen3.8-Max 的成功率都低于 60%,瓶颈在于精确 3D 世界编辑。我们进一步发现,RL 训练可以缓解这个弱点,并使开源 MLLM 超越闭源前沿模型:我们的 VibeWorlder-8B 可与前沿 MLLM 相当,而旗舰 VibeWorlder-30B-A3B 在所有评估模型中取得最佳整体 Pass@1。
论文精读
TL;DR VibeWorlding 搭建了端到端 3D 世界构建的基准与 RL 训练框架,让多模态智能体从用户查询直接生成可交互世界;实验表明 RL 后训练可使开源模型在 Pass@1 上超越闭源前沿,瓶颈在于精细 3D 编辑。
问题
问题背景
交互式 3D 开放世界构建(游戏场景、虚拟仿真、具身 AI 测试场)正成为生成式 AI 的重要应用方向,目标是从用户自然语言查询出发,自动生成可编辑、可交互的 3D 场景。
现有方法局限
- 评测查询过于理想化:现有方法多在简单、静态查询(如“生成一个卧室”)上评估,缺乏对复杂意图、多轮交互、混合文本-视觉反馈的系统考查,难以反映真实生产力需求。
- 缺少统一基准与训练框架:没有开源的 3D 世界构建 agent 基准和环境,无法公平比较不同多模态 agent 在规划、工具调用、反思修正等环节的能力,也阻碍了 agentic RL 后训练的研究。
- 反馈与奖励信号缺失:由于缺少可扩展的 verifier 与沙盒环境,模型无法在闭环中获得物理可行性、意图符合度等细粒度奖励,难以通过训练提升端到端构建能力。
为什么这个问题难/重要
- 技术挑战:端到端构建要求 agent 同时具备自然语言理解、空间布局规划、多工具调用(检索/编辑/渲染)、以及基于视觉反馈的自我修正能力。当前前沿 MLLMs 在精确 3D 编辑上仍存在明显瓶颈,例如修改物体位置、尺寸、朝向时缺乏细粒度空间推理。
- 工程价值:游戏开发、数字孪生、影视预演等行业对 3D 内容自动化生产有强烈需求,能从自然语言直接驱动场景迭代的 agent 将显著降低试错成本。
- 业界关注点:如何从“生成单个 3D 资产”跨越到“自主构建复杂开放世界”,并具备可评估、可训练、可复现的能力,是本方向亟待解决的系统性问题。
行业类比
类似从早期代码补全模型演进到能自主完成多文件软件工程任务的 coding agent,需要 SWE-bench 这类配套评测与 RL 环境来驱动长期决策能力提升;VibeWorlding 试图为 3D 世界构建补齐这一环,将“能生成”推进到“能自主构建并修正”。
核心洞察
- 该工作首次将 3D 开放世界构建任务形式化为多模态 agent 的端到端交互过程,并提出 VWE-BENCH 基准:通过反向合成多模态查询,将查询分为可验证(带真值)与不可验证(依赖 rubric)两类,从而系统量化 agent 的意图理解、布局规划、工具调用与反馈反思能力。与以往仅用简单理想查询评估的方法相比,这一设计暴露了真实用户查询的复杂性和歧义性,使模型间的差异可测量、可归因。
- 论文核心发现是当前最强 MLLM(如 GPT-5.5、Qwen3.8-Max)在该任务上的成功率不足 60%,且失败主要集中于精确 3D 世界编辑环节。这一瓶颈定位直接指向后续优化方向:不是意图理解或规划,而是对 3D 工具操作与视觉-空间推理的精细控制。VibeWorlding-Gym 通过 MCP 工具沙盒与基于 rubric 的双重验证器(物理可行性 + 意图满足),为这一弱项提供了可扩展的 RL 训练信号,使 8B 开源模型达到前沿闭源水平,30B-A3B 取得最优 Pass@1,证明 agentic RL 是突破该瓶颈的有效路径。
方法
输入与任务定义
VibeWorlding 将“从用户查询构建交互式 3D 开放世界”建模为多轮智能体与环境交互过程。输入为多模态用户查询(文本/图像等),输出为满足意图且物理可行的 3D 开放世界。智能体需依次完成:意图推断、场景布局规划、3D 工具调用、多模态反馈反思。
关键模块
VWE-BENCH 基准构建:通过三步流程生成评估数据。
- 高质量 3D 资产合成:获得 2,616 个资产。
- 种子 3D 世界人工标注:构建 323 个种子世界。
- 反向多模态查询合成:从种子世界反向生成 6,828 个查询,分为具备 ground-truth 的
verified queries与仅提供评估标准的unverified queries。
VibeWorlding-Gym 训练与评估环境:
- 3D 沙盒环境:将资产检索、场景编辑、图像渲染统一封装为 MCP 工具,供智能体调用。
- 双约束验证器(Dual-Constraint Verifier):结合物理可行性验证(碰撞、支撑等)与意图满足验证,既用于公平评估,也充当 RL 奖励服务。
联合多模态 RL 后训练:
- 冷启动 SFT 数据合成:利用沙盒环境与验证器生成高质量轨迹。
- 多模态 RL 训练:基于验证器奖励进行策略优化,缓解精确 3D 编辑的瓶颈。
输出与性能
实验显示,前沿 MLLM(如 GPT-5.5、Qwen3.8-Max)成功率低于 60%,误差集中在 3D 编辑精度。经过 RL 训练后,开源模型 VibeWorlder-8B 达到前沿水平,VibeWorlder-30B-A3B 取得所有模型最佳 Pass@1。
与同类方法仅评估理想化简单查询不同,VibeWorlding 提供统一基准与可扩展 RL 训练环境,并通过 RL 赋能开源模型超越闭源前沿。
实验
实验设计
研究构建了 VWE-BENCH 基准,包含 2,616 个高质量 3D 资产、323 个人工标注的种子 3D 世界、以及 6,828 个逆向合成的多模态用户查询。查询分为两类:verified queries 提供 ground-truth 结构用于客观评估,unverified queries 依赖精心设计的 rubrics 进行验证。在此基础上开发 VibeWorlding-Gym,集成 3D 沙盒(资产检索、编辑、图像渲染作为 MCP tools)和双约束验证器(物理可行性 + 意图满足),支持多模态 RL 后训练与公平评估。评估了多个前沿 MLLMs(如 GPT-5.5、Qwen3.8-Max)以及经 RL 训练的 VibeWorlder 系列模型。
关键发现
- 当前主流 MLLMs 在端到端 3D 开放世界构建任务上成功率均低于 60%,暴露出对复杂意图理解和精确 3D 编辑的不足。
- 失败案例分析表明瓶颈集中在 precise 3D world editing,而非初始布局或检索。
- 将 multimodal RL post-training 应用于开源 MLLMs 后,VibeWorlder-8B 达到与闭源前沿模型相当的水平,而 VibeWorlder-30B-A3B 取得所有模型中的最佳 Pass@1,证明 RL 能有效缓解 3D 编辑弱点。
该框架首次系统性地将 benchmark、sandbox、verifier 与 RL 训练结合,为 3D 世界构建 agent 的迭代开发提供了可复现的工程路径。
与基线对比解读
与仅使用指令微调或纯推理的前沿模型相比,RL 后训练带来的提升不仅体现在最终成功率,更体现在对工具调用的时序优化与多轮反馈利用上。VibeWorlding-Gym 的沙盒将资产检索、编辑和渲染统一为 MCP 工具,降低了模型与 3D 环境交互的工程复杂度;双约束验证器同时检查物理可行性和意图满足,避免单一指标误导。实验表明,开源模型通过 RL 可以跨越闭源模型在 3D 编辑上的性能鸿沟,这为后续在工业场景中部署低成本、可定制的 3D 世界生成 agent 提供了实证依据。
行业影响
落地场景
VibeWorlding 框架支持从自然语言查询端到端生成可交互 3D 开放世界,可应用于游戏原型设计、虚拟拍摄、电商 3D 商品展示、教育与培训模拟等。例如,电商平台可自动生成商品在多样化场景中的 3D 陈列,内容平台可提供用户自定义 3D 空间,游戏工作室可快速产出概念场景。
商业价值
直接降低 3D 内容制作成本:传统人工建模与布局耗时数天,VibeWorlder-30B-A3B 可自动完成意图理解、资产检索、场景规划与迭代编辑。同时,RL 后训练让开源模型超越闭源前沿,企业可私有化部署,避免 API 依赖。提升用户体验:个性化 3D 世界生成提升互动内容消费时长与转化率。
与现有产品/工作流接口
框架将资产检索、编辑、渲染封装为 MCP tools,可接入 Unreal/Unity 等引擎或 Blender 管线;rubric-based verifier 可集成到 CI/CD 作为质量门禁。开源 VibeWorlding-Gym 提供沙盒与奖励服务,适合企业微调自有 MLLM。
具体落地 use case
- 电商 AR 展示:输入“北欧风客厅,摆放一张棕色沙发”,智能体自动检索 3D 资产并生成场景,提高商品详情页转化。
- 在线教育虚拟实验室:教师用自然语言生成物理/化学实验场景,学生可在 3D 环境中交互,降低内容制作门槛。
局限
- **数据与评估偏差**:VWE-BENCH 中 6,828 条查询大量为反向合成,尽管划分了 verified/unverified 两类,但真实用户的模糊意图、多轮修正与风格化诉求可能未被充分覆盖;323 个人工标注种子世界规模有限,场景多样性不足。此外,**rubric-based verifier** 的物理可行性判定依赖视觉-语言模型打分,其与人工评估的一致性未被系统报告,可能引入评估噪声,影响模型排名的可信度。
- **方法依赖工具链与资源成本**:框架将资产检索、编辑、渲染封装为固定粒度的 **MCP tools**,但编辑操作可能无法支持细粒度几何或材质修改,限制代理的构造精度。联合多模态 RL 需要冷启动 SFT 数据合成与大规模奖励服务,8B/30B 模型的训练成本较高,开源社区复现存在门槛;同时 RL 训练可能过拟合于特定工具接口与场景分布。
- **与端到端生成方法对比的局限**:该工作采用 agent 调用工具的模式,相比端到端 3D 生成模型,各工具之间缺乏联合优化,整体性能受制于最弱环节。评估仅在 benchmark 内比较 Pass@1,未验证在真实游戏或模拟器中的交互体验,也未分析生成世界的长期可维护性与可扩展性,实际落地价值仍需进一步证明。