论文

Puffin-World: 基于原生3D世界状态扩展统一多模态模型

Puffin-World: 基于原生3D世界状态扩展统一多模态模型

Puffin-World 提出一种统一多模态架构,旨在让模型无需外部离线模块即可完成物理理解、空间模拟以及3D世界的生成与重建。为实现可靠构建与交互,框架联合建模三种原生世界状态:物理(重力场、纬度)、几何(深度)与外观(图像),并引入统一的 Omni-Camera 表示,以支撑多样任务与灵活运动。 在此基础上,Puffin-World 提出跨未来帧的物理动力学传播策略:将绝对相机属性锚定于真实世界,从而生成物理一致、视觉稳定的连续场景。方法将外观与几何耦合进同一生成过程,在合成未来视角的同时重建其底层几何,形成支持多任务协同的闭环范式——包括模仿行为和自校准世界探索。 为支撑复杂场景,论文构建 Puffin-16M 数据集,包含1500万组视觉-语言-相机三元组及100万条包含多样挑战性运动的轨迹。相关代码、模型与数据均已开源。

论文精读

TL;DR Puffin-World 将物理、几何、外观作为原生世界状态统一建模,实现物理一致且视觉稳定的 3D 世界生成与重建,不依赖外部模块,支持闭环探索。

问题

问题背景

当前多模态世界模型聚焦于从视觉输入中联合理解三维几何、物理规律与外观,并支持自由视点生成和闭环交互,这是 embodied AI 与 spatial intelligence 的核心需求。

现有方法局限

现有方案通常串联多个离线模块,如深度估计、相机位姿估计、物理量预测和图像生成,再后处理融合,导致:

  • 误差累积:几何误差传播到外观生成,引起视图失真。
  • 物理不一致:缺少统一物理状态建模(重力方向、纬度、绝对相机高度),生成结果可能违反真实约束。
  • 弱闭环:视频模型只做外观预测,难以同步输出几何与物理时间演化,无法支撑多任务协同探索。

为什么这个问题难且重要

  • 多状态耦合:物理、几何、外观相互影响,端到端建模需对齐不同模态训练信号。
  • 动态传播:重力场等物理量需跨帧传播,要求时序一致性,而非单帧推理。
  • 相机统一:自由视点生成需统一 Omni-Camera 表示,支持不同运动模式与真实尺度对齐。
  • 业界对世界模型关注度高,但多数工作仍限于 2D 视频生成或简单 3D 重建,未实现物理一致世界生成与自校准探索。

行业类比

类似于具身机器人仿真平台:视觉生成、几何重建与物理仿真必须统一,否则机器人难以在闭环控制中稳定执行拾取和导航。

核心洞察

  • 将物理状态(重力场、纬度)与几何(深度)、外观(图像)作为原生世界状态联合建模,使生成过程具备物理一致性,而非仅视觉逼真。现有视频生成或 3D 重建通常分别处理外观与几何,物理属性被忽略或作为后处理,导致多模块误差累积。Puffin-World 在统一生成框架中显式建模重力场等物理量,并通过跨帧动力学传播确保未来帧的物理合理性,为 embodied AI 等需要物理约束的任务提供了原生耦合的范式。
  • 统一 Omni-Camera 表示与绝对相机属性接地,实现灵活运动与自我校准。传统 3D 场景生成通常假设已知固定相机或仅依赖相对位姿,限制了真实世界应用。Puffin-World 将相机高度、重力方向等绝对属性作为可学习变量,与场景状态联合推理,支持任意相机轨迹下的视图生成,并能从单张图像自我校准相机参数。这种将相机属性锚定在真实世界的设计,使得模型无需外部标定即可生成稳定视图,与仅使用相对运动的 baseline 有本质区别。

方法

方法概述

Puffin-World 是一个统一的多模态生成式框架,输入包括多视角图像、相机参数(绝对位姿、重力方向、纬度)与任务指令,输出未来视图、对应深度图及物理属性。

输入与表示

  • 模型以 统一 Omni-Camera 表示 编码相机绝对属性(重力向量、纬度等),使不同任务与运动模式共享同一坐标基准。
  • 输入还包含当前帧的外观(图像)与几何(深度),以及待预测的物理状态。

关键模块

  1. 物理感知:从图像与相机元数据估计重力场方向和纬度,建立真实世界参考系,保证后续模拟物理一致。
  2. 自由视点空间模拟:结合 Omni-Camera 表示与物理状态,通过传播物理动态到未来帧,实现任意视点的未来视图生成。
  3. 3D 世界建模:在单一生成过程中耦合外观与几何,同步输出合成帧和对应的深度重建,无需离线深度估计器。

输出与训练

输出为多任务结果,包括未来视图、深度图、物理属性,可支持闭环应用如模仿学习与自校准探索。模型在 Puffin-16M 数据集(1500 万视觉-语言-相机三元组 + 100 万轨迹)上训练,采用多任务协同损失。

与依赖外部 SLAM / 深度估计模块的级联方法不同,Puffin-World 将物理、几何、外观统一在一个生成式架构内,消除了模块间误差累积,并天然支持交互式闭环任务。

实验

实验设计

基于 Puffin-World 统一框架,实验围绕四个方面展开:Camera-to-World Understanding(验证物理感知与相机定位)、Camera-Controllable Generation(评估视觉稳定性与物理一致性)、3D World Modeling(联合生成外观与几何)、以及 Ablation Study 验证各模块贡献。数据集使用自建 Puffin-16M,包含 15M 视觉-语言-相机三元组和 1M 具有挑战性运动的轨迹。

关键发现

Puffin-World 在多个任务上展现出统一的优势:物理感知模块能够从单张图像恢复重力场与纬度,为生成提供绝对相机先验;Omni-Camera 表示支持自由视点模拟和灵活运动,生成帧在物理一致性和视觉稳定性上优于依赖外部模块的管线;联合生成外观与深度实现了一步式 3D 场景重建,并支持周期性闭环应用如 mimic 和自校准世界探索。

与基线对比

与需要外部离线模块(如单目深度估计、重力方向检测)的两阶段方法相比,Puffin-World 将物理、几何、外观建模内聚于单个生成过程,避免了误差累积和跨模块对齐问题。统一表征使模型能利用跨任务信号进行联合训练,在复杂运动轨迹和长序列生成中表现更鲁棒。虽然具体量化指标未展示,但方法论层面的整合优势明显。

行业影响

落地场景

Puffin-World 可直接嵌入需要物理一致 3D 场景生成与理解的产品线。典型 use case:

  • 自动驾驶仿真:利用其物理感知(重力场、纬度)和深度几何生成多样化驾驶场景,替代部分真实路测,加速感知算法迭代。
  • 电商商品展示:从单张商品图生成多视角可交互 3D 模型,用户可旋转查看,提升转化率;同时重建深度信息用于 AR 试摆。

另外还可用于游戏 / 影视资产生成、机器人导航训练等。

商业价值

核心降本:减少 3D 建模人工成本与仿真环境构建成本;加快内容生产周期。增收:提供 3D 资产生成 API 或定制服务;提升用户体验带来留存和转化。对自动驾驶公司,仿真覆盖更多 corner case 降低事故风险,间接节省测试与保险费用。

与现有工作流接口

  • 以 Puffin-World 模型为核心,通过 REST/gRPC API 提供服务,下游应用(如仿真平台、电商后台)调用生成结果。
  • 模型输出包含图像、深度、物理参数,可与现有 SLAM、NeRF、游戏引擎(如 Unreal Engine)数据格式对接。
  • 提供开源代码与 Puffin-16M 数据集,便于团队基于自有数据微调,集成到现有 MLOps 流水线。

局限

  • **物理状态建模仍显简化**。论文仅将重力场和纬度作为原生物理状态,对于碰撞、摩擦、流体、形变等更复杂的物理现象并未显式建模。尽管通过未来帧的物理动态传播策略尝试扩展,但该策略可能只能处理刚体运动和简单重力效应。在真实世界动态场景(如柔性物体交互、非刚性形变)中,模型对物理一致性的保证不足,生成的 3D 世界可能偏离真实物理规律。相关实验也主要集中在合成或受控场景,对开放世界复杂物理的泛化能力有待进一步验证。
  • **对相机先验的依赖与自校准鲁棒性存疑**。Omni-Camera 表示统一了不同任务和运动模式,但在训练和推理时需要精确的绝对相机属性(如内参、位姿、高度等)。论文提出的自校准世界探索虽然试图缓解对离线标定的依赖,但在多传感器、低质量输入或动态场景下,自校准的误差可能累积并影响后续的物理感知和 3D 重建。实际部署中,消费级设备难以提供精确的相机元数据,限制了该框架的泛化应用。
  • **计算开销与多任务权衡问题突出**。Puffin-16M 包含 15M 视觉-语言-相机三元组和 1M 轨迹,训练成本极高;推理阶段联合生成外观和几何,并传播物理动态,计算复杂度远高于单一任务模型,难以满足实时或低延迟应用需求。此外,多任务联合训练可能导致任务间干扰——例如物理感知与外观生成的梯度冲突,使得某些子任务性能不如专用模型。论文未充分分析不同任务的性能权衡与资源消耗。
论文Kang Liao2026-09-03原文

相关内容