大晓机器人联合南洋理工 S-Lab 开源统一多模态世界模型 Puffin-World
世界模型不再只生成好看视频,而是预测机器人动完之后世界处于什么状态——Puffin-World 把重力方向、三维结构和画面统一到一个模型里输出,并开源了全套数据和代码。
大晓机器人联合南洋理工大学 S-Lab 发布并开源 Puffin-World,一个统一多模态世界模型框架。它把物理、几何、外观定义为三种原生三维世界状态,一次生成同时给出 RGB 画面和深度,并能感知重力方向、按指定相机轨迹仿真视角,用于机器人仿真与具身智能训练。代码、模型和 1600 万组数据的 Puffin-16M 数据集同步开源。
正文摘录
.png) 近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。 Puffin-World同步开源代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。 针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。