行业新闻

大晓机器人联合南洋理工 S-Lab 开源统一多模态世界模型 Puffin-World

世界模型不再只生成好看视频,而是预测机器人动完之后世界处于什么状态——Puffin-World 把重力方向、三维结构和画面统一到一个模型里输出,并开源了全套数据和代码。

大晓机器人联合南洋理工大学 S-Lab 发布并开源 Puffin-World,一个统一多模态世界模型框架。它把物理、几何、外观定义为三种原生三维世界状态,一次生成同时给出 RGB 画面和深度,并能感知重力方向、按指定相机轨迹仿真视角,用于机器人仿真与具身智能训练。代码、模型和 1600 万组数据的 Puffin-16M 数据集同步开源。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/8a43818a-46a6-4898-8e33-7e280973979a/%E5%9B%BE%E7%89%875(2).png) 近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。 Puffin-World同步开源代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。 针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

阅读原文(jiqizhixin.com)→

行业新闻新闻资讯2026-09-10原文

相关内容