行业新闻

李飞飞团队发布多模态世界模型 Atlas,支持像素级相机控制

李飞飞团队发布多模态世界模型 Atlas,支持像素级相机控制

李飞飞团队推出世界模型 Atlas,可生成可控视频并重建 3D 场景,为机器人模拟等应用提供基础能力。

World Labs 发布新模型 Atlas,号称全球首个多模态世界模型。它能从单张图片生成带相机控制的视频,重建 3D 空间,并理解时空关系,为机器人模拟提供新路径。

正文摘录

World Labs 对这款名为 Atlas 的新一代世界模型,用词可谓毫不克制。除了「全球首个」之外,slogan 也明确强调:这一次,可不只是生成一段可互动视频了。 也就是说,Atlas 能够以像素级的相机控制生成图像和视频帧,并完成 3D 重建,同时理解 空间 与 时间。 李飞飞高徒、英伟达机器人研究主管 Jim Fan 也来捧场,指出:这是机器人领域 Real-to-Sim(真实到仿真)的一大步。 具体来说,Atlas 是一个 多模态自回归扩散 Transformer,它的能力包括: - 相机控制生成:仅需一张图片,Atlas 即可生成具有像素级相机控制的图片和视频,最高可输出 1 分钟、1440p 的视频。 - 空间重建:Atlas 可以基于 1 张到数十张输入图像,重建真实世界场景。既能生成新视角下的图像帧,也能输出显式 3D 表示,其效果超过当前专门针对 3D 重建训练的最先进模型。 - 时空模拟:Atlas 可以根据输入视频同时建模空间和时间,能够转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人 Real-to-Sim 工作流。 - 图像生成:Atlas 可以根据文本生成图片和 360° 全景图,能够遵循复杂 Prompt、准确渲染文字,并生成大量不同的视觉风格。 对于 机器人模拟,仅需喂给 Atlas 几张照片,它就能生成逼真的 RGB 和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。 为了实现这些目标,李飞飞团队设计了一种全新的基础架构,作为未来世界模型的基础——多模态自回归扩散 Transformer。 文本、图像、视频、3D 数据……各种输入都会被锚定在三维空间中,从而形成一种 空间上下文。

阅读原文(qbitai.com)→

行业新闻鱼羊2026-09-02原文

相关内容