行业新闻

李飞飞团队提出 OpenWAM,统一世界动作模型建模框架

斯坦福李飞飞团队开源 OpenWAM:用共享底座加四种可切换的交互方式,把世界动作模型的设计变量拆开比较

以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布开源 7B 世界动作模型 FLUX 3 Action,在英伟达 RoboLab-120 榜单上超过参数量近两倍于它的 Cosmos 3 Nano,说明视频模型积累的物理直觉正被当作机器人大脑的底座。斯坦福李飞飞团队随后发布 OpenWAM 框架,试图厘清这类系统中究竟是哪些设计带来提升。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/607c6aa8-7759-42e3-9f4a-b9ff24ff4b2e/021(2).jpg) 编辑|Panda 9 月 22 日,以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布了开源 7B 世界动作模型 FLUX 3 Action。据其官方博客,该模型在英伟达 RoboLab-120 榜单上超过了此前最强的开源模型 Cosmos 3 Nano,参数量却不到后者一半。一家做图像生成的公司跑来卷机器人控制,说明 视频模型里积累的「物理直觉」正被越来越多的团队当作机器人大脑的底座 。 这条路线即所谓 世界动作模型(World-Action Model,WAM) 。自今年 2 月英伟达在 DreamZero 论文中明确提出这一术语以来,相关论文快速涌现。但热闹背后有个尴尬的问题:这些系统几乎都同时换了视频骨干、训练数据、视频与动作的交互方式和推理流程,谁也说不清究竟是哪个设计带来了提升。 本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人的团队发布论文,提出开放的世界动作建模框架 OpenWAM ,试图给这个问题一个系统性的回答。 ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqF06V6bcC3OVugkamPOSDmiaLY9v3JsT7SxFh6iazohcFibXXppE9juXEicKv6trKFZRz48NMwCdHSwD6K9ibjQpNtLSIrkxlvyN5CU/640?wxfmt=png&from=appmsgimgIndex=1) OpenWAM 框架总览:三阶段训练、共享 MoT 架构、四种可配置交互方式,以及可冻结复用的局部动力学模型。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-08原文

相关内容