李飞飞团队提出 OpenWAM,统一世界动作模型建模框架
斯坦福李飞飞团队开源 OpenWAM:用共享底座加四种可切换的交互方式,把世界动作模型的设计变量拆开比较
以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布开源 7B 世界动作模型 FLUX 3 Action,在英伟达 RoboLab-120 榜单上超过参数量近两倍于它的 Cosmos 3 Nano,说明视频模型积累的物理直觉正被当作机器人大脑的底座。斯坦福李飞飞团队随后发布 OpenWAM 框架,试图厘清这类系统中究竟是哪些设计带来提升。
正文摘录
.jpg) 编辑|Panda 9 月 22 日,以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布了开源 7B 世界动作模型 FLUX 3 Action。据其官方博客,该模型在英伟达 RoboLab-120 榜单上超过了此前最强的开源模型 Cosmos 3 Nano,参数量却不到后者一半。一家做图像生成的公司跑来卷机器人控制,说明 视频模型里积累的「物理直觉」正被越来越多的团队当作机器人大脑的底座 。 这条路线即所谓 世界动作模型(World-Action Model,WAM) 。自今年 2 月英伟达在 DreamZero 论文中明确提出这一术语以来,相关论文快速涌现。但热闹背后有个尴尬的问题:这些系统几乎都同时换了视频骨干、训练数据、视频与动作的交互方式和推理流程,谁也说不清究竟是哪个设计带来了提升。 本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人的团队发布论文,提出开放的世界动作建模框架 OpenWAM ,试图给这个问题一个系统性的回答。  OpenWAM 框架总览:三阶段训练、共享 MoT 架构、四种可配置交互方式,以及可冻结复用的局部动力学模型。