WorldArena 2.0 启动,世界模型评测走向在线强化学习与真实机器人
世界模型评测从离线视频生成升级到闭环交互与真机任务,三大赛道检验其预测、学习与执行能力。
世界模型的评测不再只看生成视频“好不好看”。WorldArena 2.0 将评测推向三个逐步加压的赛道:复杂任务下的视频质量与物理一致性、世界模型作为在线强化学习环境的可用性、以及真实机器人平台上的任务规划与执行。触觉被设为可选增益项,而非门槛。组织方包括清华、CMU、斯坦福等机构。
正文摘录
.jpg)  WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。 然而,WorldArena 1.0 的评测仍主要集中在离线视频生成和仿真任务中。面对真实机器人执行、在线强化学习闭环、视觉 - 触觉等多模态感知,以及真实部署中的噪声、延迟和误差累积,仍缺少一个系统性的评测框架。 为进一步回答这些问题,WorldArena 团队正式发布 2.0 版本,并同步启动 IROS 2026 WorldArena 2.0 Challenge。WorldArena 2.0 设置了视频质量评测、在线 RL 环境、真实机器人 WAM 任务三大赛道,旨在检验世界模型能否从可靠预测走向闭环学习,并进一步支撑真实平台上的任务规划与动作执行。