从月球漫步到赛博都市,WBench 测出了世界模型的边界
WBench 是首个多轮评测基准,专测交互式视频世界模型,揭示其从“看”到“做”的瓶颈。
美团 LongCat 团队开源了 WBench——首个面向交互式视频世界模型(能根据用户操作生成后续画面的 AI)的多轮评测基准。它像一台 CT 扫描仪,精准找出模型从“被动观看”到“主动交互”时卡在哪,帮开发者定位缺陷。
正文摘录
 从月球漫步到赛博都市,WBench 测出了世界模型的边界 美团 LongCat 2026-06-12 LongCat 大模型 开源 AI 视频的进化速度突飞猛进。是否想过有一天能真正走进这些由 AI 生成的世界里,亲自感受一下? [点击查看视频](https://mp.weixin.qq.com/s/tQFM4yay6wmIMnQdpDaoQ) 像这样,在月球上自由漫步,是什么感觉?它们是真的理解了世界,还是仅仅在模仿视频?目前的模型距离这个目标还有多远? 为了彻底搞清这个问题,美团 LongCat 团队提出了 WBench ,它是首个面向交互式视频世界模型的系统性多轮评测基准。它就像一台“CT 扫描仪”,能精准定位当前世界模型在从“被动观看”到“主动交互”的过程中,到底卡在了哪里。 我们用 WBench 对 20 个前沿模型(包括 Kling 3.0、HY-World 1.5、Genie 3 等)进行了全面"扫描",最核心的发现可以总结为以下几点: - 不存在全能模型: 不同模型各有专长,文本驱动模型更擅长理解场景,而专用世界模型在交互控制上突出。 - 导航 是一项独立的技能: 模型的视频画质好坏,和它的导航控制能力基本没关系。 - 多轮交互是核心难点: 所有模型在连续交互后表现都会变差,导航能力尤其严重,平均分下降了整整 33 点。 - 开源模型表现出色: 在一些特定能力上,开源模型甚至超过了闭源模型,比如 HY-World 1.5 的导航能力在所有模型里突出。 01 WBench 是如何测出这些问题的?