高德联合南大清华北大发布世界模型长时交互评测基准 WorldRoamBench
高德联合三校发布 WorldRoamBench,把世界模型评测从几秒短片拉到分钟级交互,结果显示没有模型全能,Genie 3 也明显偏科。
Genie 3 这类可交互世界模型(用户输入动作即可实时改变一个持续演化的虚拟世界)出现后,评测却仍停留在 5~10 秒短片。高德联合南大、清华、北大推出 WorldRoamBench,用 1000+ 个长时漫游样例,从动作、视觉、物理、记忆四个维度测试 12 款主流模型能否撑住分钟级交互。
正文摘录
.jpg)  随着 Genie 3 的发布,可交互世界模型真正走到台前:用户不再只是观看生成视频,而是可以输入动作实时改变一个持续演化的世界。世界模型开始从「生成一段视频」走向「模拟一个可交互世界」,但能走进去,不等于经得起探索。模型能否持续响应控制、维持视觉与空间一致、遵守物理规律并记住来路,仍缺少系统评测。 然而,现有评测往往仍停留在 5~10 秒短片段的比较上,很难暴露分钟级长时交互过程中的问题,如下图所示,问题往往不会立即显现,而是在较长时间推理后逐渐暴露。