行业新闻

高德联合南大清华北大发布世界模型长时交互评测基准 WorldRoamBench

高德联合三校发布 WorldRoamBench,把世界模型评测从几秒短片拉到分钟级交互,结果显示没有模型全能,Genie 3 也明显偏科。

Genie 3 这类可交互世界模型(用户输入动作即可实时改变一个持续演化的虚拟世界)出现后,评测却仍停留在 5~10 秒短片。高德联合南大、清华、北大推出 WorldRoamBench,用 1000+ 个长时漫游样例,从动作、视觉、物理、记忆四个维度测试 12 款主流模型能否撑住分钟级交互。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b7caf801-01f4-4dc9-ab7b-334811a0c12a/015(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 随着 Genie 3 的发布,可交互世界模型真正走到台前:用户不再只是观看生成视频,而是可以输入动作实时改变一个持续演化的世界。世界模型开始从「生成一段视频」走向「模拟一个可交互世界」,但能走进去,不等于经得起探索。模型能否持续响应控制、维持视觉与空间一致、遵守物理规律并记住来路,仍缺少系统评测。 然而,现有评测往往仍停留在 5~10 秒短片段的比较上,很难暴露分钟级长时交互过程中的问题,如下图所示,问题往往不会立即显现,而是在较长时间推理后逐渐暴露。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-15原文

相关内容