京东探索研究院开源可交互视听世界模型 JoyAI-EchoWM
京东探索研究院开源 JoyAI-EchoWM,让用户能操作着走进 AI 生成的世界,画面与声音随操作实时延续,指向可反复探索的生成内容。
京东探索研究院开源 JoyAI-EchoWM,一个可交互的世界模型(能按用户操作实时生成后续画面的模型)。用户用键盘在场景中移动、切换第一/第三人称视角,画面与环境声、语音、音乐同步延续。在 158 个 WBench Navigation 评测案例中平均分 81.7,四步流式版本 EchoWM-Flash 为 81.0。
正文摘录
- title: 国产世界模型 EchoWM 开源!会发声的「可探索世界」来了 - sourcecompany: 机器之心 - bodymarkdown: .jpg) 编辑|杜伟 进入 2026 年,可交互世界生成面对一道更难的考题: AI 生成的世界能否经得起用户反复探索? 一扇门画得逼真,只是起点。往前走,它要自然靠近;穿过走廊再回头,它还应该留在原来的位置。用户每一次移动、转身和折返,都在检验模型是否有能力记住已经生成的世界。 世界模型的竞争开始从画面质量延伸到持续交互中的可靠性。镜头要听从指令,场景要保持连贯,生成速度还要跟得上操作。这些能力需要同时成立,任何一处掉链子,都可能打断探索。 近一年来的技术进展,让这条主线更加清晰。谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 将分钟级生成、精确相机控制与更高效率结合了起来,World Labs 的 Atlas 通过空间上下文支持沿指定相机轨迹生成新视角,维持场景的几何关系。 当探索进一步触及到视听体验,新的问题随之出现:用户改变路线或者切换视角时,脚步声、环境声和人物说话声,是否能够与画面一起连贯地延续?因此,对于面向沉浸式内容的世界模型,视听生成与交互控制的结合更加值得关注。 9 月 9 日,在京东全球科技探索者大会(JDD)上,京东探索研究院发布 JoyAI-Echo 系列最新进展:超长音视频生成模型升级至 JoyAI-Echo 1.5; 同时发布并开源面向可交互视听世界生成的 JoyAI-EchoWM 。