智象未来发布交互式世界模型 HiDream-O1-World 登顶 WBench
智象未来推出原生全模态交互式世界模型 HiDream-O1-World,以 UiT 架构实现时空与物理一致性,在 WBench 登顶,让 AI 生成从单向输出转向可探索交互。
智象未来发布全球首款原生全模态交互式世界模型 HiDream-O1-World,基于自研 UiT 架构,支持文本、图像、交互输入,可生成具备长时空与物理一致性的动态世界。在 WBench 评测中,物理维度得分 73.3、一致性维度得分 88.0,均列第一。
正文摘录
标题:刚刚,HiDream-O1-World 首秀登顶,原生全模态 UiT 架构打造「可交互时代」 编辑|陈陈 过去三年,AI 内容生成行业经历了几轮密集的技术迭代。从文生图到文生视频,从几秒的短片到分钟级的长视频,每一轮升级都让生成内容的质量和时长向前推进一步。 但仔细观察就会发现,这些进步在本质上属于同一个范式:用户提供提示词,模型输出内容,然后用户观看这段内容。两者之间始终是单向的。 这个范式有一个根本局限,它生产的是内容,不是世界。无论生成的视频多么逼真,用户始终是旁观者,无法真正进入、改变、或持续影响那个画面里的空间。 业界也意识到了这一点,世界模型的概念开始频繁出现在各大 AI 实验室的技术报告和产品发布中,谷歌、World Labs 等都在这一方向上投入了大量资源。但热闹背后,争议同样激烈:目前市面上的产品,究竟是在构造世界,还是只是在渲染画面? 就在刚刚,智象未来 HiDream.ai 给出了自己的答案:发布 全球首款原生全模态交互式世界模型 HiDream-O1-World 。 该模型基于 自研原生全模态 UiT 架构,支持文本、图像、交互等多模态输入 ,可生成具备长时空一致性和物理一致性的动态世界。用户既能以第一、第三人称视角自由漫游,也能实时编辑角色和场景变化;从写实城市、自然地貌到二次元、幻想世界、3A 游戏风格,从人类、动物到虚构角色,都可以在同一套模型中生成和持续推演,让世界生成进一步走向 可探索、可交互 。