HelixWorld 1.0发布:实时可交互音视频世界模型,支持24FPS与48kHz立体声
HelixWorld让世界模型同时实时生成画面和声音,用户操作能立刻得到声画回应,且即将完全开源。
传统视频生成只能产出固定成片,无法干预。HelixWorld 1.0实现24FPS画面与48kHz立体声实时生成,声音随场景和视角变化,原生Transformer统一生成,不后期配音,模型权重与代码将开源。
正文摘录
但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。 而现在,做这件事的团队多了起来。Google DeepMind 的 Genie 3、腾讯的 WorldPlay、蚂蚁的 LingBot-World,以及一批创业公司,都在推进这个方向。 放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。 你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。 Noiz AI 联合来自香港科技大学、清华大学、CMU、Google DeepMind 等机构的研究员,刚刚发布了实时可交互音视频世界模型 HelixWorld 1.0。 离多远、踩在什么材质上、从哪个方向来,都会让它不一样;身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。 参数也相当硬核,HelixWorld 支持 24 FPS 实时生成画面,同时输出 48kHz 双声道音频。 真正关键的还在后面。画面和声音由原生 Transformer 架构统一生成,从一开始就绑在一起,不会等视频做完再另配一条音轨。 声画一起生成,声音跟着场景转,还能实时交互,是 HelixWorld 和现有方案不同的地方。放进现在可交互世界模型的对照里,会更清楚: 好戏才开始。接下来几周,HelixWorld 的模型权重和代码将完全开源。(详见后续章节) 视觉侧已有成熟解法,可以用位姿估计模型反推每一帧的相机轨迹,生成动作标签。可一到声音侧,几乎没有现成数据可用。 现有技术报告通常会筛分辨率、时长、镜头切换等等,却很少管声音。道理很简单,它们本来就没打算生成有声世界。