PixVerse R2 发布,实时世界模型引入 Scaling 框架
PixVerse R2 把世界模型的"能力上限"和"实时运行"拆成两层做,不再靠缩模型换速度,实时交互画面可以边生成边被指令改写。
爱诗发布 PixVerse R2,把 LLM 里"投入越多、能力越强"的 Scaling(规模扩展,指靠增加数据、参数和算力持续提升模型能力)逻辑搬进实时世界模型:视觉、动作、音频、控制信号先被收进同一套因果自回归框架做高能力上限,再由实时加速层压进毫秒级单帧预算,支持 Prompt 实时改写剧情与角色。
正文摘录
画面更夯,控制更细,但一旦走到实时生成这一步,继续往上做能力,就会有个很难绕开的坎: 更麻烦的是,实时世界模型还得面对世界模型的共性难题,相比 LLM,能力想沿着稳定路径 持续增长 也没那么容易。 然而,这个困扰行业多年的实时世界模型的老 bug,如今,已经有厂商用实际模型完成验证并跑出了答案—— 其实今年 1 月的时候,爱诗就发布了首个通用实时世界模型 R1,主打持续生成能力,当时直接在网上火出圈了一波。 这回,R2 直接把 LLM 里那套规模继续加、能力继续涨的 Scaling 逻辑,真正搬进实时世界模型里。 基于统一可扩展的世界模型框架,R2 把完整的时空关系压进模型,让场景能够沿着时间持续演化,前后状态保持一致,让这个世界真正 「记得住」 。 不仅如此,R2 还把文字、图像、声音、动作统一进模型,边生成边响应、音画同步,让世界真正 「控得动」 。 比如下面这个探险世界,用户不仅可以控制方向,还能基于 Prompt 控制场景角色,而且画面是实时生成的内种: 文章链接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA 当然,脑洞完全可以再大一点,比如游戏剧情也能 DIY,一句指令就能改变眼前世界,世界剧情真·随意拿捏了: 文章链接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA 过去实时世界模型最大的难题之一,就是能力一旦往上堆,速度、稳定性和交互性往往也开始彼此拉扯。 当实时和通用能力同时成立,世界模型的能力边界和使用边界也会一起外扩,逐渐进入游戏、虚拟交互等场景。 其中第一道门槛,便是整个视觉世界建模都绕不开的一道表征难题: 「信息」到底该怎么被统一表示和建模?