Matrix-Game 3.5: 通过 Patch Memory 增强实时流式交互世界模型
交互式世界模型将视频生成从离线片段合成扩展到对交互式虚拟世界的持久模拟,为游戏、机器人、具身智能体和 XR 等应用提供支持。然而,实现稳定的长时程交互式生成仍然具有挑战性,模型必须同时保持场景几何、动态一致性和相机控制,并支持实时自回归生成。 基于 Matrix-Game 3.0,我们提出 Matrix-Game 3.5,通过三项关键改进推动实时交互式世界生成迈向几何感知和长时程一致的模拟。第一,我们提出统一的几何感知记忆框架,其 patch-memory 和 tiled-PRoPE 组件不引入额外可学习参数,将显式 3D patch 检索与投影相机条件相结合,实现几何一致的相机控制和忠实的长时程场景回忆。第二,我们引入静态-动态解耦的世界表示,分别建模静态场景几何和动态主体,在长时程生成过程中保持几何一致性和主体身份。第三,我们开发了两阶段渐进式实时蒸馏框架,通过感知流匹配和基于课程的自滚动 DMD 将双向扩散模型转换为少步因果生成器,实现分钟级实时交互生成。 大量实验表明,在涵盖 Unreal 模拟环境、开放世界游戏和互联网视频的统一训练语料上,Matrix-Game 3.5 在长时程场景回忆、精确相机控制、主体一致性、提示驱动的世界生成以及稳定的实时开放世界交互方面均表现出强劲性能。
论文精读
TL;DR Matrix-Game 3.5 通过 patch memory 几何感知记忆、静态动态解耦表征与渐进蒸馏,实现分钟级长时程、相机可控的实时交互世界生成。
问题
问题背景
交互式世界模型正从离线视频生成迈向持久化、可交互的虚拟世界模拟,目标场景覆盖游戏、机器人、具身智能与 XR。
现有方法局限
早期工作如 Matrix-Game 3.0 及同类模型在长时程生成中面临三类瓶颈:
- 几何记忆缺失:缺乏显式三维几何记忆,长时间跨度生成后场景结构逐渐漂移,相机移动后无法准确召回已生成区域。
- 静态-动态耦合:静态场景与动态主体统一建模导致相互干扰,动态主体身份易漂移,静态纹理也随步数退化。
- 推理延迟高:基于扩散模型的多步去噪难以满足实时交互所需的毫秒级延迟,无法支撑流式生成。
为什么这个问题难/重要
挑战在于必须同时满足多个强约束:生成序列需保持场景几何一致性(三维结构可验证)、动态主体一致性(身份不变)、相机精确可控(任意视角位姿),并且要在自回归过程中以极低延迟输出。任何单一目标的优化都可能牺牲其他目标。业界对可实时交互、长时程稳定的世界模型关注度极高,因为它们有望替代传统图形引擎的部分功能,驱动新一代游戏、机器人和 XR 应用。
行业类比
可类比自动驾驶仿真中需实时生成高保真、可交互的动态场景,但这里更强调开放世界与视觉生成本身的质量,是“AI 原生游戏引擎”的核心技术。
核心洞察
- 几何感知记忆以零可学习参数实现:patch-memory 采用显式 3D patch 检索,tiled-PRoPE 提供投影相机条件化,两者均不引入额外参数。区别于依赖可训练记忆模块或外部编码器的同类工作,该设计降低了训练成本与过拟合风险,同时保持几何一致的相机控制和长时程场景召回,更适合实时流式生成场景。
- 静态与动态内容解耦建模:将静态场景几何与动态主体分离,分别维护几何一致性和主体身份。对比统一建模所有内容的 baseline,解耦表示在长时程生成中显著减少几何漂移和身份混淆,同时允许独立控制动态对象,为交互式世界模拟提供更稳定的状态管理。
- 两阶段渐进蒸馏实现分钟级实时因果生成:先通过 Perceptual Flow Matching 将双向扩散模型转为少步生成器,再用 Self-Rollout DMD 做课程式自举分布匹配。相比直接单步蒸馏或从头训练自回归模型,该策略在保持生成质量的同时大幅提升推理速度,解决了长时程实时交互的核心瓶颈。
方法
输入为多模态控制信号:当前帧、相机位姿(内外参)、文本/动作提示、历史生成序列,目标输出下一帧或未来多帧 RGB,保持几何、动态物体身份与相机轨迹一致。
关键模块
Pose-aware Sequence Representation
Camera-aware Attention 将相机参数注入注意力层,使生成对视角变化敏感;Pose-aware Sequence Layout 把位姿序列组织成可学习的布局表示,统一多视角条件建模。Unified Memory System
- Patch Memory 通过显式 3D patch 检索与投影相机条件融合,不引入额外可学习参数,强化几何一致的相机控制与长时程场景回忆。
- Context Memory 缓存长程上下文,缓解自回归漂移。
- Static-Dynamic Disentangled Memory 将静态场景几何与动态主体分离建模,用 Motion-aware Object Filter 过滤运动目标,Reference Token Memory 保持主体身份一致性。
Progressive Distillation
先通过 Causal Adaptation 将双向扩散模型转换为因果自回归生成器,再用 Self-Rollout Distribution Matching 以自滚动课程逐步蒸馏到少步推理,实现实时生成。
输出为分钟级实时交互视频流,支持相机控制、几何一致场景回忆与主体一致运动。
与 Genie 等纯隐式记忆或单向扩散方案相比,本方法用无参数 3D patch 检索加显式静态/动态分离,在长时程几何一致性与实时性之间取得更好的平衡。
实验
实验设计
Matrix-Game 3.5 在统一语料库上训练,涵盖 Unreal simulation environments、open-world games 与 internet videos。评估维度包括长程场景回忆、相机控制精度、主体一致性、提示驱动世界生成和实时开放世界交互稳定性。
关键发现
- patch-memory 与 tiled-PRoPE 不引入额外可学习参数,实现显式 3D patch 检索与投影相机条件化,提升几何一致性与长程场景回忆。
- static-dynamic disentangled representation 分离静态场景几何与动态主体,保持几何一致与主体身份。
- two-stage progressive distillation 将双向扩散模型转化为少步因果生成器,实现分钟级实时交互。
与基线对比的深度解读
相比 Matrix-Game 3.0,新模型在几何感知与长程一致性方面显著增强。几何感知记忆框架避免了额外的可学习参数,降低部署成本;静态-动态解耦使模型在长程生成中同时保持场景结构与动态对象身份;蒸馏流程将推理从多步扩散压缩至少步因果生成,在实时约束下稳定输出。但论文未公布具体量化指标(如 FVD、PSNR 或推理延迟),无法给出数值对比,实际效果需结合项目主页演示与代码评估。
行业影响
落地场景
Matrix-Game 3.5 的实时交互世界生成能力可直接用于 开放世界游戏开发、自动驾驶仿真、机器人训练环境合成。具体落地场景:
- 电商虚拟体验:生成可交互的 3D 商品场景,用户实时漫游并切换视角,提升转化率。
- 内容平台互动视频:基于用户操作实时生成分支剧情与场景,替代预渲染视频流,降低带宽与制作成本。
商业价值
核心降本路径在于 去手工建模/渲染:传统开放世界环境制作需大量美术与引擎工时,Matrix-Game 3.5 可通过 prompt 或参考帧直接生成几何一致的持久场景,成本降低一个数量级。体验端上,分钟级实时交互与相机控制提升用户沉浸感,带来订阅/时长增长;对于 B 端仿真客户,可快速生成多样化训练数据,缩短自动驾驶/机器人开发周期,间接增收。
与现有工作流集成
蒸馏后的 causal generator 可部署为实时推理服务,通过 WebSocket/gRPC 输出视频流,与现有 Unreal Engine / Unity 通过插件或 sidecar 集成;patch memory 与 tiled-PRoPE 无新增参数,可轻量替换已有视频扩散模型中的时序模块。数据管线复用论文中的 geometry/semantic/identity annotation 流程,可对接现有的 3D 资产库与合成数据平台。
局限
- 论文依赖大规模带精细标注的数据集(自建 Geometry Annotation / Semantic Annotation / Identity Annotation),虽然声称统一训练语料涵盖 Unreal 仿真、开放世界游戏和互联网视频,但这类标注成本高昂,且论文未详细披露数据规模与标注质量,可能限制方法在缺乏标注场景的泛化性。相比之下,Genie 3 等模型更强调无监督学习,数据获取门槛更低。
- 静态-动态解耦表示通过 Motion-aware Object Filter 和 Reference Token Memory 分离场景与主体,但分离建模可能在长视界交互中引入边界不一致,例如动态主体与静态场景的遮挡、阴影耦合未充分解决。实验部分缺乏与不分离基线的消融分析,难以量化该设计的独立贡献。
- 两阶段渐进式蒸馏(Perceptual Flow Matching + Self-Rollout DMD)训练流程复杂,涉及多阶段课程和自回滚分布匹配,可能对超参数敏感,复现门槛较高。论文仅报告最终模型效果,未提供蒸馏过程稳定性分析或训练成本对比,对希望迁移到自身数据集的团队不够友好。