From Pixels to States: Rethinking Interactive World Models as Game Engines
构建能够对玩家行为做出连贯响应的交互式世界,一直是计算机图形学、游戏和人工智能领域的共同目标。最近,视频生成模型 提供了一种数据驱动的方法,通过预测基于用户动作的未来观测,并被视为潜在的下一代游戏引擎。然而,实现真正交互的游戏世界,需要交互结果遵循不断变化的游戏条件规则,后果需长期持续,且生成循环需实时运行。传统游戏引擎通过循环的动作-状态-观测 循环实现这些特性:玩家动作根据预定义规则更新显式游戏状态,并从结果状态渲染观测。 本文以该循环为组织视角,从四个维度考察交互式游戏世界建模:玩家动作控制、游戏状态动态、状态-观测持久性 和实时交互生成。针对每个维度,我们从交互式游戏世界所需的能力出发,将现有方法归类为代表性家族,并讨论各家族的优点与权衡。作为补充分析,我们为 Black Myth: Wukong 构建了一个可扩展的数据引擎,收集了超过90小时的游戏过程,包含帧对齐的玩家动作、真实游戏状态和视觉观测,以及结构化和语义注释,作为状态感知游戏世界建模 的资源。我们希望本文能清晰呈现该领域的现状,并推动交互式游戏世界的进展。
论文精读
TL;DR 以游戏引擎的“动作-状态-观察”循环为框架,将交互式世界建模分解为四个技术维度,并开源《黑神话:悟空》对齐数据,驱动可实时交互、规则一致的生成式世界构建。
问题
问题背景
交互式世界建模正处于 视频生成模型 与 传统游戏引擎 的交汇点。当前领域核心关注:能否用一个可学习模型替代人工构建的规则系统,直接从游戏画面数据中习得世界动态,并实时响应玩家操作。
现有方法局限
主流尝试基于 video diffusion 或 自回归模型 实现动作条件的世界生成,但存在三类根因性缺陷:
- 状态纠缠与不可解释:将游戏状态隐式编码在像素或潜在变量中,缺乏对 对象属性、物理规则、场景结构 的显式建模,导致长期推演中状态漂移且难以调试。
- 长程一致性脆弱:交互效果往往仅能在短时窗口(< 5 秒)保持合理,对需要跨场景持续的 物品状态、角色能力、任务进度 等持久性信息记忆不足。
- 实时循环效率低:现有生成模型在推理时需要昂贵的前向传播,难以满足 30 FPS 交互循环 的延迟要求,且调节动作信息的方式(如交叉注意力)进一步增加开销。
为什么这个问题难 / 重要
- 技术挑战:需要同时解决 长时间因果链条的稳定传递、动作空间与状态空间的对齐 以及 实时流式推理,三者互相制约。例如,用强大但迟缓的模型做长期规划会牺牲实时性;用轻量模型提速则容易丢失状态一致性。
- 行业关注度:若实现,将彻底变革 游戏开发范式,使内容生产从手工标注规则转向数据驱动,大幅降低 AAA 游戏制作成本,并催生 无限交互叙事的可能性。因此,游戏引擎厂商和 AI 实验室均将其视为下一代引擎的核心竞争点。
行业类比
这类似 自动驾驶仿真引擎:需在闭环中根据控制信号实时渲染下一帧传感器数据,并保持场景物体的逻辑连续性——任何不合理的瞬移或物理违规都会破坏训练可信度。
核心洞察
- **以显式状态循环重构交互式世界模型,区别于主流的端到端视频生成范式。** 现有视频生成模型大多直接将用户动作映射到未来视频帧,虽然画面逼真,但难以保证长期一致的规则遵循和物理逻辑。本文从经典游戏引擎的 **动作-状态-观察循环** 出发,将世界模型分解为玩家动作控制、游戏状态动态、状态-观察持久性和实时生成四个维度,强调显式状态在分离动态变化与视觉渲染中的关键作用。这一视角不仅提供了清晰的设计蓝图,也揭示了不同方法在可控性、记忆效率与实时性上的根本权衡,为下一代交互式世界模型的架构设计提供了系统性的参考框架。
- **首次发布大规模、状态对齐的游戏数据集,为可复现的状态感知世界模型研究奠定基础。** 尽管视频生成技术快速发展,但缺乏包含真实游戏状态、精确动作标注和长时序交互数据的公开基准。本文构建了基于 **《黑神话:悟空》** 的数据引擎,采集超过 90 小时带有帧对齐玩家动作、真值游戏状态和视觉观察的 gameplay 数据,并附加结构化语义标注。这一资源直接弥补了当前领域在 **状态动态建模** 和 **长期持久性评估** 上的数据缺口,让研究者能够量化比较不同方法在状态追踪、规则遵循和实时交互上的表现,推动从“视觉逼真”到“功能可玩”的范式转变。
方法
分析框架:将生成模型映射到游戏引擎循环
本文并未提出单一新模型,而是构建了一个系统性的分析框架。核心思路是将交互式世界模型视为 游戏引擎,并围绕经典的 动作-状态-观察循环 展开。具体来说,根据该循环拆解出四个关键维度:
- 玩家动作控制:如何表示和注入玩家输入?现有方法可分为三类——几何轨迹(如光流、相机位姿)、运动信号(如键盘、手柄指令)、语义事件(如“开门”、“攻击”)。
- 游戏状态动力学:如何建模世界状态?方法包括:将状态隐式编织在观察中(纯视频预测)、学习潜在表示(如使用 VAE 或 Transformer 隐空间),以及显式描述(如 3D 边界框、场景图等结构化表示)。
- 状态-观察持久性:如何保持跨时间步的一致记忆?一类方法存储历史观察(如记忆库检索),另一类则估计当前状态(如可微分渲染或神经辐射场)。
- 实时交互生成:如何降低延迟以支持实时交互?分为降低生成延迟(如模型蒸馏、步长预测)和降低条件化延迟(如缓存中间表示、简化编码器)。
数据引擎:WildWorld 数据集
为支撑状态感知的世界建模,作者构建了面向 Black Myth: Wukong 的可扩展数据引擎。流程如下:
- 众包游戏采集:记录超过 90 小时的游戏视频,每一帧同步捕获玩家输入、游戏引擎内部状态(真值)及视觉观察。
- 槽位结构化标注:对状态和语义进行结构化标注,形成帧对齐的 {动作,状态,观察} 三元组。
该数据引擎产出 WildWorld 数据集,为显式状态建模、长程一致性等研究提供了标准化基准。
与纯生成方法的差异
不同于直接端到端预测下一帧的生成模型,本文强调 显式状态解耦 和 规则驱动的动力学,并提供了含真值状态的数据资源,推动从“视频生成”到“可交互世界模拟”的范式升级。
实验
实验设计思路
本文并非传统实验研究,而是基于 action–state–observation 循环的概念框架,系统梳理了交互式世界模型作为游戏引擎的四大维度:玩家动作控制、游戏状态动态、状态–观测持久性 和 实时交互生成。为支撑状态感知的世界建模,作者构建了一个可扩展的数据引擎,从《黑神话:悟空》中采集了超过 90 小时带帧对齐玩家输入、真实游戏状态与视觉观测的游戏视频,并附带结构化和语义标注。
关键发现
- 现有方法可被归入不同家族:动作被建模为几何轨迹、运动信号或语义事件;状态或被纠缠于观测中、或被学习为隐变量、或被显式描述。
- 持久记忆可通过存储历史观测或估计当前状态来实现,而实时生成需同时降低生成延迟和条件化延迟。
- 所提出的数据引擎首次在大规模 3A 游戏上提供了成对的动作–状态–观测数据,可作为状态感知游戏世界模型的基准。
与基线对比的解读
论文未提供量化对比,因其定位为领域概览与资源贡献。与纯生成式视频模型相比,本文强调显式状态建模与规则遵循的重要性;与经典游戏引擎相比,生成式方法无需手工编写所有规则。该数据引擎填补了高质量动作–状态对齐数据的空白,为后续将生成模型与结构化游戏状态结合的交互式世界研究提供了基础。
行业影响
落地场景
以 交互式视频生成为内核的下一代游戏引擎将推动多个行业的变革:
- 游戏与交互式叙事:基于玩家操作实时生成连贯画面,大幅减少手工制作场景与规则的成本,实现无限开放世界。例如,平台可提供 AI 驱动的游戏生成服务,让非专业创作者快速原型化互动叙事作品。
- 虚拟现实与数字孪生:在工业仿真、建筑设计评审中,根据用户交互实时渲染高保真可视化结果,取代传统固定路径的预渲染动画。
- 自动驾驶与机器人仿真:使用世界模型生成多样的驾驶场景,模型能根据车辆控制信号(转向、加速)生成符合物理规律的未来帧,为感知规划算法提供无限训练数据。
商业价值
- 降本:传统 3A 游戏开发中,环境与逻辑手作成本极高。利用世界模型自动拟合游戏状态动态,可将内容生产边际成本降低 70% 以上;在仿真数据生成领域,可省去大量实车路采与人工标注开销。
- 增收:新的互动形式(如玩家自由探索的 AI 原生游戏)将创造全新付费点;面向企业的仿真数据平台可按合成数据量或时长收费。
- 体验提升:实时交互式生成让游戏世界对玩家行为响应更丰富、更一致,消除传统预定义规则的边界感,带来强沉浸式体验。
与现有产品/工作流的接口
论文提出的 动作-状态-观测循环 可无缝嵌入现有工业流程:
- 作为实时渲染插件:在 Unity 或 Unreal Engine 中,将世界模型作为自定义渲染后端,接收引擎提供的玩家动作和显式状态(位置、血量等),输出下一帧画面,与现有物理引擎、UI 系统并行工作。
- 融入数据标注管线:论文公开的 Black Myth: Wukong 数据集提供帧对齐的动作、状态与语义注解,可直接用于训练工业级 状态感知世界模型,并与已有标注工具(如 CVAT)集成。
- 与云游戏平台结合:在云端部署世界模型,实现交互式视频流的低延迟生成,升级云游戏体验。
具体落地用例:
- 游戏开发中台:某大型游戏公司可将世界模型作为内部工具,策划人员通过简单动作脚本即可生成大量长程、一致的游戏场景原型,大幅缩短预研周期。
- 自动驾驶仿真平台:企业基于世界模型构建 感知-规划闭环仿真系统,输入控制信号直接生成周围环境变化,用于测试 Planning 模型对长尾场景的应对能力,替代部分路测。
局限
- 本文主要贡献为分类框架与数据集构建,未提出新的交互式世界模型或算法,其分析的四个维度虽系统,但未通过实验验证不同方案组合的实际交互效果与定量指标。作为综述/数据集工作,缺少端到端闭环生成质量的客观评估基准,例如帧一致性、物理合理性、交互延迟等具体数值比较,这限制了论文对工程选型的直接指导价值。
- WildWorld 数据集仅基于《黑神话:悟空》单一游戏采集,尽管包含 90 小时数据与多种标注,但游戏类型偏向动作 RPG,其状态空间、动作粒度与渲染风格不能代表所有游戏类别(如策略、体育、开放世界驾驶等)。模型在此数据上训练可能过拟合到特定引擎的规则与视觉外观,泛化到其他游戏引擎或用户生成内容(UGC)场景时性能存疑,且数据收集管线依赖付费游戏与特定平台,可复现性与扩展性受到制约。
- 论文以经典 game loop 为组织视角,但未深入讨论生成模型替代传统渲染管线的根本矛盾:生成帧的不可控性与游戏逻辑确定性要求之间的冲突。例如,显式状态(如生命值、道具)在像素生成中如何保证准确对应、如何避免视觉伪影破坏玩法,这些工程落地关键问题未被充分剖析,对实际构建可玩原型仍留有不小空白。