论文

GameWAM: 视频游戏的世界动作模型

GameWAM: 视频游戏的世界动作模型

现代视频游戏融合了第一人称感知、快速视觉变化、持久世界状态和异构原生控制。现有游戏代理直接将视觉和任务上下文映射到动作,但缺乏显式的世界动态建模;而交互式游戏世界模型则根据提供的动作预测视觉未来,但并不能作为任务策略。世界动作模型 (World-Action Models, WAMs) 统一了这些目标,但在视频游戏的动态和开放交互下仍未被充分探索。我们提出了 GameWAM,据我们所知,这是首个用于原生闭环游戏玩法和 GUI 控制的 WAM。 GameWAM 通过并行的视觉和动作生成过程,结合块因果条件 (block-causal conditioning) 和流匹配 (flow matching),联合生成未来的视觉观察和可执行的键盘-鼠标轨迹。为支持联合世界-动作学习,我们构建了同步的游戏玩法和 GUI 轨迹。为处理异构原生控制,GameWAM 在每个动作步骤预测一个游戏玩法/GUI 模式,并使用模式特定预测分布和连续动作归一化生成动作。对于长时程交互,块循环控制 (block-cycle control) 预测超出承诺时域的未来,仅执行短动作前缀,并从新观察重新规划,而循环内细粒度上下文和层级跨循环历史则保持了时间连续性。 实验表明,与对比代理相比,GameWAM 以更少的原生动作执行实现了竞争性的任务成功率。我们还发现了低频动作源印记 (Low-Frequency Action Source Imprinting, LASI),即采样动作源的低频分量在固定条件下系统地引导粗略的生成相机运动,揭示了生成控制中的源敏感性失败模式。项目页面:https://yunncheng.github.io/GameWAM/。

论文精读

TL;DR GameWAM 是首个面向原生游戏/GUI 操控的世界-动作模型,通过并行视觉与动作生成、block-causal 条件与 flow matching,同时预测未来画面与可执行键鼠轨迹,以更少的原生动作实现竞争性任务成功。

问题

问题背景:视频游戏作为测试通用智能体的高动态环境,业界正聚焦世界模型与动作策略的融合。

现有方法局限:当前游戏代理(如 VPT )将视觉与任务上下文直接映射为离散/连续动作,缺乏显式世界动力学建模,难以应对需要长期规划或物理一致性约束的任务;而交互式世界模型(如 DIAMOND )仅从给定动作预测未来视觉,不产生可执行动作,需额外策略网络桥接,造成模块间隙与误差累积。两类方法均未统一视觉预测与动作生成,尤其面对游戏原生控制的异构性(键盘、鼠标、GUI 点击)与快速视角变化时表现不足。

为什么难/重要:视频游戏的第一人称视角、高频视觉变化和持久世界状态(背包、血量、环境记忆)对模型的长时程一致性与因果关系提出高要求;同时生成未来帧和动作轨迹需要在多模态输出间保持对齐,避免模式坍缩。GameWAM 采用块因果流匹配与块循环重规划,尝试解决长期交互与异构动作问题,但如何平衡生成质量、控制精度和推理延迟仍是挑战。业界关注此类统一模型在游戏 AI、机器人仿真和自动驾驶模拟中的迁移潜力。

行业类比:类似自动驾驶中将世界模型与规划器合并为单一生成式网络,GameWAM 对游戏控制做了同构尝试,减少模块化误差并提升样本效率。

核心洞察

  • GameWAM 首次将世界模型与动作策略统一为单一生成式架构,用于原生视频游戏闭环控制。以往游戏智能体仅将视觉和任务上下文直接映射到动作,缺乏显式世界动态建模;交互式世界模型虽然能从给定动作预测未来视觉,却不能直接作为任务策略。GameWAM 通过块因果流匹配,在同一前向过程中并行生成未来观测和可执行键鼠动作,实现想象、规划与执行的隐式耦合。工程上,这消除了独立世界模型与策略网络之间的表示错位和额外推理延迟,为具身智能和游戏 AI 提供了更紧凑的架构范式。
  • 块循环控制以“超越承诺视域预测 + 短前缀执行 + 新观测重规划”解决长程交互中的误差累积。与固定视域开环执行或单步自回归不同,GameWAM 在一个块内生成多步动作与视觉,但仅执行前几步,然后根据新观测重新规划。同时通过块内细粒度上下文与跨块层次记忆保持时间连续性。在 Minecraft 和 ViZDoom 上,该机制以更少执行步骤达到有竞争力的任务成功率,说明部分规划与重规划可以在全局一致性和局部适应性之间取得平衡,对实时控制系统的部署有直接借鉴意义。
  • LASI(低频动作源印刻)揭示了生成式控制模型对采样动作源频率成分的系统性敏感。在固定条件化下,采样动作源的低频成分会主导生成相机运动的整体趋势,即使动作内容不同也出现源一致性偏差。这不同于常见的预测误差漂移,而是生成模型内部路径对源分布的频率选择性放大。该发现提示在评估和部署生成式控制模型时,需要区分模型能力与源分布偏差,可通过频率分解、源空间对照等手段进行诊断,为生成控制的可控性研究提供了新的测试维度。

方法

GameWAM 的输入包括当前视觉观察、任务上下文与历史交互轨迹(按块组织)。方法围绕三个关键模块展开。

联合视觉-动作生成:采用平行生成过程,视觉流与动作流并行处理,通过 block-causal conditioning(块因果条件化)和 flow matching(流匹配)训练。这使模型同时预测未来视觉帧和对应动作,而非仅映射感知到动作。视觉生成侧重世界动态,动作生成输出可执行键盘/鼠标轨迹。

异构原生动作建模:在每个动作步预测当前交互模式(gameplay 或 GUI),使用 mode-specific prediction distributions 分别建模不同模式的动作分布,并通过 continuous-action normalization 处理连续动作(如鼠标位移)的尺度差异。这使单一模型能应对游戏内移动、攻击与 GUI 点击、拖拽等混合控制。

长时程闭环控制:采用 block-cycle control,模型预测整个规划周期内的动作序列,但仅执行短前缀,随后从新观察重新规划。为保持时间连续性,引入细粒度 within-cycle context 和层次化 cross-cycle history(短期 buffer 与多尺度长期更新),避免长轨迹中的漂移。

输出为未来视觉观察和可执行动作序列(含模式标签),可直接驱动游戏闭环运行。

与直接映射视觉到动作的现有 agent 或仅预测视觉的 game world model 相比,GameWAM 在统一框架内同时进行世界建模与策略输出,实现原生闭环游戏与 GUI 控制。

实验

实验设计

GameWAM 在 Minecraft MCU 和 ViZDoom 两个原生游戏环境上进行闭环评估,覆盖第一人称视角、快速视觉变化、持续世界状态和异构原生控制。评测使用事件锚定的轨迹数据,包括脚本化的 GUI 轨迹和从 VPT 数据集提取的 gameplay 轨迹,以支持联合世界-动作学习。此外,论文还进行了跨游戏零样本迁移实验,将模型迁移到 VoxeLibre。

关键发现

  • 在任务成功率上,GameWAM 与基线智能体相比具有竞争力,同时执行的原生动作数量更少,表明其 块循环控制 和 模式特定预测分布 能有效降低动作冗余。
  • 论文揭示了一种新的失败模式 低频率动作源印记 (LASI):在固定条件化下,采样动作源的低频分量会系统性地引导粗略的相机运动生成,暴露了生成控制在源敏感性方面的局限性。
  • 消融实验(附录)显示跨模态掩码影响控制、世界建模和推理效率之间的权衡。

与基线的对比解读

传统游戏智能体直接将视觉和任务上下文映射为动作,缺乏显式世界动态建模;交互式世界模型则只预测视觉未来而不生成策略。GameWAM 统一两者,通过 块因果流匹配 联合生成未来观测和可执行动作,在保持任务成功率的同时减少了原生动作的执行次数。该优势可能源于模型在动作生成时显式利用世界动态,以及 块循环重规划 在长时程交互中及时利用新观测修正策略,而 LASI 的发现提示生成控制需要额外的源正则化或去偏机制。

行业影响

落地场景

GameWAM 作为原生视频游戏的世界-动作模型,可直接用于 游戏自动化测试、NPC 行为生成 与 GUI 自动化。其 block-cycle replanning 支持长程交互,适合开放世界、FPS、模拟经营等类型。在软件领域,模型可从屏幕视觉生成键盘鼠标轨迹,覆盖重复性 UI 操作场景。

商业价值

  • 降本:游戏 QA 人力成本高,GameWAM 可减少回归测试时间,GUI 自动化降低脚本维护开销。
  • 体验提升:智能 NPC 增强游戏沉浸感,生成式控制可作为游戏助手(代打、陪玩、自动演示)。
  • 新服务形态:模型可封装为云 API,为游戏厂商或企业提供 AI 测试、流程自动化服务。

与现有产品/工作流集成

GameWAM 通过微调适配特定环境,输出原生键盘鼠标事件,可直接对接游戏引擎日志、测试框架(如 Selenium、Appium)或 RPA 平台。例如,电商平台的 GUI 回归测试中,模型仅凭视觉状态生成点击/输入序列,减少元素定位依赖;内容平台的后台审核流程,可借助 GameWAM 将截图映射为操作轨迹,替代部分人工审核。教育模拟软件中,模型可作为智能助教,基于画面演示操作步骤。核心集成点在于:视觉输入→动作输出的闭环接口,与现有自动化工具链兼容。

局限

  • 论文仅在两个游戏环境(Minecraft MCU 和 ViZDoom)上评估,且跨游戏迁移只测试了 VoxeLibre 零样本,泛化到更广泛的游戏类型和开放世界交互仍有待验证。作者发现的 Low-Frequency Action Source Imprinting (LASI) 表明,在固定条件源下,生成动作的低频成分会系统性主导相机运动,这种失败模式可能在实际部署中造成不可预测的轨迹,影响闭环控制的安全性和稳定性。
  • 联合视觉与动作生成需要同步的视觉-动作轨迹数据,论文通过事件锚定提取和脚本化 GUI 构造来建立数据集,这一过程成本较高且可能引入数据分布偏差。此外,flow matching 在推理时需要多步采样,相比直接策略网络增加了计算开销,对实时游戏(如高帧率 FPS)的部署构成挑战;同时并行生成视觉与动作也增加了模型容量需求,可能限制规模扩展。
  • 与单独的游戏世界模型或专用游戏 agent 相比,GameWAM 虽然首次统一了世界建模与原生动作生成,但实验结果显示任务成功率仅为“有竞争力”(competitive),并未在性能上显著超越现有 agent,部分收益来自执行动作数量更少。对比基线可能未包含最新的基于大语言模型或决策 Transformer 的强 agent,且 GUI 控制的评估相对简单,缺少复杂界面下的深层交互测试,因此其优势的稳健性仍需更多基准验证。
论文Yuncheng Guo2026-08-25原文

相关内容