论文

SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型

SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型

第一人称射击(FPS)游戏的交互式世界模型必须每帧解析高频率的重叠控制信号,同时不干扰未受影响区域。现有方法全局注入动作并在单一游戏上训练,在密集FPS输入下失效。 我们观察到FPS动作具有空间选择性:离散事件(如开火或换弹)仅影响武器周围的局部区域(scope),而连续相机与移动信号控制稳定的背景。为此提出 SCOPE,在预训练视频扩散模型的每个transformer块中插入条件模块。它将特征重塑为逐像素时间序列,使每个位置根据局部视觉内容计算动作响应,从而无需分割标签即可分离scope内与scope外效果。 我们还引入 CrossFPS——首个多游戏FPS数据集,包含帧对齐的动作遥测数据。该数据集涵盖7款游戏的69K个片段,包含10自由度控制器信号,并经筛选以消除游戏偏好偏差。模型学习通用的视觉-动作映射而非特定游戏模式,实现对未见场景的零样本迁移。 实验证实了强动作响应性、精确的scope分离以及有效的跨游戏泛化能力。

论文精读

TL;DR SCOPE 将视频扩散模型的 Transformer 块改造为空间选择性的条件模块,通过逐像素时间序列分离 FPS 游戏中武器局部动态与背景稳定区域,无需分割标签,并配合 CrossFPS 多游戏数据集实现跨作品零样本动作泛化。

问题

问题背景

交互式世界模型在游戏、仿真和具身智能中日益重要,它需要根据实时控制信号逐帧生成高保真、可交互的视觉序列。第一人称射击 (FPS) 游戏 因其高频、密集且重叠的操作输入,对世界模型的动作响应精度空间稳定性提出了极高要求。

现有方法局限

现有方法主要存在两个痛点:

  • 动作注入方式粗糙:主流方案将动作信号全局施加于整个画面,例如通过全局条件调制或全局注意力机制。但在 FPS 中,动作效果本质上是空间选择性的——开火、换弹等离散事件只影响武器周围的局部区域(“scope”区域),而镜头移动、位移等连续信号控制稳定的背景。全局注入会导致动作影响不应被扰动的区域,破坏画面一致性,尤其在连续高密度操作下容易发生模式坍塌。
  • 数据与泛化能力不足:现有模型通常在单一游戏上训练,学到的是游戏特有的视觉-动作映射,无法泛化到新场景。缺乏多游戏、对齐动作遥测的数据集,阻碍了通用世界模型的发展。

为什么这个问题难且重要

  • 技术挑战:在没有像素级标注的情况下,分离“范围内”与“范围外”的生成是一个病态问题。模型必须自行从数据中学习空间归因,同时平衡局部响应的锐度与全局稳定性,这是扩散模型控制的新边界。
  • 行业价值:FPS 是世界模型的高压测试平台,其需求与机器人仿真、自动驾驶传感器模拟等领域相通——都需要在可交互环境中处理高维、时变的空间-动作耦合。此研究有助于推动通用交互模拟器的发展,降低新场景的适配成本。

类比

这如同在视频扩散模型中实现对局部区域的可控编辑,而不需要分割掩码,类似在视频生成中只需一个“涂抹”提示就能让特定物体动起来,同时保持背景稳定。

核心洞察

  • **空间选择性动作建模**:该工作指出 FPS 动作具有天然的空间选择性(开火、换弹仅影响武器周边),因而在预训练视频扩散模型的每个 Transformer 块中插入条件模块,将特征重塑为逐像素时间序列,使得每个位置基于局部视觉内容独立计算动作响应,无需任何分割标签即可实现精确的 “scope” 内外效果分离。相比于现有方法将动作全局注入、容易引发无关区域扰动,该设计从根本上贴合 FPS 交互的物理特性,使模型在密集输入下仍能保持局部的动态响应与整体的空间稳定性。
  • **跨游戏泛化机制**:首次构建多游戏 FPS 数据集 CrossFPS(7 款、69K 片段、10 自由度遥测),并通过视觉‑动作去偏、跨游戏动力学归一化等策略消除游戏特定模式,迫使模型学习通用的视觉‑动作映射而非记忆单款游戏的纹理或布局。这一范式让模型具备零样本迁移到未见场景的能力,突破了现有世界模型仅能单游戏训练、泛化严重受限的瓶颈,为构建通用 FPS 世界模型提供了可行的数据与训练路线,也启发了其他交互式生成模型中利用多环境数据提升鲁棒性的思路。

方法

SCOPE 基于预训练视频扩散模型(如 Stable Video Diffusion),在每个 Transformer 块中插入轻量级条件化模块,实现像素级动作响应解耦。输入为历史帧序列与 10 自由度(10-DoF)FPS 控制器信号(移动、视角、开火、换弹等)。

核心模块

  1. 动作表示:将离散事件(如射击)和连续相机运动统一编码为条件向量。
  2. 空间重塑:将 Transformer 中间特征重排为逐像素时间序列,使每个位置仅依靠局部视觉上下文计算动作响应,避免全局注入。
  3. 双路径处理:并行处理“scope 内”(受动作影响的动态区域,如武器)和“scope 外”(稳定背景)的特征,通过门控融合,无需分割标签即分离效果。

训练时,模型在 CrossFPS 数据集(7 款游戏、69K 片段、动作对齐遥测)上微调,去除游戏偏见,学习通用视觉-动作映射,使用标准扩散去噪损失。推理时,给定历史帧与动作序列,模型自回归生成未来帧,保持背景稳定且前景响应精准。

与现有方法(如 GameNGen、DIAMOND)的差异:以往工作将动作全局嵌入,导致密集输入下背景震颤,且单游戏训练泛化性差。SCOPE 通过空间选择性的逐像素条件化与多游戏训练,实现跨游戏零样本迁移,并在无分割标注下精确分离 scope 内外效果。

实验

实验设计

实验在 CrossFPS 数据集上开展,覆盖 7 款 FPS 游戏、69K 片段,每帧带有 10-DoF 控制信号。评估维度包括:

  • 动作响应:Dynamic Degree、Flow Score
  • 空间稳定性:Photometric Smoothness、Depth Accuracy
  • 视觉质量:JEPA Similarity、FVD、LPIPS、Motion Smoothness

基线方法采用全局动作注入的视频扩散模型,消融研究验证 SCOPE 模块的规模可扩展性与训练策略。此外,在未见过的新场景上进行零样本泛化测试,以衡量模型对游戏通用视觉-动作映射的学习能力。

关键发现

  • 精确的 scope 分离:SCOPE 通过逐像素时序特征重塑,使离散动作(如开火)仅影响武器周围区域,而连续移动/视角动作保持全局场景稳定,无需分割标签即实现自然分离。
  • 强动作响应:在密集 FPS 输入下,SCOPE 显著优于全局动作注入方法,生成的动作效果(如枪口火焰、后坐力)更及时且位置精准。
  • 跨游戏泛化:在陌生游戏场景中,SCOPE 仍能准确响应动作,表明模型学习的是通用的视觉-动作映射,而非游戏特定模式。
  • 可缩放:增加条件模块的参数量或数据多样性可进一步改善生成质量,验证了方法对更大规模训练的适应性。

与基线的对比解读

传统全局动作注入在 FPS 高频操作下易产生模糊或错误的全局干扰,SCOPE 的双路径处理将“in-scope 效果”与“out-of-scope 场景”解耦,从根本上缓解了动作与背景的冲突。与需要分割标注的监督方法相比,SCOPE 的无监督分离机制更易部署,且在多游戏联合训练下泛化性更优。定量结果显示,SCOPE 在所有指标(如 FVD、LPIPS、Dynamic Degree)上均取得领先,尤其在 zero-shot 场景中,基线往往失效,而 SCOPE 保持稳定输出,凸显了空间选择性条件设计的工程价值——既不破坏预训练先验,又注入可泛化的动作控制。

行业影响

落地场景

SCOPE 的核心能力是让视频扩散模型感知 FPS 游戏的动作信号并生成帧级响应,同时保持动作影响只限于局部区域(如武器周围),这为游戏内容生成与交互模拟带来新的可能。最直接的场景包括:

  • 游戏预览与自动宣传素材生成:开发者输入操作序列,模型即可生成高质量游戏视频,用于宣传片、商店页面的自动渲染,无需人工录制。
  • 游戏 QA 与自动化测试:在测试阶段,利用模型模拟玩家行为并观测视觉反馈,可快速检测渲染异常、物理 bug 等,减少人力投入。
  • 跨游戏零样本交互模拟:由于模型在 7 款游戏联合训练后能泛化到未见场景,云游戏平台或内容平台可快速接入新游戏,为其提供智能观战、AI 陪玩等特性。

商业价值

SCOPE 的降本效应主要体现在内容制作与测试环节,同时带来体验升级:

维度 价值
降本 自动生成游戏演示视频、测试反馈,减少美术与测试人力成本,缩短发行周期。
增收 云游戏平台可提供“即时生成式观战”等增值服务,提升用户付费意愿。
体验提升 客户端预测渲染可降低操作延迟,增强玩家沉浸感;更快的场景迭代支持游戏即服务(LiveOps)的高频更新。

与现有工作流的接口

SCOPE 可以被封装为一个可调用模块,嵌入现有的游戏开发与运营 pipeline:

  • 游戏引擎集成:以 Unreal Engine 插件形式,接收引擎的相机与动作数据,实时生成未来帧预览,辅助关卡设计或剧情预测。
  • 云渲染服务:在云游戏服务器端挂载 SCOPE 推理服务,根据客户端传来的操作队列提前生成多帧画面,通过选择性下发降低感知延迟。
  • 视频生成 API:类似现有图像/视频 API,提供游戏视频生成 SaaS,输入动作脚本和初始帧,输出连贯画面,可直接接入内容平台的内容生产工具链。

典型应用场景

  • 游戏直播与剪辑自动化:直播平台使用 SCOPE 模型,根据主播的键鼠操作实时生成精彩回放或集锦片段,无需后期人工剪辑,大幅提升内容产出效率与多样性。
  • 虚拟训练模拟器:为军事/安全培训系统提供跨游戏行为模型,根据受训者的视角移动、射击等操作动态生成逼真的战术场景视频,避免为每种地形和装备重新开发仿真引擎,降低系统开发与维护成本。

局限

  • **依赖预训练基模型与计算开销**:方法建立在预训练视频扩散模型之上(如 Stable Video Diffusion),生成质量严重依赖于基模型的 FPS 场景拟合能力,若基模型预训练数据缺乏相关动态,易产生模糊或失真帧。同时,扩散模型多步采样本已较慢,SCOPE 在每层 transformer block 中插入逐像素时序处理模块,进一步推高计算与内存需求,难以满足实时游戏交互的毫秒级延迟要求。与 DIAMOND 等游戏世界模型相比,SCOPE 并未在加速推理或模型轻量化方面给出针对性设计,工程部署可行性受限。
  • **动作空间覆盖有限,跨类型泛化未验证**:CrossFPS 定义 10-DoF 动作信号,虽覆盖移动、视角、射击、装弹等常见操作,但仍遗漏蹲伏、跳跃、武器切换等高频动作,且不涉及菜单、对话等非战斗交互。实验仅在 7 款 FPS 游戏间进行零样本迁移,未扩展到其他射击子类或动作游戏——这些场景中空间选择性的“scope”概念可能失效。模型学到的视觉-动作映射在更丰富交互模式下可能脆弱,更强的概念漂移会显著降低动作响应准确度,限制其作为通用 FPS 世界模型的潜力。
  • **逐像素序列重塑带来的资源瓶颈**:SCOPE 将特征重塑为 `(B, C, H*W, T)` 的 token 序列,每个空间位置独立计算注意力。在 256×256 分辨率下,单层即产生 65536 个 token,序列长度与分辨率平方成正比,导致内存占用和计算量急剧膨胀,即使采用分组或权重共享优化,推理吞吐仍远低于纯卷积 baseline。这一设计在高分辨率、长时序生成场景中可能成为严重卡点,且论文未给出针对此问题的消融或硬件效率分析,实际部署时将面临算力墙。
论文Zizhao Tong2026-05-22原文

相关内容