论文

Game2World 引擎:解锁野外游戏视频用于世界模型训练

Game2World 引擎:解锁野外游戏视频用于世界模型训练

视频游戏为视频世界模型提供了可扩展的训练数据来源,涵盖多样化环境、复杂交互以及丰富的野外游戏视频。然而,原始游戏画面将游戏世界与屏幕空间界面纠缠在一起,引入特定游戏的偏差和无关动态,阻碍了世界模型的训练。为解决此问题,我们提出了 GameUI-Taxonomy 和 G2WEngine,一个全栈框架,用于规范化游戏 UI 的定位与去除。G2WEngine 能够自动从真实游戏视频中提取可复用的 UI 资产,并在干净画面上合成时间上连贯的 UI 叠加层。 利用该引擎,我们构建了 Game2World 数据集,包含 96K 对带有精确重建目标的合成视频,以及来自 303 款游戏的 1,079 个野外剪辑,用于真实评估。其资产库包含 5,132 个经过验证的 UI 元素,覆盖 21 个分类类别,采集自 1,010 个代表性游戏帧。基于 Game2World,我们提出了 GameCleaner,一种无掩码的游戏 UI 去除模型,结合了多模态语义理解与视频编辑能力。与基于掩码的方法不同,GameCleaner 直接识别并移除多种 HUD 元素,同时保留底层场景内容和时间动态。 在受控实验中,使用无 UI 游戏视频训练的世界模型在 VideoReward 上比使用叠加 UI 数据训练的模型提高了 6.83%。在 UI 去除评估中,GameCleaner 在合成视频上的平均 AAR 达到 95.36,比最强的时间掩码基线高出 57.3%,并在野外视频上取得了最佳的 AAR 80.05,同时实现了 99.8% 的背景保留。这些结果证明了将互联网游戏视频转化为高质量世界模型训练数据的可扩展潜力。代码、数据集和模型将在 https://github.com/Dongping-Chen/Game2World 提供。

论文精读

TL;DR 提出 G2WEngine 框架与 GameCleaner 模型,从原始游戏视频中自动剥离 HUD/UI 叠加层,生成干净训练数据,使世界模型 VideoReward 提升 6.83%。

问题

问题背景
当前视频世界模型(video world models)成为模拟复杂动态与具身智能的关键路径,训练数据质量与规模成为瓶颈。游戏视频凭借多样环境、复杂交互和丰富的 in-the-wild 素材,被视为极具潜力的可扩展数据源。

现有方法局限
然而原始游戏视频中屏幕空间 UI(HUD)与游戏世界高度纠缠——血条、小地图、任务提示、背包等元素引入了游戏特定偏差与无关动态。现有 UI 去除方法多基于 mask-based video inpainting,需要逐帧提供精确掩码,标注成本高、难以规模化;掩码不准导致背景破坏或去除不彻底;视频时序上易出现闪烁与不一致。同时缺乏大规模配对数据(带 UI / 无 UI 视频对)支撑监督训练与评估,使得自动识别并移除多样化 HUD 元素变得困难。

为什么这个问题难/重要
核心挑战在于:自动区分 UI 与场景内容需要多模态语义理解,同时必须保留底层场景的几何结构与运动连续性;不同游戏 UI 风格差异大,模型需要跨域泛化。业界关注度日益提升,因为世界模型是 AI 前沿方向,数据质量直接影响模型上限。论文初步实验显示,在去除 UI 的游戏视频上训练的世界模型相比带 UI 数据,VideoReward 提升 6.83%,验证了数据清洗的显著价值。从互联网游戏视频中自动提取干净数据,有望大幅降低数据采集成本,扩展世界模型训练语料。

行业类比
类似于从自然驾驶视频中自动剥离叠加的传感器读数、水印或字幕,以获取纯净的道路场景用于自动驾驶世界模型训练。

核心洞察

  • 将游戏视频中的屏幕UI视为世界模型训练的核心噪声源,并通过系统化移除将其转化为高质量训练数据,是本文区别于直接使用raw gameplay的关键。已有工作多直接混合UI进行训练或采用通用视频修复,而本文通过pilot study量化证明了UI-free数据使VideoReward提升6.83%,并构建了G2WEngine框架,首次将UI grounding与removal形式化,从资产提取、干净语料库策展到UI叠加合成都实现自动化,为大规模清洗游戏视频提供了可复现的工程路径。
  • 无掩码UI移除模型GameCleaner通过融合多模态语义理解与视频编辑能力,突破了传统掩码方法依赖精确掩码且对动态UI不鲁棒的局限。掩码方法需要预先生成或推断UI区域掩码,在复杂HUD、透明元素和时序变化下容易出错;GameCleaner则直接利用视觉-语言对齐识别UI元素并移除,同时通过视频编辑能力保持背景内容和时序动态。在合成基准上AAR达到95.36,比最强时序掩码基线高57.3%,在in-the-wild上AAR为80.05且背景保留99.8%,验证了该路线对真实游戏视频的泛化性和工程价值。

方法

输入与整体流程

本方法以 互联网游戏视频 为输入,目标是输出 无 UI 的游戏视频,作为视频世界模型的训练数据。整体分为两阶段:G2WEngine 负责构建合成配对数据,GameCleaner 负责学习 UI 移除模型。

G2WEngine:合成配对数据生成

  • GameUI-Taxonomy:定义了 21 类游戏 UI 元素(如血条、小地图、任务提示),从 1010 个代表性帧中收集 5132 个已校验 UI 资产。
  • UI 资产提取:自动从真实游戏视频中检测、分割并裁剪出可复用的 UI 元素,存入资产库。
  • 干净游戏语料:从无 UI 的游戏画面或修复后的视频中构建干净背景序列。
  • UI 叠加合成:将提取的 UI 资产按时间一致的布局叠加到干净视频上,生成 有 UI / 无 UI 的配对视频,并提供精确的重建目标(ground truth)。

GameCleaner:无 mask 的 UI 移除模型

  • 输入:有 UI 的游戏视频帧序列。
  • 关键模块:结合 多模态语义理解(识别 UI 区域和类型)与 视频编辑能力(基于时序扩散或 Transformer 的修复网络)。模型无需外部 mask,直接预测无 UI 的干净帧。
  • 训练:使用 Game2World-S 合成配对视频进行监督,损失函数包含重建损失、感知损失与时间一致性约束,以保持底层场景细节和运动动态。
  • 输出:与输入同等长度和分辨率的无 UI 视频,保留原始场景内容和时间连续性。

与同类方法的差异点

与传统的 mask-based 视频修复方法相比,GameCleaner 端到端识别并去除 UI,无需依赖精确的掩码输入,更适合大规模自动化处理多样化的真实游戏视频。

实验

论文实验围绕两个核心问题展开:验证 UI-free 视频对世界模型训练的增益,以及评估 mask-free UI 移除模型 GameCleaner 的性能。

实验设计

  • 世界模型实验:分别用 UI-free 和 UI-overlaid 的视频训练世界模型,使用 VideoReward 评估生成质量。
  • UI 移除评估:在 Game2World-S(96K 合成视频)和 Game2World-W(1,079 个真实游戏视频)上,与多种基线(包括 temporal mask 方法)对比,采用 AAR 和背景保持率作为指标,并使用 MLLM-as-a-Judge 进行评估。

关键发现

  • UI-free 训练带来 +6.83% VideoReward 提升。
  • GameCleaner 在合成基准上 AAR 95.36,比最强 temporal mask baseline 高 57.3%;真实基准上 AAR 80.05,背景保持 99.8%。

与基线对比

GameCleaner 的 mask-free 设计避免了 mask 标注需求,直接利用多模态语义理解定位 UI,并结合视频编辑能力在保持时空一致性的同时移除 HUD,这相比 mask-based 方法更接近实际应用。在真实数据上的优异表现表明其对多样游戏 UI 的泛化能力,为大规模从互联网游戏视频提取干净训练数据提供了可行路径。

行业影响

落地场景

Game2World Engine 与 GameCleaner 直接面向视频世界模型训练的数据清洗环节。游戏录屏数据规模庞大但混杂 HUD、弹窗、准星等屏幕空间 UI,去除后可作为高质量世界模型训练数据。该技术可迁移到任何含叠加元素的视频领域:

  • 电商视频:商品展示视频常叠加价格标签、促销角标,去除后用于训练视觉理解或视频生成模型,避免模型学习到 UI 伪影。
  • 内容平台:用户生成的游戏视频、教程视频含水印、字幕条,自动清理后可提升推荐系统特征质量或作为生成模型的干净素材。
  • 自动驾驶仿真:从游戏视频中提取干净场景,合成多样驾驶数据,辅助训练感知与规划模型。

商业价值

  • 降本:将人工逐帧清理 UI 的流程自动化,据论文数据,GameCleaner 在合成视频上平均 AAR 达 95.36,远超 mask 基线 57.3%,可显著减少人工审核与标注成本。
  • 增效:世界模型使用 UI-free 数据训练后,整体 VideoReward 提升 6.83%,直接改善下游生成任务质量。
  • 数据资产化:Game2World 数据集提供 96K 合成配对视频与 1,079 真实评估片段,可作为行业基准,促进第三方工具开发与模型评测。

跟现有产品/工作流的接口

  • 形式:提供 Python 库与预训练权重,输入单段视频,输出去除 UI 后的干净视频及 UI 定位信息,无需额外 mask 输入。
  • 集成路径:可作为数据预处理模块嵌入现有视频数据管线,与 ffmpeg、OpenCV、PyTorch 等工具链兼容;支持在 AWS/GCP 上以容器化服务部署。
  • 合成数据生成:利用 G2WEngine 的 UI 资产库(5,132 个已标注元素),可批量合成多样化的带 UI 视频,用于训练自己的去 UI 模型或数据增强。

具体 use case:

  • 电商:某视频购物平台每天产生数十万条商品短视频,用 GameCleaner 自动去除价格标签和优惠弹窗,得到干净商品画面,输入商品视觉生成模型,提高生成视频点击率与转化率。
  • 在线教育:课程录屏常带操作提示、鼠标轨迹等叠加元素,使用该框架清洗后,可提取纯净板书与演示画面,用于训练教学视频摘要模型,减少人工剪辑成本。

综上,该工作为「互联网视频 → 世界模型训练数据」提供了一条可规模化的工业级路径。

局限

  • 论文在讨论中承认,合成的 UI 叠加虽然高度可控,但与真实游戏中的 HUD 分布仍存在差距,尤其在特殊渲染效果(如半透明、动态模糊、视角扭曲)下可能失真,影响模型泛化。此外,世界模型训练实验仅在受控试点上进行,得到的 VideoReward 提升(6.83%)可能无法直接迁移到大规模或不同架构的世界模型上,实际收益有待验证。
  • Game2World 数据集规模相对有限(96K 合成对,1,079 段真实视频),难以覆盖海量游戏类型和 UI 风格;GameCleaner 依赖多模态语义理解自动识别 UI 区域,当 UI 与场景内容高度耦合(如游戏内嵌菜单、实体化 HUD)或光照剧烈变化时,可能出现误检或漏检,导致去除不彻底或背景破坏。mask-free 方法对语义分割精度的要求更高,而分割本身可能引入额外偏差。
  • 与现有基于 mask 的视频修复方法相比,GameCleaner 虽然免除了人工 mask 标注,但训练需要大规模配对数据,而合成数据与真实数据的分布差异可能限制其在 in-the-wild 场景下的表现(论文报告 in-the-wild AAR 为 80.05,低于合成基准的 95.36)。同时,该方法对底层多模态模型和视频编辑模型的依赖较强,若上游模型能力不足,整体性能会受约束。
论文Wenxuan Shen2026-08-25原文

相关内容