论文

EgoCS-400K: 用于世界模型的以自我为中心的游戏数据集

EgoCS-400K: 用于世界模型的以自我为中心的游戏数据集

从视频生成到交互式世界建模的转变对数据提出了新的要求:除了带字幕的视频外,世界模型还需要时间对齐的视频-动作-语言轨迹,这些轨迹基于驱动未来场景变化的动作、相机运动、状态和事件。然而,大规模获取此类数据很困难。网络视频数据集提供广泛的视觉覆盖,但缺乏可执行的动作和可靠的状态;机器人数据集提供动作和状态监督,但成本高且场景多样性有限;现有模拟器通常缺乏大规模人类驱动的交互轨迹。 本文介绍了 EgoCS-400K,一个大规模基于回放的第一人称反恐精英(Counter-Strike) 数据集,用于世界模型。该数据集基于公开的专业CS和CS2比赛回放构建,保留了人类游戏轨迹,支持解析、回放、渲染和时间对齐。我们提取玩家状态、视角方向、移动、键盘/按钮输入、视角变化、武器使用、游戏事件和回合级上下文,并从相同轨迹渲染干净的第一人称视频。EgoCS-400K包含超过40万段第一人称视频和1万小时游戏时长,来自1000多场比赛和4万回合,覆盖13张地图,每回合10个玩家视角。 该数据集支持多种交互式视觉建模任务,包括: 1. 动作条件未来预测 2. 状态和事件感知场景推演 3. 基于回放的描述生成 4. 智能体第一人称动作理解 通过将视觉观察与人类动作、相机运动、游戏状态和事件在大规模上连接,EgoCS-400K成为被动网络视频、可控游戏模拟和昂贵现实世界具身数据之间的实用桥梁。

论文精读

TL;DR EgoCS-400K 是一个大规模第一人称 CS 游戏数据集,提供视频、动作、状态和事件的对齐轨迹,为世界模型提供稀缺的动作与状态监督,衔接了被动视频与具身数据。

问题

问题背景

视频生成模型正从生成静态视频向交互式世界模型演进,后者需要理解动作如何改变未来场景。这要求训练数据不仅是标注视频,更要包含时间对齐的视频-动作-语言轨迹,涵盖玩家状态、相机运动、游戏事件等驱动场景变化的要素。

现有方法局限

当前主流数据源各有短板:

  • Web 视频数据集(如 Kinetics)覆盖面广,但缺乏可执行的动作信号和可靠的环境状态,无法用于训练控制策略或预测动作后果。
  • 机器人数据集(如 Open X-Embodiment)提供精确的动作与状态监督,但采集成本高,场景多样性有限,难以覆盖长尾交互。
  • 游戏模拟器(如 CARLA、Habitat)虽可合成数据,却缺少大规模人类操作轨迹,导致行为不自然或分布窄。

这些方法本质上是被动观察昂贵交互的两极:一边是仅记录视觉而忽略因果关系,另一边是采集精细但难以扩展。世界模型训练急需一条中间路径,将人类演示的丰富性可复现的动作-状态标注结合。

为什么这个问题难且重要

构建世界模型的核心难点在于时空对齐:视频帧需要与动作、相机朝向、游戏内事件(如开火、受伤)精确同步。传统解析流水线难以从海量回放文件中自动提取这些信号,且渲染一致性要求高。业界对这一方向的关注度极高,因为一旦在可控游戏环境中验证世界模型,相关技术可无缝迁移到自动驾驶、机器人仿真等领域,降低对真实世界数据的依赖。

该赛道相当于为视觉学习系统提供了一个可控的数字沙盒——类似强化学习中的 Atari 环境,但更贴近真实交互的复杂性。

核心洞察

  • EgoCS-400K 通过解析职业《反恐精英》比赛回放,提供了大规模且精密时间对齐的视频-动作-语言轨迹,弥补了现有世界模型数据类型在动作可执行性、状态监督和场景多样性上的缺口。与被动网络视频缺乏动作和状态不同,它从游戏回放中提取了玩家输入、视角变化、武器使用、游戏事件和回合上下文;与机器人数据集相比,它覆盖多张地图和多个玩家视角,场景多样性远超真实具身数据;与模拟器生成的合成数据不同,它保留了人类专业选手的真实交互轨迹,为训练世界模型提供了可扩展的监督信号。
  • 该数据集构建了从非交互式视频生成到可控世界模型的实用桥梁,通过回放基础的渲染和标注,使模型能够学习动作条件化的未来预测和状态感知的场景展开。传统视频生成模型缺乏对动作和相机运动的精确控制,而具身数据集场景受限。EgoCS-400K 利用游戏引擎的可重放性,低成本获得像素对齐的视觉-动作对,并提供细粒度事件和状态标签,使模型能训练出理解因果交互的能力,为交互式世界模型和游戏AI代理提供关键训练资源。

方法

数据采集与渲染

从公开职业比赛 Demo 文件(.dem)出发,利用 CS:GO/CS2 游戏引擎精准重放(replay)原始人类操作轨迹,渲染为干净的第一人称视频帧。此阶段同时过滤无效或低质量片段,确保视频素材对应真实玩家交互,而非脚本或 bot 行为。

轨迹解析与分割

从 Demo 中提取逐帧结构化数据,形成时间密集的多模态监督:

  • 玩家状态:位置、血量、护甲、弹药、经济等;
  • 操控输入:键盘(WASD)、鼠标(视角角度变化)、功能按键(射击、换弹、切换武器);
  • 摄像机运动:精确的视点方向与角速度;
  • 游戏事件:击杀、死亡、助攻、爆炸等,并关联到具体的回合上下文(如炸弹安放/拆除)。

系统将长段比赛切分为回合级片段,每个片段保留 10 名玩家各自的完整第一人称视角轨迹,便于模型学习多智能体交互动态。

先验引导的 VLM 字幕生成

为获取自然语言监督,采用先验过滤(prior filtering)策略:将 Demo 解析得到的结构化动作序列、事件标签转化为段级先验(segment-local prior),作为视觉语言模型(VLM)的提示上下文。VLM 基于第一人称视频帧生成描述时,必须引用先验中的具体操作与事件,从而抑制幻觉,产出具有即时对齐的游戏行为字幕(例如“玩家向左移动并射击,击杀敌人后换弹”)。该流程同时输出动作条件化的未来预测描述,直接服务于世界模型的训练目标。

方法特色

与仅依赖视频-文本对的网页数据或高成本机器人示教相比,EgoCS-400K 利用 Game Demo 天然的时间对齐特性,以极低成本获得可执行的动作、精确状态、丰富事件的强监督,并覆盖广泛场景与人类操作多样性,构成从被动视频到可交互世界模型的桥梁。

实验

该论文围绕 EgoCS-400K 数据集设计了四种核心任务,评估其对世界模型的支撑能力:

  • 动作条件未来预测:给定当前帧与动作序列,生成未来视频帧;
  • 状态与事件感知的场景推演:融入玩家状态和游戏事件,实现可控场景生成;
  • 重放指导的视频描述:利用状态先验辅助视觉语言模型,生成细粒度时序字幕;
  • 智能体自我中心动作理解:从第一人称视频预测玩家下一步操作。

实验按比赛和回合切分训练/验证集,保证无信息泄漏。评估指标覆盖生成质量(FVD、LPIPS、PSNR)、描述准确性(CIDEr、BLEU)及动作预测准确率。

(因提供的论文摘录未包含具体实验数值,无法列出定量对比结果。)

从设计意图看,该数据集的核心创新在于将 大规模人类操作轨迹精确的动作‑视觉‑语言对齐 相结合,有望解决现有世界模型数据中动作缺失或场景局限的难题。通过在同一渲染引擎中同步记录视觉、输入和游戏事件,EgoCS-400K 为模型提供了因果一致的交互信号。与仅使用被动网络视频的基线相比,训练出的模型预期在长程一致性和精细可控性上获得显著提升;与依赖昂贵机器人采集的表征性数据相比,EgoCS-400K 以极低成本提供了更丰富的场景多样性与动作标注,为世界模型研究构建了一个资源丰富且易复现的公开基准。

行业影响

落地场景

EgoCS-400K 以第一人称游戏视频为载体,提供高精度的 视频-动作-语言对齐轨迹,可直接赋能以下产品与业务:

  • 交互式世界模型与视频生成:用于训练条件视频生成模型(如 GameNGen、Sora 类模型),实现动作驱动的未来帧预测、状态感知场景展开,支撑游戏内容自动生成、虚拟世界实时渲染等。
  • 具身智能与机器人:在多样化的 3D 环境中,以极低成本提供带完整动作与状态标注的自我中心视觉数据,用于预训练视觉-语言-动作(VLA)模型,或作为 sim-to-real 的中间桥梁。
  • 游戏与仿真训练:为 NPC 行为建模、游戏测试自动化、教练 AI 与精彩片段自动解说提供大规模人类玩法轨迹。

商业价值

  • 降本:替代昂贵且场景单一的机器人数据采集,将高质量具身交互数据的获取成本降低数个数量级,同时覆盖 13 张地图、10 种玩家视角,显著提升数据多样性。
  • 体验提升:推动下一代交互式娱乐体验——游戏引擎根据玩家操作实时生成画面与情节;训练出的世界模型可令数字孪生、虚拟试驾等应用更逼真、响应更自然。
  • 增收:为 UGC 平台提供自动剪辑、智能解说、AI 主播能力;也可为游戏内广告投放提供精准上下文理解,提升转化。

与现有产品/工作流的接口

  • 模型训练管线:数据统一以 (video, action, state, event, caption) 五元组组织,兼容主流视频生成框架(如 Stable Video Diffusion、VideoPoet)及具身模型训练流程(如 OpenVLA)。
  • 仿真环境:基于 Source 2 引擎的可重放特性,可与 RL 环境(如 Gym-compatible 接口)集成,直接输送到策略学习或规划模块。
  • 多模态理解:结合视觉-语言模型(VLM)的预标注与细粒度状态/事件标签,可快速微调视频问答、行为识别、第一人称叙事生成等下游模型。

具体落地 Use Case

  1. 电商 AR 虚拟购物:利用 EgoCS-400K 的自我中心动作理解能力,训练虚拟试衣间中的 AI 助手,使其能根据用户手势和视角变化,实时渲染服装上身效果与物理交互,营造沉浸式购物体验。
  2. 内容平台体育赛事解说:借鉴游戏中回合级上下文与事件标注,训练模型自动分析 CS2 竞技录像,生成媲美专业解说的实时语音旁白,并可迁移至真实体育赛事的自动集锦与高光时刻生成。

局限

  • **视觉领域偏差与真实世界迁移困难**: 数据取自游戏引擎渲染的第一人称视频,尽管渲染质量高,但与真实摄像头的成像特性(噪声、动态范围、模糊等)仍有显著差异。这种领域鸿沟可能导致在 EgoCS-400K 上训练的世界模型难以直接泛化到真实机器人或 AR/VR 的视觉观测,限制了其在真实具身智能场景中的实用性。
  • **高度专业化的行为分布**: 数据来源于专业 CS 比赛,玩家行为集中在战斗、移动、射击等竞争性任务,缺乏日常交互、探索或事故等多样化行为模式。这使得基于该数据集训练的动作预测或场景推演模型容易过拟合到狭窄的战术行为空间,对通用世界模型所需覆盖的广泛人类活动分布覆盖不足。
  • **动作与状态空间的封闭性**: 动作信号局限于离散的键盘/鼠标事件和游戏内定义的状态(如血量、武器类型),无法提供连续控制(如力矩、关节角度)或精细操作(如抓取、转动)的监督。这使得该数据难以直接用于需要物理交互建模的任务,例如操控机器人灵巧手,其价值主要停留在视觉-键鼠动作级别的游戏环境建模。
论文Rongjin Guo2026-06-16原文

相关内容