论文

可编程世界模型

可编程世界模型

近期视频世界模型能生成愈发逼真、可交互的视觉体验,却缺乏在长时交互中维持持久世界状态并强制执行可编程规则的可靠机制。为此,我们提出 Programmable World Model,一个将世界状态演化与视觉观测生成解耦的框架。 其核心设计包括: - 可执行规则:由 agent 将自然语言指令翻译为可执行程序,显式指定实体状态与状态转移规则,从而直接控制单个实体及其交互; - 持久世界状态:轻量引擎执行这些程序,更新并维护显式的全局世界状态,涵盖屏外实体与非视觉属性; - 中间表示:引入 state-augmented 3D oriented bounding boxes (OBBs) 连接世界状态与视觉生成,并与目标相机轨迹一起被确定性编译为像素对齐的时空条件信号,驱动预训练视频模型作为生成式渲染器。 该设计让用户能够创建具有预设机制、可操控单个实体、且在整个游戏过程中保持持久世界状态的可玩游戏。我们还提出 CombatStateBench 基准用于评测可编程世界模型。 在该基准上,本方法取得 94% Count Accuracy 与 98% State Accuracy,大幅超越现有交互式视频世界模型,并支持连贯的长时程生成,表明将显式状态演化与生成式渲染分离,是构建持久、可编程世界的有效途径。

论文精读

TL;DR Programmable World Model 将世界状态演化与视觉生成解耦:用可执行程序维护持久全局状态,经 3D 定向包围盒桥接预训练视频模型渲染,实现可编程、长时一致的游戏级交互世界,在 CombatStateBench 上准确率大幅领先。

问题

问题背景:视频世界模型(video world models)近期在生成逼真、可交互视觉体验上进展显著,但领域正从“能生成”转向“能长期、可编程地维持世界”。

现有方法局限:现有交互式视频世界模型通常将世界状态隐式编码在生成过程中,缺乏显式持久状态与规则执行机制。具体表现为:

  • 难以在长时程交互中保持实体一致性,离屏实体状态易丢失,非视觉属性(如生命值、冷却时间)无法可靠追踪。
  • 用户指令通常映射为文本条件或低层控制,无法对单个实体进行细粒度操控或定义状态转移规则。
  • 生成过程与状态演化耦合,导致相同初始状态可能产生不一致的视觉结果,规则无法稳定贯彻执行。

为什么难/重要:构建可编程世界模型的技术挑战在于:一方面需要将自然语言指令编译为可执行程序,显式更新全局状态,包括视觉外观之外的属性和离屏信息;另一方面需要将离散状态精确对齐到高维像素空间用于生成渲染,避免纹理漂移和几何错位。这种显式状态与生成渲染的分离,业界关注已久,因为它直接关系到游戏引擎式的内容生成、自主智能体训练环境构建,以及可复现的仿真测试。

行业类比:该架构与游戏引擎中“逻辑状态层”和“渲染层”解耦的思路一致,类似用可编程规则驱动生成式渲染器,为可交互视频内容提供可验证、持久的运行基础。

核心洞察

  • PWM 的核心创新是将世界状态演化与视觉生成显式解耦,用可执行程序维护全局状态,视频模型仅作为渲染器。传统交互式视频世界模型依赖神经网络的隐式记忆,难以保证长时程状态一致性和规则执行。PWM 通过轻量引擎执行用户定义的规则,显式跟踪实体状态(包括屏幕外与非视觉属性),再将状态转化为渲染条件,从而在生成质量和状态可控性之间找到平衡,为需要持久、可编程环境的游戏或仿真场景提供了工程上可行的路径。
  • 状态增强的 3D OBB 作为中间表征,实现了从符号状态到像素级条件的确定性编译。与直接将状态向量注入生成模型的方法不同,PWM 将实体状态编码为具有空间定位和朝向的 3D 定向包围盒,并基于相机轨迹投影为一致的时空条件信号。这种确定性中间层既保留了显式状态的可解释性和可编辑性,又能精确对齐像素,避免预训练视频模型对模糊条件信号的猜测,是连接逻辑世界与生成渲染的关键设计。

方法

输入:自然语言指令

用户提供描述游戏机制、实体属性和交互规则的自然语言指令。

关键模块

  1. Agent 编排的 Box World:一个 agent 将指令翻译为可执行程序,程序明确指定每个实体的状态和状态转移规则。轻量引擎执行这些程序,维护一个显式的、持久的全局世界状态,涵盖屏幕外实体和非视觉属性。
  2. 控制编译:引入 state-augmented 3D oriented bounding boxes (OBBs) 作为中间表示,携带实体状态和几何信息。这些 OBB 与目标相机轨迹一起,被确定性编译为像素对齐的时空条件信号,供下游生成模型使用。
  3. 生成渲染器:预训练视频模型作为生成渲染器,接收条件信号生成视频帧。为实现长程生成,采用 chunk-autoregressive 策略,结合 temporal history 和 geometry-aligned spatial memory,保持视觉连贯性和状态一致性。
  4. 自动训练数据管道:从视频数据中自动提取相机参数、语义类别、实例分割与追踪、物体轨迹,生成条件图用于训练渲染器。

输出

生成可交互、持久一致的游戏视频,支持直接控制单个实体和预定义游戏机制。

跟同类方法的差异点:与直接让视频模型隐式记忆状态的交互式世界模型不同,该方法通过显式程序状态引擎和几何中间表示,将世界演化与视觉渲染解耦,实现了实体级精确控制和长程状态保持。

实验

实验设计

  • 引入 CombatStateBench 作为可编程世界模型的评测基准,核心指标为实体计数准确性与状态准确性。
  • 方法流程:自然语言指令 → 可执行程序 → 显式全局状态更新 → state-augmented 3D OBB 中间表示 → 像素对齐时空条件信号 → 预训练视频模型生成帧。
  • 重点验证状态演化与视觉生成解耦后,在长时程交互中的计数保持、状态一致性及可玩性。

关键发现

  • 在 CombatStateBench 上达到 94% Count Accuracy 与 98% State Accuracy,显著超越现有交互式视频世界模型。
  • 支持长时程一致生成,包括离屏实体与非视觉属性的持续维护,说明显式状态引擎可有效避免生成模型的状态遗忘。
  • 3D OBB 作为中间表示,将程序化状态稳定编译为生成条件,降低了对生成模型内部记忆的依赖。

与基线的深度对比

  • 现有交互式视频模型缺乏持久状态与规则执行机制,多步交互后常出现实体计数错误或状态漂移;本方法将状态演化托付给确定性引擎,再让生成模型只负责渲染,从架构上规避了状态漂移问题。
  • 工程启示:在游戏、仿真等需要长期一致性的场景,应优先采用“显式状态 + 生成渲染”的设计,而不是让端到端模型同时承担状态维护与视觉合成。

行业影响

落地场景

Programmable World Model 可落地于 游戏开发 与 交互式内容平台:开发者用自然语言描述实体状态与规则,直接生成可玩游戏;UGC 平台创作者无需编程即可构建持久的可交互世界。同时,该框架适合 自动驾驶仿真 与 数字孪生,为复杂场景中的实体生命周期提供可视化与规则控制。

商业价值

  • 降本:减少手工编写游戏状态机与脚本的人力,自动数据管线进一步降低数据成本。
  • 增收:低门槛 UGC 创作可催生新的付费内容与虚拟经济。
  • 体验提升:94% Count Accuracy / 98% State Accuracy 保证长时程连贯一致,增强用户留存。

与现有产品/工作流接口

该框架可作为 生成式渲染后端 接入 Unity、Unreal 等游戏引擎或内容创作管线:输出 pixel-aligned spatiotemporal conditioning 信号驱动预训练视频模型渲染,同时保留可查询的显式世界状态。可与 VLM Agent 框架结合,将自然语言解析为可执行规则;也可与现有视频生成 API 互补,作为状态管理层。

具体 use case:电商虚拟直播间 中,商家描述商品位置与互动规则,生成可交互展示空间,用户离开后状态不重置;企业数字孪生 中,对设备运行/故障状态进行程序化模拟,结合视觉渲染辅助运维决策。

局限

  • 该方法将视觉生成完全交由预训练视频模型作为渲染器,生成质量与可控性受限于该模型本身的能力。虽然通过 OBB 条件信号和 chunk-autoregressive 策略提升了长时一致性,但在复杂遮挡、快速运动或罕见交互下,渲染器仍可能出现纹理漂移、形状失真或逻辑违背。论文在 CombatStateBench 上报告了 94% Count Accuracy 和 98% State Accuracy,但未系统评估生成视频的感知真实度、运动自然度及与真实物理规律的符合度,因此尚难直接用于高保真或开放域游戏环境。
  • 显式世界状态以 3D OBB 为核心中间表示,这隐式假设实体可被有向包围盒近似。对于铰接体、可变形对象、流体或具有复杂拓扑的物体,OBB 会丢失大量几何与姿态细节,导致状态描述不够准确。自动训练数据管线依赖实例分割、跟踪与相机参数估计,在密集拥挤或动态遮挡场景中容易失效,从而限制训练数据规模与多样性。当前框架更适用于战斗类游戏中离散、刚性的实体,向通用世界模型迁移仍需更灵活的表示。
  • 作者提出的 CombatStateBench 基准仅覆盖战斗场景和少量实体类别,主要评测计数准确率和状态准确率等高层语义指标,难以全面反映世界模型在物理推理、开放词汇语言理解、多智能体涌现行为等维度上的能力。此外,系统仍需要用户提供自然语言指令,由 agent 翻译为可执行程序,尚未实现从交互中自动学习状态转移规则。这限制了在无人工指导或大规模自主构建复杂世界时的可扩展性。
论文Zheng-Hui Huang2026-09-09原文

相关内容