Code World Model: Coding Agent as World Brain
世界模型旨在模拟复杂环境在行动与事件下的演化过程,然而现有的基于视频的世界模型主要从视觉观察中学习动态,这些观察揭示的是结果而非支配世界演化的底层知识、规则与机制。这使得模型难以维持持久的状态后果,也难以支持连贯、开放式的演化。我们提出 Code World Model 框架,将世界演化与视觉实现分离,结合语言模型的推理与编码能力以及视频模型的生成先验。其中,编码智能体(Coding Agent)充当世界大脑,负责推理事件及其后果,并生成可执行代码以维护持久的世界状态并执行符合规则的演化。 为将可执行状态与视觉生成连接起来,我们引入了代理表示(Proxy Representation),该表示编码了逐帧的时空约束,并编译为代理视频,用于条件化视频模型以渲染高保真的视觉观察。我们还开发了从游戏视频和真实世界视频构建对齐的代理-观察对的数据流水线。在成对的游戏数据上进行微调后,MiniMax-H3 能够遵循由编码智能体构建的简单交互世界中的基于代理的时空规范,同时保留丰富的视觉细节与动态。 这些结果展示了将代码用于持久世界演化与视频模型用于灵活视觉实现相结合的潜力,为迈向开放式世界模型提供了一条新路径。
论文精读
TL;DR Code World Model 让 coding agent 作为世界大脑生成可执行代码维护持久世界状态,并用 proxy 表示驱动视频模型渲染高保真观察,实现规则演化与视觉生成的解耦,开辟开放世界模型新路径。
问题
世界模型研究正从简单视频预测走向可交互、可长期演化的环境模拟,核心目标是让模型不仅能生成逼真画面,还能理解并遵循世界运行规则。
现有方法局限:
- 视频世界模型 直接从 RGB 帧学习动力学,本质上是对视觉结果的统计拟合,缺乏对底层状态、因果关系和规则的显式建模。
- 这导致长期一致性差:物体被遮挡后状态无法持续追踪,事件链的后果难以在后续帧中正确延续。
- 开放演化能力受限:模型难以在未见过的场景中按规则推理出合理的新状态,只能对训练分布内的视觉变化进行插值。
为什么这个问题难且重要:
- 技术挑战在于将持久化世界状态(如物体位置、属性、关系)与视觉渲染解耦,并建立两者之间可控、可编译的映射。
- 业界对开放世界模拟需求强烈,涉及具身智能训练环境、游戏 AI、自动驾驶仿真等,都要求世界模型能像引擎一样维护规则一致的状态。
行业类比:类似于游戏引擎维护物理状态、神经渲染负责画面生成,Code World Model 尝试用代码作为世界大脑、视频模型作为视觉皮层。
核心洞察
- 将世界模型中的演化过程与视觉渲染分离,用可执行代码维护持久世界状态,而不是让视频模型直接推断动态。其独特性在于代码提供了可解释、可查询、可规则化更新的状态表示,支持长期一致性和开放世界演化。相比基于像素或潜变量的视频世界模型只学习表面动态,代码世界模型能显式建模事件后果,并通过编译器执行保证规则一致性,为后续推理和规划提供结构化接口。
- 引入代理表示(proxy representation)作为代码状态与视频生成之间的桥梁,先由轻量编译器生成低维代理视频,再条件化视频模型渲染高保真观测。其独特性在于用逐帧时空约束代替文本或语义条件,使视频模型既能遵循精确的布局和运动,又保留其丰富的视觉先验。这种两级生成降低了对视频模型直接进行精确控制的难度,比 ControlNet 等基于图像的约束更通用,可直接从代码状态编译,无需额外标注。
方法
整体框架
Code World Model 将世界演化与视觉生成解耦,核心流程为:输入动作/事件 → 编码代理生成可执行代码更新状态 → Proxy 表示桥接状态与像素 → 视频模型渲染高保真视觉。
输入 → 关键模块 → 输出
- 输入:动作(如键盘操作)或事件描述,以及当前世界状态(由代码维护)。
- 编码代理(Coding Agent):作为世界大脑,基于 LLM 的推理与编码能力,接收输入并生成可执行代码(如 Python)对世界状态进行更新。代码执行后持久化状态,保证规则一致性和长程后果(如物体位置、属性变化)。
- Proxy 表示(Proxy Representation):从可执行状态中提取帧级时空约束(如物体边界框、运动轨迹、遮挡关系),编译成一个轻量级 proxy video(粗粒度中间表示),将符号状态转化为适合条件化的视觉线索。
- 视频模型(Video Model):以 proxy video 和文本指令为条件,通过微调(如 MiniMax-H3)学习从 proxy 到真实像素的映射,生成高保真、细节丰富的视频观察。
训练与数据
使用游戏和真实视频数据,通过自动/半自动管线构建对齐的 proxy–observation 对,用于微调视频模型(proxy 作为条件输入,真实帧作为监督)。
与同类方法的差异点:不同于现有视频世界模型直接从视觉观察学习动力学,本方法用代码维护持久状态,再通过 proxy 桥接视频模型,实现了规则一致性演化与高保真渲染的解耦。
实验
实验设计
构建 paired proxy–observation 数据,从 gameplay 与 real-world videos 提取对齐的 proxy 表示与真实观测。对 MiniMax-H3 视频模型在 gameplay 配对数据上微调,使模型以 proxy video 为条件生成高保真视觉帧。推理时,coding agent 生成可执行代码维护世界状态,并将状态编译为 proxy video 输入视频模型。
关键发现
- MiniMax-H3 在简单互动世界中能遵循 proxy-based 时空规范,同时保留丰富视觉细节与动态。
- 该框架展示了“代码负责持久演化 + 视频模型负责灵活视觉实现”的可行性,区别于传统 video-based world model 仅学习视觉观测中的结果而非底层规则。
- 未给出具体量化指标(如 FVD/PSNR),需查看论文完整实验部分。
与基线对比解读
传统视频世界模型直接从 visual observations 学习动力学,难以维持持久后果与开放演化;Code World Model 将状态更新显式编码为 executable code,并用 proxy 约束视频生成,缓解“只看到结果、学不到机制”的问题。不过当前仅在简单互动世界验证,距离开放世界仍有距离。
行业影响
落地场景
CWM 架构可落地于交互式视频生成、程序化世界模拟和合成数据管道。具体用例:
- AI 原生游戏 / 互动叙事:游戏引擎逻辑(物理、因果、NPC 状态)用代码维护,视频模型负责渲染高质量画面,实现长期一致、可交互的游戏世界。
- 自动驾驶 / 机器人仿真数据:将交通规则、传感器模型写成代码状态更新,用 video model 生成符合规则的多视角场景视频,用于感知模型训练与闭环测试。
商业价值
- 降低世界模拟开发与维护成本:传统视频世界模型需从海量视频隐式学习动态,难以调试和验证;CWM 把逻辑与视觉解耦,代码可测试、可版本化、可复用,显著减少重训成本。
- 提升产品体验与内容供给效率:生成内容具备持久状态和规则一致性,支持更长时序、更复杂的交互,改善游戏 / 虚拟试穿 / 教育模拟等产品的留存与付费转化。
- 拓展合成数据市场:可低成本批量生成带精确标注、可控因果的场景视频,服务自动驾驶、具身智能等领域的数据需求。
与现有产品 / 工作流的接口
- 与 LLM + 视频生成栈集成:Coding agent 可作为状态管理服务,输出 JSON / 代码状态,经轻量 compiler 生成 proxy video,再作为条件输入现有视频模型(如 MiniMax-H3)。
- 微调即接入:只需构造
proxy-observation对齐数据对视频模型做轻量 fine-tune,即可复用其视觉先验,不改动模型主干。 - 适配 MLOps 流水线:代码组件可纳入 CI/CD、单元测试、状态审计;proxy 表示是紧凑的中间层,便于缓存、分布式渲染和版本管理。
局限
- - 实验仅在简单交互世界中进行,代理表示对复杂物理现象(连续碰撞、流体、可变形体)的表达能力未验证。编码代理依靠一次性生成可执行代码更新状态,若代码存在逻辑错误,会导致状态不一致且缺乏自动纠错,长时程演化中的可靠性存疑。
- - 代理-观测对齐数据依赖从 gameplay 和真实视频中提取的代理管线,代理视频的粗糙度直接限制视频模型输出保真度;真实场景中的细粒度外观、材质与遮挡关系可能丢失。当前仅在游戏数据上微调,对真实世界开放场景的泛化尚未证明。
- - 整体系统由编码代理、代理编译器、视频模型三部分串联,推理链路长、工程复杂度高;相比端到端视频世界模型,需要额外维护状态代码与代理视频,实时交互性能可能不足。代理编译器对复杂交互(多智能体、可变拓扑)的扩展性未明确。