行业新闻

西湖大学发布Code World Model:用代码驱动视频世界模型

用代码管理世界状态、视频生成画面,解决视频模型难以处理长期规则与因果的问题。

西湖大学AGI Lab提出Code World Model,将视频世界模型拆分为决定演化的Coding Agent与负责视觉生成的视频模型。代码维护规则与状态,视频模型将状态渲染为画面,二者闭环协作,以应对开放世界中长期因果推理与动态变化。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/317c9307-5a50-47e2-a4a7-bf232f30ee9e/013(2).jpg) ![图片](/r/blog/d1844d536c0554dddf5c0e490b7407303bc9c245ee6b9c7b0aaea0d46d809ef1.jpg) 该项目的第一作者是南洋理工大学博士生、西湖大学访问学生陈奕文。指导老师是西湖大学通用人工智能实验室负责人张驰助理教授。 能生成一段逼真的画面,不等于能让一个世界持续运转。真正的开放世界不仅要回答「下一帧是什么」,还要记住屏幕之外发生过什么、规则如何作用,以及一次事件会怎样在很久以后继续改变角色与环境。 近年来,视频世界模型的画质、动作控制和交互速度快速提升,它们已经可以把键盘、鼠标、动作或文本指令转化为连续视觉画面。但现有系统的核心建模对象,往往仍是「接下来应该生成什么观察」。视觉历史能够记录看得见的结果,却很难直接保存世界规则、角色关系、事件历史和屏幕之外持续发展的因果链。 想象一下,游戏中如果玩家刺杀了一座城市的统治者并离开,城市秩序、继承关系、贸易、阵营联盟以及大量非玩家角色的信念和目标,都应该继续变化。等玩家很久以后返回,系统不仅要生成一幅「看起来合理」的城市画面,还要知道玩家离开期间发生了什么、为什么发生,以及这些后果接下来还会如何延伸。 为此,西湖大学 AGI Lab 的研究团队提出 Code World Model。它不再要求视频模型独自从视觉结果中反推所有隐藏机制,而是把「世界如何演化」和「世界如何被看见」拆成两个互补问题:Coding Agent 负责决定世界如何演化,代码负责让规则持续执行,视频模型负责把演化后的状态转化为高保真视觉观察。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-04原文

相关内容