流式多智能体自回归扩散模型与世界状态寄存器
多智能体交互世界模型不仅需生成一致观测,还应维护跨智能体、跨视图的持世界状态。现有自回归视频扩散模型将历史观测作为条件上下文,难以在多智能体与多视图场景中保持共享状态。 本文提出 WorldWeaver (W²),一种流式多智能体视频扩散模型。其核心创新是引入跨智能体世界状态寄存器:一组可学习 token,用于存储全局共享信息、追踪各智能体状态,并在每生成一个视频块后动态更新。寄存器通过三种监督信号进行训练:1) 个体智能体状态(如位置、姿态);2) 全局视图(如鸟瞰图);3) 场景文本描述。此外,模型采用 Mixture-of-Transformers 架构,为世界状态建模与视觉帧建模分配独立权重,实现解耦学习。 在双智能体 Minecraft 视频生成任务中,实验表明:显式的世界状态建模显著提升了生成视频的逻辑一致性与视觉质量,尤其在涉及多智能体协作与视角切换的场景中优势明显。
论文精读
TL;DR WorldWeaver (W²) 引入可学习的“世界状态寄存器”,在流式生成中动态更新,显式维护跨智能体共享世界状态,解决多视角一致性难题。
问题
问题背景
多智能体交互世界模型(interactive world models)是具身智能和物理仿真中的核心组件,其目标不仅是逐帧生成视觉观测,更要维持跨智能体、跨时间步的共享世界状态,以支持长期一致的交互。
现有方法局限
目前主流的自回归视频扩散模型(autoregressive video diffusion)将历史观测帧作为上下文(conditioning context),通过滑动窗口逐步生成未来帧。这种方法存在两个根本局限:
- 隐式状态传递:场景的全局信息仅通过像素历史隐式传递,模型缺乏对共享世界状态的显式表征,导致多智能体视角下的逻辑一致性难以保证。
- 长程依赖脆弱:当交互步骤增多,历史窗口中可能缺乏关键的长程因果信息,且不同智能体的局部观测难以对齐,容易造成物体突然消失、行为不连贯等“世界遗忘”现象。
为什么难 / 重要
显式建模世界状态的技术挑战在于:需要设计一种紧凑、可学习的状态寄存器,使其既能编码跨智能体的共享信息,又能追踪个体状态,并能够在每个生成片段后高效更新。同时,如何利用多源监督信号(如个体状态、全局俯视图、场景文本)来学习这些状态也是难点。该方向对自动驾驶仿真、多机器人协同、游戏AI等需要长时间一致交互的场景高度相关,业界正逐步将研究重心从像素级质量提升转向结构化世界状态管理。
行业类比
类比检索增强生成(RAG) 中为LLM注入持久记忆,多智能体世界模型也需要一个可读写、可演化的“世界内存”,以克服纯生成式模型的记忆瓶颈,实现连贯的多步骤旅程。
核心洞察
- 显式世界状态寄存器作为持久化、可更新的记忆,解决多智能体长序列生成中的状态漂移。此前自回归视频扩散模型仅将观测历史作为条件上下文,难以跨视角保持共享状态的一致;WorldWeaver 引入可学习 token 动态存储全局世界信息与个体状态,在每段生成后迭代更新,使不同智能体的视角始终基于同一共享的世界状态,从而提升长程逻辑一致性。
- Mixture-of-Transformers 架构将世界状态建模与视觉帧建模解耦,避免单一 Transformer 参数共享带来的任务干扰。针对多智能体视频生成,状态推理和精细帧渲染需捕捉不同粒度的特征,该设计让两支模型各自专注,显著提升生成稳定性与全局几何一致性,为多模态世界模型的模块化设计提供了新范式。
- 多信号监督(个体状态、鸟瞰图、场景文字)将抽象的世界状态寄存器接地至可验证的真实信息。通过组合局部-全局视图及跨模态数据,寄存器学习到丰富且可解释的表示,相比无监督或弱监督方法,这种显式对齐增强了模型对状态的精确控制能力,并为未来交互式世界模型中的可控生成与状态编辑打下基础。
方法
整体流程
WorldWeaver (W²) 是一种流式多智能体视频扩散模型,其核心设计围绕 世界状态寄存器 (World State Registers) 展开。模型以自回归方式运作:每一时间步,输入为多个智能体的历史观测帧与当前时刻的 世界状态寄存器,输出为未来一段视频块 (chunk) 的预测帧,同时更新寄存器内容。寄存器是一组可学习的 token,作为持久状态存储,显式记录共享的全局信息(如场景布局)和每个智能体的个体状态(如生命值、视角)。
关键模块与训练
- 寄存器动态更新:每生成一个视频块后,模型基于新观测和旧状态对寄存器进行更新,使用 Transformer 解码器注入时序依赖,确保状态随环境变化而演变。
- 多模态监督:为使寄存器具备可解释且稳定的语义,解码阶段施加 三类监督信号:
- 个体状态解码:预测每位智能体的数值状态(如装备、坐标)。
- 全局视图解码:从寄存器重建鸟瞰图 (BEV),迫使寄存器捕捉全局几何信息。
- 场景文本解码:识别场景中出现的文字,引入跨模态对齐。
- Mixture-of-Transformers 架构:将视觉帧生成与状态建模的参数分离。具体地,世界状态交互使用一套 Transformer 权重,而视频像素生成使用另一套,两者通过交叉注意力交互,避免视觉细节噪声对状态学习的干扰。
- 三阶段训练策略:
- 阶段一 (双向训练):随机掩码视频 Patch,用双向注意力重建,学习通用时空表示。
- 阶段二 (因果训练 + 世界状态寄存器):自回归预测未来块,同时优化状态解码损失,让寄存器学会追踪动态。
- 阶段三 (自强制与上下文 rollout):在推理时引入自我反馈,用模型自身生成的帧和状态作为下一步输入,并联合上下文帧进行微调,提升长序列一致性。
与同类方法的差异
传统自回归视频扩散模型(如 Video Diffusion Models)仅将历史帧作为条件输入,缺乏显式的共享状态记忆,导致多智能体场景下状态漂移。WorldWeaver 通过可学习的寄存器抽象出与视角无关的世界状态,从结构上保证了跨智能体和跨时间的逻辑一致性。
实验
实验设计
- 数据集:收集双智能体在 Minecraft 中的交互视频,包含个体智能体状态(生命值、位置等)、全局状态(鸟瞰图)和场景文本等多模态监督信号。
- 评估任务:从连续生成的视频块中评估生成帧的视觉质量和逻辑连贯性。
- 训练流程:分三个阶段——Stage 1 双向训练视觉基础;Stage 2 引入世界状态寄存器(World State Registers)进行因果训练,使寄存器捕获可持久化的世界信息;Stage 3 自强迫(Self-Forcing)训练,联合上下文帧和寄存器状态进行自回归推演。
关键发现
- 世界状态寄存器 有效解决了多智能体场景中共享状态难以维护的问题。可学习 token 在每次生成块后动态更新,持续追踪个体和全局状态。
- Mixture-of-Transformers 架构 将世界状态建模与视觉帧建模解耦,使用独立权重,进一步提升了生成一致性和效率。
- 显式世界状态建模显著提升了生成视频的逻辑一致性(如智能体行为符合全局约束)和整体质量,在双智能体 Minecraft 视频生成上优于仅依赖观察历史的自回归扩散基线。
与基线对比解读
- 传统自回归视频扩散模型将历史帧作为条件给到扩散过程,这在多视角、多智能体场景下难以维持跨智能体的共享世界状态,容易产生不一致。
- WorldWeaver 通过引入世界状态寄存器,将共享状态显式编码为可学习 token,并用丰富的监督信号(个体状态、全局鸟瞰图、场景文本)进行规约,使得状态更新可解释且可控。
- 与隐式依赖历史的方案相比,这种设计减少了误差累积,提升了跨智能体和跨视角的生成鲁棒性,为构建多智能体交互世界模型提供了可扩展范式。
行业影响
落地场景
WorldWeaver 的多智能体世界状态寄存器设计,可直接落地于需要协调多视角、多智能体一致交互的生成式仿真与内容创作场景。典型用例包括:
- 开放世界游戏 NPC 行为生成:为每个 NPC 维护独立状态与共享世界状态,实现逻辑一致的实时视频序列,取代传统脚本驱动的行为树。
- 自动驾驶多车轨迹联合预测:将各车辆视为独立智能体,通过共享寄存器建模全局道路动态,生成符合物理规律与交互关系的未来场景帧,提升感知-规划闭环验证的真实性。
商业价值
模型在长期一致性与可控性上的突破带来直接商业回报:
- 降本:传统多智能体仿真依赖大量手工规则与状态维护代码,WorldWeaver 以端到端自回归扩散模型替代部分硬编码,显著减少开发与调试人力。
- 体验提升:更高的帧间逻辑一致性和跨智能体行为协调,使虚拟世界交互更可信,可转化为用户留存与付费意愿。
- 加速迭代:半监督训练支持少量标注即可扩展至新场景,让内容平台或仿真服务快速适应不同领域需求,缩短产品上市周期。
与现有产品/工作流的接口
WorldWeaver 作为纯视觉生成模型,可封装为微服务或云端推理 API,接入现有实时交互栈:
- 游戏引擎集成:通过 gRPC/REST 接收当前帧、各智能体状态与全局地图,返回下一段视频流,供 Unity/Unreal 渲染管线消费,替代部分离线烘焙动画。
- 自动驾驶仿真平台:与 CARLA、SUMO 等工具链对接,输入传感器视角与交通参与者状态,输出未来多视角视频,作为感知模型的训练数据或规划器的在线环境模型。
- 视频生成管线:可与现有多模态大模型(如 Gemini、GPT-4o)协作,文本/语音指令转换为世界状态更新,驱动 WorldWeaver 生成符合指令的多智能体视频,实现更自然的剧情生成与交互叙事。
局限
- 实验仅在双智能体 Minecraft 环境中进行,当智能体数量增加时,world state registers 之间的交互、注意力计算开销以及多状态冲突的仲裁机制将面临严峻挑战,模型扩展到更多智能体或真实世界多视角场景的可行性尚未验证。
- 训练依赖额外的监督信号,包括个体智能体状态、全局鸟瞰图和场景文本,这类标注数据获取成本高,限制了模型在自然视频或缺乏结构化状态标注的场景中直接应用。半监督策略虽有所缓解,但性能退化程度与监督信号的稀疏性之间的权衡仍需深入分析。
- world state registers 的流式更新需要在每个生成块后执行动态调整,随着序列长度增加,累计计算延迟可能影响实时交互性能;此外,Mixture-of-Transformers 将世界建模与视觉帧生成分离,虽然提高了专项能力,却也导致整体参数量上升,对部署资源提出更高要求。