论文

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

我们提出 WorldDirector,一个高度可控的视频世界模型框架,专为持久动态对象记忆(persistent dynamic object memory)和无限制视角探索而设计。与现有将物理动力学与像素渲染交织并依赖连续视觉观察维持运动的世界模型不同,我们的框架明确地将语义运动编排(semantic motion orchestration)与视觉生成解耦。 通过利用 LLM 协调 3D 轨迹(3D trajectories)与相机运动(camera movements),并将编排后的轨迹作为视频生成的控制信号,我们的方法确保了严格的物理逻辑(physical logic)和外观稳定性(appearance stability)。即使动态实体长时间离开视野后重新进入场景,也能精确保留其视觉身份。 实验结果表明,该方法支持合成复杂且扩展的事件,具有前所未有的可控性和持久动态对象记忆。项目页面:https://worlddirector.github.io/

论文精读

TL;DR WorldDirector 通过 LLM 编排 3D 轨迹与相机运动,将视频生成解耦为语义运动规划与视觉渲染,实现持久动态对象记忆,即使对象出画后重入,外观仍一致,支持自由视角探索。

问题

问题背景

视频生成正从被动像素合成全面转向交互式环境模拟 ,其核心诉求之一是长期一致性——尤其是对动态物体身份的持久记忆。

现有方法的局限

当前主流视频世界模型仍将物理动态像素渲染深度耦合,依赖连续视觉观测来维持运动。这导致两大缺陷:

  1. 物体重识别失败:一旦动态物体离开画面,再次入画时,模型极易产生外观漂移或身份丢失,无法保持其视觉特征。
  2. 记忆机制偏静态:现有记忆增强方法(如基于检索的上下文条件化)虽能有效保持静态场景一致性,但对动态实体缺乏持久建模,难以处理任意视角下、间隔数秒后重新出现的同一物体。 这些局限根本上源于缺乏对3D 语义轨迹视觉生成过程的显式解耦。

技术挑战与重要性

在长时序视频生成中保持动态物体的持久性,需要同时满足:

  • 严格物理逻辑:物体运动轨迹必须符合3D空间约束,并与相机运动协调一致。
  • 外观稳定性:同一物体的纹理、光照、形状等在离开视野后必须准确恢复。
  • 语义编排与像素生成的解耦:高层运动规划(“物体向何处移动”)不能与底层视觉合成(“如何绘制该物体”)相互干扰,否则会破坏一致性。 这使得该问题成为构建可交互世界模拟器的关键瓶颈,直接关系到自动驾驶仿真、数字孪生、影视预演等对时空一致性有严苛要求的应用。

行业类比

类似自动驾驶仿真中,一辆车在多摄像头之间切换时,其3D轨迹与外观必须毫秒级连贯——WorldDirector 的解耦思路可为这类需要长周期动态实体记忆的工业场景提供直接参考。

核心洞察

  • 解耦运动规划与视觉生成是构建持久化世界模拟器的关键突破口。现有方法将物体物理动态与像素渲染耦合,依赖连续视觉观测来维持运动状态,导致物体一旦离开视口便容易丢失身份。WorldDirector 明确分离语义运动编排和图像生成:先用 LLM 将事件逻辑转化为 3D 轨迹和相机路径,再以此作为控制信号驱动视频模型。这种架构将“世界状态”维护为可长期记忆的轨迹数据,即使物体长时间不在画面中,再次出现时仍能保持外观和运动一致性,为长时间、多视角的交互式环境模拟提供了工程化路径。
  • LLM 扮演了世界模型中的高级规划器,将抽象指令转化为可执行的时空轨迹。不同于端到端地直接预测像素,WorldDirector 借助 LLM 理解物理规则和事件因果关系,输出物体 3D 运动路径和相机参数,再交由生成器渲染。这类似于导演将剧本分解为分镜和走位的过程,使得生成过程可控、可解释且更容易符合物理逻辑。显式轨迹规划降低了生成器对连续视觉输入的依赖,有利于扩展至更长时序和复杂事件的多物体协调,也为集成更强大的推理模型留下了接口,预示未来世界模拟将更偏向规划与生成解耦的架构。

方法

WorldDirector 采用解耦设计,将视频生成分为语义运动编排视觉渲染两个阶段,实现持久动态对象记忆与自由视点探索。

输入与整体流程

系统接受文本指令(如"一辆红色汽车绕过障碍物后离开画面,再从远处返回"),通过以下模块生成可控视频:

  • LLM 运动规划:大语言模型根据指令生成3D 对象轨迹相机运动路径,将语义级动作意图转化为时空坐标序列,天然保障物理逻辑。
  • 持久动态记忆:设计动态上下文检索模块,为每个对象维持独立的视觉身份表示。即使对象出画再返回,也能从记忆库中召回其精确外观,避免身份漂移。
  • 视觉生成引擎:以规划的轨迹和相机参数为控制信号,结合空间感知文本条件(如位置描述)驱动视频生成。训练时引入相机注入机制,增强多视角一致性;推理时可采用因果分块生成,支持无限时长。

训练与数据

构建了专门的数据管线,包含静态场景和动态对象的多视角配对数据,并设计外观条件丢弃策略,迫使模型学会在缺失显式外观条件时仍保持对象一致性。

与同类方法的差异

现有视频世界模型常将物理模拟与像素生成耦合,依赖连续视觉观察来延续运动,难以处理长时遮挡后重入场景的对象身份保持。WorldDirector 通过显式解耦,将运动逻辑交给 LLM 规划,视觉生成只负责渲染,从而在复杂事件合成中实现前所未有的可控性与持久记忆

实验

实验设计

WorldDirector 围绕两大核心能力评估:持久动态对象记忆自由视角可控性。实验选取包含复杂遮挡与长时序列的场景,测试物体在离开视野后重新出现的视觉身份一致性,以及轨迹编排下相机运动的物理逻辑。消融研究重点检验解耦架构各组件(LLM 轨迹规划、动态上下文检索、外观条件注入)的贡献,基线覆盖主流视频生成与可控世界模型。

关键发现

  • 外观稳定性:解耦语义运动规划后,动态实体即使经历长时间遮挡,重入画面时仍保持精确视觉身份,无畸形或纹理漂移。
  • 控制精度:LLM 协调的 3D 轨迹与相机运动作为控制信号,使复杂事件合成严格遵循物理约束,用户可通过自然语言指令灵活干预。
  • 记忆持久性:动态上下文检索机制有效避免了传统模型对连续观测的依赖,长视频生成中未出现“灾难性遗忘”。

与基线对比解读

以往方法将物理动态与像素生成耦合,导致物体操控性与视角感知能力不足。WorldDirector 通过显式分离运动编排与视觉渲染,在动态对象记忆保持率轨迹服从度指标上均显著优于基线。尤其在自由视角探索场景,基线常出现物体消失或变形,而 WorldDirector 保持稳健,充分证明了解耦设计对世界模拟器工程化的价值。

行业影响

落地场景

WorldDirector 将视频生成从单帧渲染升级为语义可控的世界模拟,核心落地场景包括:

  • 专业内容制作:电影预演、广告创意中需要长时序、多角色交互的镜头,无需演员实拍即可生成一致的运动与外观。
  • 沉浸式交互体验:VR/AR 环境中,用户可自由变换视角,动态对象即使暂时离开视口再重现,仍保持身份一致,适用于虚拟旅游、数字人接待等。
  • 仿真与合成数据:自动驾驶、机器人训练需要多样且物理真实的交通/行人行为,WorldDirector 可生成像素级一致的动态场景,弥补真实数据稀缺。

商业价值

  • 降本:替代传统 CG 手工关键帧动画和持续拍摄,显著降低电影级特效、3D 广告制作的人力与时间成本。
  • 增收:为内容平台、电商提供交互式商品展示:用户可自由旋转视角观看服装或家具的动态效果,提升转化率。
  • 体验升维:在游戏与虚拟世界中实现 NPC 持久记忆与合理行为,增强沉浸感与用户粘性。

与现有产品/工作流的接口

WorldDirector 采用 LLM 规划 → 3D 轨迹 → 视频生成 的解耦范式,可无缝集成进现有 pipeline:

  • 上游:接受自然语言指令或剧本脚本,通过 LLM 输出结构化的 3D 轨迹与摄像机路径。
  • 中游:与主流视频生成模型(如扩散模型)结合,将轨迹作为控制信号输入,无需修改架构。
  • 下游:支持渲染引擎(Unity、Unreal)的离线或实时驱动,便于与传统 3D 资产管线协同。

具体落地用例

  1. 电商虚拟试播:用户输入“让这件连衣裙在微风中飘动,并展示背部细节”,系统生成自由旋转视角的连续动画,保持纹理与细节不变,减少退货率。
  2. 自动驾驶闭环仿真:生成城市街道中行人穿越、车辆变道的长时序视频,确保同一辆车离开屏幕后再次进入时外观、车牌一致,作为感知模型训练的高置信度合成数据。

局限

  • **LLM依赖与闭环控制缺失**:框架利用 LLM 进行高层轨迹与相机运动编排,但当前仅支持前向开环规划,无反馈闭环矫正能力;一旦生成的长序列中出现累积误差或物体交互偏差,缺乏实时修复机制,可能影响长时间滚动的视觉逻辑一致性。
  • **动态内存与多物体交互的泛化边界**:论文侧重单个或少量动态物体的持久记忆与重识别,对多物体密集交互、遮挡-脱出-再入过程中的身份保持与重定位缺乏系统性验证;训练数据管线依赖精确的 3D 轨迹标注,对未见过物体类别或非刚体形变的泛化能力尚不明确。
论文Hanlin Wang2026-07-02原文

相关内容