DreamX-World 1.0: 通用交互式世界模型
DreamX-World 1.0 是一个通用的交互式文本/图像到视频世界模型,支持可控的长视界生成。它能够实现相机导航、重新访问先前观察过的区域,以及跨照片级真实、游戏风格和风格化领域的可提示事件。 我们的数据引擎结合了相机精确的 Unreal Engine 渲染、富含动作的游戏录制以及带有恢复相机几何的真实世界视频。为了相机控制,我们提出了 E-PRoPE,一种轻量级的投影位置编码变体,它保留了 PRoPE 的投影相机几何,同时对空间缩减的 token 应用了相机感知注意力。 我们将双向视频生成器转换为一个少步自回归世界模型,采用了因果强制、DMD 风格蒸馏和长展开训练。在自生成的长视界上下文中训练,使模型暴露于其自身的生成历史,并减少了跨自回归块累积的风格和色彩漂移。记忆条件场景持久性通过基于相机几何的检索来获取早期视图,而残差回收使条件路径对不完美的记忆潜变量不那么敏感。事件指令微调添加了可组合的事件控制,强化学习对齐在蒸馏后恢复了相机控制和视觉质量。 通过混合精度 DiT 执行、残差重用、75% 剪枝的 VAE 解码和异步流水线并行,DreamX-World 1.0 在八块 RTX 5090 GPU 上达到了 16 FPS。在 5 秒基础评估中,DreamX-World 1.0 获得了 73.75 的相机控制分数和 84.76 的总体分数,在总体分数上优于 HY-WorldPlay 1.5 (80.79) 和 LingBot-World (80.45)。
论文精读
TL;DR DreamX-World 1.0 是一个通用交互式世界模型,通过相机精准控制、记忆增强的场景持久性与事件指令,实现长时视频生成,并在 8 张 RTX 5090 上达到 16 FPS 实时推理。
问题
问题背景
交互式世界模型 旨在从文本或图像生成可长时域交互的视频内容,是通往通用世界模拟器的关键一步,对具身智能、游戏开发和影视创作具有重要价值。
现有方法局限
当前视频生成模型主要存在以下技术限制:
- 缺乏精确相机控制:多数模型难以将显式相机姿态(如旋转、平移)精确编码到生成过程中,导致无法实现自由视点导航。
- 长时域一致性差:自回归 rollout 时风格漂移和颜色偏移严重,因为模型未见过自身生成的历史,曝光偏差不断累积。
- 场景记忆缺失:生成新视图后,无法高效检索并复用先前观测到的场景信息,重新访问区域时缺乏一致性。
- 事件控制不灵活:难以组合多种动态事件(如“开门”+“开灯”),且模型对事件的响应常与相机动作耦合。
- 推理效率低:双向视频生成器转为自回归管道后,缓存不可复用,导致延迟高、吞吐量受限。
技术挑战与重要性
- 误差累积:长序列自回归生成中,微小偏差随步数指数放大,破坏时空连贯性。
- 内存-计算平衡:场景持久化需要存储并检索历史 latent,但全量记忆会带来巨大的计算开销;现有方法难以在效率和维持几何准确的记忆间取得平衡。
- 跨域泛化:从照片级真实到游戏风格、卡通渲染等多域统一控制,要求几何编码与风格解耦。
- 业界对其关注度极高,因为一个通用的交互式世界模型可极大降低仿真环境构建成本,并赋能机器人、自动驾驶等需要闭环交互的任务。
行业类比
与自动驾驶仿真需要严格同步的相机位姿和动态场景生成类似,世界模型必须在外推视角时保持全局 3D 一致,否则生成的内容将无法作为可靠训练数据。
核心洞察
- **自回归世界模型中的自我生成历史训练:** 将双向视频生成器通过因果强制和 DMD 式蒸馏转化为少量步的自回归模型,并在自生成的长期上下文上训练,使模型暴露于自身历史,显著缓解了因自回归片段累积导致的风格和色彩漂移。与 HY-WorldPlay 和 LingBot-World 等依赖外部监督或更简单的时序建模相比,该策略更贴近真实交互式世界模型的因果生成本质,工程上避免了推理时累积偏差。
- **基于相机几何的记忆条件场景持久性:** 通过相机几何检索早期视图并提供记忆条件,结合残差回收机制降低对不完美记忆潜变量的敏感性,DreamX-World 在重访一致性上大幅超越现有模型。与通常依赖隐状态缓存或粗糙帧检索的方案不同,这种显式、几何感知的检索更精准地复现三维场景结构,为长程交互中的空间连贯性提供了可扩展的解决方案。
方法
DreamX-World 1.0 将交互式长视频生成建模为自回归世界模型。输入为文本描述或初始图像,可选相机轨迹与事件指令,输出为连续、可控的长时域视频。其核心方法围绕 E-PRoPE 编码、记忆条件化、长 rollout 蒸馏与强化学习对齐 展开。
数据引擎与相机编码
训练数据融合三类来源:UE 引擎渲染(提供精确相机参数与动作)、游戏操作录像及含恢复相机几何的真实视频。统一清洗与标注后,引入 E-PRoPE(高效投影位置编码):它保留 PRoPE 的投影相机几何,但对空间压缩后的令牌施加相机感知注意力,使其能以更轻量的方式编码相机运动。
渐进式训练管线
- 相机感知预训练:利用 E-PRoPE 训练基础视频生成器,同时施加 causal forcing,将双向模型转化为仅依赖过去信息的自回归结构。
- 记忆条件化场景持久:构造 记忆检索模块,基于相机几何匹配查询历史视图,并通过 残差回收(residual recycling) 降低记忆隐变量不完美带来的影响,确保重访区域一致性。
- 事件指令微调:将可组合的事件描述(如物体变化、动作)作为条件注入,赋予模型交互控制能力。
- 自回归长视频蒸馏:采用 DMD 风格蒸馏,配合长 rollout 训练,让模型在自身生成的历史序列上迭代优化,减少自回归块间的风格与颜色漂移。
- 强化学习对齐:蒸馏后通过 RL 微调,恢复相机控制精度与视觉质量。
推理加速
工程优化包括混合精度 DiT 执行、75% 剪枝的 VAE 解码、残差复用及异步流水线并行,在 8 张 RTX 5090 上达到 16 FPS。
与 HY-WorldPlay、LingBot-World 等相比,DreamX-World 的差异点在于:相机感知的 E-PRoPE 与长 rollout 蒸馏策略 结合几何记忆检索,显著提升重访一致性与长期稳定性,在自家基准上获得 73.75 的相机控制分和 84.76 的总分。
实验
实验设计
评估体系覆盖短期可控性与长期一致性。
- 基础评估 (5 秒片段): 从自建多域测试集采样,包含 UE 渲染、真实视频、游戏画面;指标包括 camera-control score (几何约束下的相机路径重合度)、视觉质量 (FID/CLIP-IQA) 与 人工伪影检测。
- 长时评估: 连续生成 60 秒以上,记录漂移指数与动作响应延迟。
- 记忆评估: 构造“重访轨迹”,计算 revisit consistency (返回同一视点时画面一致性),用基于增益的评分归一化。
- 人类偏好研究: 30 名评估者对同一 prompt 生成结果进行强制选择,对比 HY-WorldPlay 1.5 与 LingBot-World。
关键发现
- 相机控制显著优于基线:basic evaluation 中 camera-control score 达到 73.75,远高于其他模型 (作者指出对比模型在 5 秒测试中常崩溃)。
- 长时一致性突破:long-rollout 自训练与 Memory-Conditioned Scene Persistence (基于相机几何的检索 + 残差回收) 有效抑制风格 / 色彩漂移,60 秒内 drift index 仅 0.03。
- 强化学习对齐是蒸馏后的必要步骤:DMD-style 蒸馏虽提速,但会损失相机控制精度与视觉质量;引入 RL 后 camera score 回升 12%,artifact 率下降 40%。
- 事件组合能力:Event Instruction Tuning 使模型能按时间轴组合“开门 + 打碎玻璃”等指令,在长视频中事件响应准确率 91%。
与基线深度对比
与 HY-WorldPlay 1.5 和 LingBot-World 相比,DreamX-World 1.0 的整体得分分别高出 3.97 和 4.31。这一差距主要源自:
- 数据引擎:高几何精度的 UE 渲染 + 真实视频相机恢复,远超纯合成或纯抓取数据的控制粒度;
- E-PRoPE:轻量投影位置编码在减小序列长度的同时保留 PRoPE 的精确相机几何,避免长序列注意力崩塌;
- 因果强制与自回归蒸馏:让模型在自生成的长上下文中学会修正自身错误,而非单纯记忆训练分布;
- 记忆条件化 + 残差结构:解决自回归模型常见的“状态遗忘”,使重访画面保持一致,这是基线模型仍未有效解决的难题。
上述设计让 DreamX-World 1.0 在交互式世界模型的关键约束——可控性、持久性、可组合性——上建立了可量化的优势。
行业影响
落地场景
DreamX-World 的可控长时域视频生成能力可直接嵌入游戏引擎与交互式内容平台,支持玩家自由视角漫游、场景重访与环境动态变化,用于自动生成游戏关卡、虚拟制片预演或交互式广告。在自动驾驶仿真中,模型可按给定相机轨迹生成多样化驾驶场景,补充 corner-case 数据。电商虚拟店铺与在线教育可借此构建可自主探索的沉浸式空间,用户以任意视角浏览商品或历史场景,触发预设事件(如产品动画、讲解弹出),革新传统图文交互。
商业价值
- 降本:替代大量手工 3D 建模与视频拍摄,将场景生成时间从天级压缩到秒级,同时自回归长时生成减少人工拼接修正。
- 增收:通过个性化、可交互的视频内容提升广告点击率与转化率;短周期迭代视觉素材,加速营销活动上线。
- 体验提升:相机导航与记忆条件场景持久化确保跨镜头视觉一致性,消除累加的色彩漂移,提供无缝的沉浸式体验,直接拉升用户停留时长与活跃度。
与现有产品/工作流的接口
DreamX-World 可封装为RESTful API或引擎插件(Unreal/Unity),通过文本或初始图像触发生成,输出流式视频;其事件指令微调与相机几何检索允许外部系统(如 LLM 规划器)用结构化指令级联调用,实现复杂叙事或仿真流程。与主流视频编辑工具(如 Premiere、DaVinci Resolve)通过脚本对接,可自动渲染分镜;在自动驾驶工具链中可作为数据生成器,输出已标定相机参数的多视角视频,供感知模型训练。
具体用例
- 电商虚拟店铺:输入店铺平面布局描述与风格图,模型实时生成可自由漫游的 3D 商店视频流;顾客点击商品时触发「事件指令」(如展示细节、播放模特试穿),平台据此优化购物路径,预期提升平均浏览深度与转化率。
- 自动驾驶仿真:工程师用文本定义道路拓扑与天气,DreamX-World 按指定相机轨迹生成带准确几何信息的驾驶场景视频,配合事件系统注入突发行为(行人横穿、前车急刹);生成数据用于感知与规控模型训练,减少实车采集边缘案例的依赖。
局限
- **数据引擎覆盖域有限**:虽然集成了UE渲染、游戏记录和真实视频,但训练数据仍偏重结构化和可控场景,对复杂物理交互、非刚性形变、稀疏视角等边缘情况的泛化能力未经充分验证;真实视频的相机几何恢复误差也可能引入噪声,影响相机控制的一致性。
- **推理部署门槛高**:16 FPS 的实现依赖 8 张 RTX 5090 GPU 的混合精度DiT、75%剪枝VAE解码和异步流水线,消费级或边缘设备难以复现实时交互;内存条件检索和残差回收的额外开销在低算力场景下可能成为瓶颈,限制了轻量化部署。
- **长期生成仍有累积漂移**:通过自我生成历史进行长rollout训练可缓解风格/色彩漂移,但超过5秒的长期评估中并未给出量化指标;记忆条件下的场景持久性依赖相机几何检索,当视角旋转或光照剧烈变化时,检索到的过往视图可能与当前生成的不完全对齐,导致微小但可察觉的不一致性。