WorldCrafter: 具备隐式 3D 感知记忆的一致性视频世界模型
视频世界模型能够支持对动态环境的交互式探索,但难以在长时间跨度与跨视角条件下保持对既往观测的一致性。为此,我们提出 WorldCrafter,一种学习相机可查询的隐式 3D 感知记忆 的视频世界模型。 核心思路是让请求的视角决定多视角证据如何被压缩进视频生成器有限的 token 预算中。记忆编码器与姿态条件读出模块 同视频生成器联合训练,在去噪之前将历史观测整合为一组固定的、目标视角特定的 token,且无需基于深度的显式对应关系。 结合该记忆、近期时序上下文与少步蒸馏,WorldCrafter 可从单张输入图像或文本提示出发,实现流式场景探索。在静态与动态场景上的实验表明,该方法在分钟级探索中显著提升了长时程一致性与相机控制精度,同时保持了视觉质量。
论文精读
TL;DR WorldCrafter 用目标视角条件化的隐式 3D 感知记忆,动态压缩历史多视角观测,在分钟级探索中大幅提升长视距一致性与相机控制精度。
问题
问题背景
视频世界模型 的核心任务是让用户通过移动相机来交互式探索动态环境,并生成符合几何与外观一致性的新观察。当前领域关注长时域(long-horizon)与跨视点(cross-viewpoint)下保持先前观测的一致性。
现有方法局限
现有记忆机制存在明显技术瓶颈:
- 全历史注意力(
full-history attention):将所有历史帧纳入注意力计算,内存与计算成本随序列长度二次增长,难以扩展到分钟级探索。 - 选择性历史检索(
selective history retrieval):通过检索相关历史帧降低开销,但往往牺牲视角覆盖,容易遗漏与当前目标视角相关的内容,导致重访时不一致。 - 显式空间记忆(
explicit spatial memories):依赖深度图等几何先验构建共享 3D 参考,但动态场景中几何估计不可靠,显式对应难以维护。
这些方法都难以在有限令牌预算下同时满足长时域一致性和跨视点一致性。
技术挑战与重要性
核心挑战在于:如何将多视角历史观测压缩到视频生成器有限的令牌预算中,同时保留目标视角的 3D 感知信息,且不依赖显式深度对应。这要求记忆模块与相机姿态解耦,实现流式(streaming)交互。该问题对具身智能、自动驾驶仿真、交互式内容生成等下游应用至关重要,业界正寻求可扩展且鲁棒的世界模型记忆方案。
行业类比
类似自动驾驶仿真平台中,车辆需要在不同时间和视角下回忆之前看到的道路元素(如交通标志、障碍物),避免因视角切换导致场景不一致或重复探测。
核心洞察
- WorldCrafter 的核心是将目标视点作为查询条件,将多视图历史观测动态压缩为固定数量的视点特定 token,再注入视频生成器。与传统全历史注意力(计算开销大)或选择性历史检索(视点覆盖有限)不同,该方法的记忆编码器与生成器联合训练,readout 模块以相机姿态为条件生成紧凑记忆 token,在有限 token 预算内保留跨视点一致性,且无需显式深度对应,适合长时程探索。
- 通过隐式 3D 感知记忆而非显式几何重建,WorldCrafter 在动态场景中实现了可查询的记忆整合。显式空间记忆通常依赖深度估计或 3D 结构,对动态物体鲁棒性差;WorldCrafter 的隐式记忆直接学习从多视图特征到目标视点 token 的映射,避免显式对应,因此能处理场景中的动态元素,同时与少步蒸馏结合实现实时交互。这一设计将对 3D 一致性的需求内化到网络参数中,无需在线优化。
方法
输入与总览
WorldCrafter 接收单张输入图像或文本提示作为初始观测,以及用户指定的新视角相机轨迹。在交互探索中,模型需要根据当前视角逐步生成视频帧,同时维持已观测内容在重新访问时的一致性。
关键模块与数据流
- Memory Encoder:将历史多视角观测压缩为隐式 3D 感知记忆。该模块不依赖显式深度图或点云,而是在特征空间保存场景几何与外观信息,并随观测不断更新。
- Pose-Conditioned Readout:根据目标相机姿态从记忆中提取固定数量的目标视角特定 token。这一设计让请求的视角直接决定多视角证据如何压缩到生成器的 token 预算内,避免全历史注意力或选择性检索带来的覆盖损失。
- Video Generator:以提取的记忆 token 与近期时间上下文为条件,通过去噪过程生成新帧。记忆模块与生成器联合训练,无需显式深度对应。
- Few-Step Distillation:将模型蒸馏为少步去噪版本,实现实时流式交互。
输出与差异
输出为与请求视角严格一致的视频帧,支持分钟级场景探索。与显式空间记忆(依赖准确几何且对动态场景脆弱)和全历史注意力(计算成本高)不同,WorldCrafter 用视角条件化的隐式记忆压缩,在长期一致性与相机控制精度之间取得平衡。
实验
实验设计
WorldCrafter 在 静态与动态场景 上评估长期一致性、相机控制精度与视觉质量。实验分为四部分:
- Memory Evaluation 考察历史观测被复用时的长期一致性;
- Camera Control Evaluation 衡量给定相机位姿下生成视角的准确性;
- Visual Quality Evaluation 验证视觉保真度;
- Ablation Study 分离记忆编码器、位姿条件读出、蒸馏等模块的贡献。
训练分为两阶段:先训练视频生成器与隐式 3D 记忆联合模型,再通过 few-step distillation 蒸馏至实时交互版本。支持从单张图像或文本提示流式探索。
关键发现与基线对比
摘要仅给出定性结论:WorldCrafter 在长期一致性和相机控制精度上较基线有显著提升,同时保持分钟级探索中的视觉质量。对比的隐性基线包括依赖全历史注意力或选择性检索的方案,以及基于显式几何/深度的空间记忆方法。WorldCrafter 的差异化在于 pose-conditioned readout 将多视图证据压缩为固定数量的目标视角 token,无需显式深度对应,使动态场景也能稳定记忆。
论文未在摘要中披露具体数据集名称与量化指标,因此 key_metrics 留空。建议查阅项目主页 WorldCrafter 获取详细实验表格。
行业影响
落地场景
WorldCrafter 的相机可查询隐式 3D 记忆使其直接适配需要用户自由视角探索的场景。在电商领域,可生成商品(如家具、汽车内饰)的交互式 3D 展示,用户从单一图片即可进入可漫游的虚拟空间,无需专业 3D 建模。在内容平台,可创建动态可探索的短视频或直播场景,例如旅游景点或活动现场的个性化视角生成。此外,自动驾驶仿真可受益于其长期一致性,用单帧输入扩展出分钟级的驾驶场景回放。
商业价值
- 降本:单图或文本生成可探索世界,替代传统多视角拍摄或手工 3D 建模,大幅降低资产制作成本。
- 增收:交互式体验提升用户停留时长和转化率,例如电商 3D 展示可增加购买意愿;内容平台可提供差异化功能吸引付费订阅。
- 体验提升:长时间探索中保持视觉和几何一致性,避免跳变,提升沉浸感,减少用户流失。
跟现有产品/工作流的接口
- 模型集成:作为视频扩散模型的记忆增强模块,可插入现有 video diffusion pipeline(如 SVD、CogVideoX),无需改变骨干。
- 实时交互:通过 few-step distillation 实现实时推理,适合部署在 Web 端或边缘设备,与现有摄像头控制和前端渲染框架(如 three.js)结合。
- API 化:可提供“输入图像/文本 -> 输出可探索视频流”的 API,对接企业现有内容管理或电商平台。
局限
- **固定大小的目标视图 token 预算**:记忆编码器将多视角历史压缩为固定数量的 target view-specific tokens,不随历史长度增长。在分钟级探索中,早期观察到的细节可能被后续信息覆盖或平均化,导致回访时出现模糊、纹理丢失或场景漂移。该设计牺牲了长期记忆的保真度以换取计算效率,对需要精确重建远处区域的场景尤其不利,且未提供显式的记忆淘汰或优先级机制。
- **依赖准确的相机位姿**:方法的核心是 pose-conditioned readout,将历史观察按请求视角整合。如果相机位姿估计存在噪声(例如来自 SLAM 或用户提供的轨迹),读出的记忆 token 可能与真实视角不一致,造成几何错位和一致性下降。论文未讨论位姿误差的鲁棒性,这限制了在真实世界无位姿或位姿噪声较大场景下的直接部署。
- **动态场景泛化仍存疑**:虽然实验涵盖静态与动态场景,但动态物体的复杂非刚性运动、遮挡与时序变化可能超出隐式记忆的表达能力。训练数据若主要来自合成渲染或受限的多视角采集,模型在开放世界动态场景下的长期一致性仍有待验证;此外,记忆编码器与视频生成器联合训练可能导致过拟合特定数据集分布。