论文

Wonder:更优的视频世界模型

Wonder:更优的视频世界模型

我们提出 Wonder,一个通用视频世界模型,用于实时、相机可控的世界探索。给定一张图像或条件视频,Wonder 构建一个可玩的虚拟世界,用户可通过移动相机交互式导航,实时发现未见过区域、重访先前观察区域,并支持长时程探索。 实现此能力需要系统级协同设计控制方法、内存机制与训练策略。我们引入一种新型相机条件方法,使用密集坐标场,其渲染提供空间对齐的运动和方向线索,使模型能直接以视觉证据解读相机运动。为支持在增长的生成上下文中快速精确的内存检索,我们提出高效基于稀疏注意力的内存机制,使推理时模型能选择性关注一小批相关上下文 token,而不受实际上下文长度限制。我们还开发多种技术修正自强化式蒸馏管线,提升学生模型尊重控制信号的能力,同时保留教师模型的多样化生成模式与长期记忆。 这些组件共同使 Wonder 能以 16 FPS 合成多样化、分钟级视频,且在整个长 rollout 中保持连贯的几何、外观与动力学。除图像到视频生成外,Wonder 自然支持视频条件生成,允许实时重拍现有动态场景。

论文精读

TL;DR Wonder 是一个实时交互视频世界模型,可从单图或视频构建可控相机的长期可探索环境,核心创新是密集坐标场控制、稀疏注意记忆与蒸馏训练策略共同实现分钟级连贯生成。

问题

问题背景

视频生成正从固定时长剪辑合成,进化为交互式视觉世界建模,在游戏创建、虚拟制作、具身智能等领域具备广泛应用前景。行业当前关注如何从单张图像或条件视频出发,构建一个持久、可探索、物理一致的虚拟环境。

现有方法局限

  • 相机控制粗粒度:多数可控视频生成方法仅将相机参数作为全局条件注入网络,缺乏与像素空间对齐的运动线索,导致相机移动时出现几何错位或外观不一致。
  • 长期记忆效率低:为支持长视频生成,现有记忆机制要么采用稠密注意力,计算量随上下文长度二次增长,无法实时推理;要么压缩历史信息为固定向量,造成空间细节丢失,难以精确回溯早先看到的区域。
  • 蒸馏过程退化:自回归式蒸馏(如 context forcing)常用于加速推理,但学生模型容易忽视相机控制信号、丧失生成多样性,并遗忘教师模型中的长期记忆,导致生成内容偏离控制轨迹或出现模式坍塌。

技术挑战与重要性

构建实时、相机可控的世界模型面临三大核心挑战:

  1. 精确的控制-视觉对齐:模型需要将抽象的相机运动(位移、旋转)转化为可直接感知的视觉证据,保证在不同视点下场景几何与纹理高度一致。
  2. 高效的长期上下文检索:随着生成序列拉长至分钟级,历史帧数膨胀,要求记忆模块能在恒定时间内精准选择最相关的上下文 token,不支持简单压缩。
  3. 质量-速度-控制三者的平衡:在蒸馏加速的同时,必须保留教师模型对复杂相机轨迹的遵从能力和多样化的生成模式,否则交互式体验会崩溃。

该方向对数字孪生、自主系统仿真等产业需求意义重大——例如,让机器人直接在可实时探索的虚拟世界中学习空间推理,而无需昂贵的物理采集。

行业类比

类似于 NeRF 通过可微分渲染将 2D 图像重建为 3D 场景,视频世界模型 进一步将这个静态场景拓展到动态、可交互的时序维度,相当于为每张图像赋予了一个可“走入”的动态世界。

核心洞察

  • - **密集坐标场作为相机条件** 将抽象的相机运动转化为可视化的空间线索,使模型能够直接解读渲染后的坐标场图像中的运动与方向。这与仅将相机参数编码为条件向量的方法(如 AnimateDiff、CameraCtrl)形成鲜明对比,后者缺乏空间对齐的视觉证据,难以维持长序列中的几何一致性。该设计将相机控制问题转化为视觉理解问题,极大降低了学习难度,是从图像生成向交互式世界探索的关键一步。
  • - **稀疏注意力记忆机制** 在推理时动态选择少量相关上下文令牌进行注意力计算,无论生成历史多长,都能以恆定成本快速检索精确记忆。相较于常见的滑动窗口或压缩记忆方法,它避免了历史遗忘和过度压缩的信息损失,为分钟级、16 FPS 的实时相机探索提供了核心效率保障,证明专门优化的记忆模块远比增大模型容量更有效。

方法

Wonder 采用两阶段训练框架,先训练高质量的相机条件教师模型,再将其蒸馏为实时自回归学生模型,从而实现可交互视频世界建模。

输入:初始条件为单张图像或一段条件视频,以及实时变化的相机参数(位置、朝向)。

阶段一:相机条件教师模型(Camera-Conditioned Teacher)

  • 像素空间坐标场:将三维场景坐标渲染为与当前相机姿态对齐的密集坐标图,与原始 RGB 帧拼接后作为模型输入。这种方式提供空间对齐的运动与方向线索,使模型能够将相机运动直接解释为视觉证据,而非抽象的位姿参数。
  • 基础架构:采用视频扩散模型,结合多任务多时间尺度训练,使教师模型能生成长时间、高保真的视频序列。

阶段二:快速自回归学生模型(Fast Autoregressive Student)

  • 稀疏上下文强迫:引入基于稀疏注意力的记忆机制,在推理时仅选择性地关注一小部分相关上下文 token,无论上下文长度如何增长,检索速度和精度均保持稳定,支持实时流式生成(16 FPS)。
  • 学生混合与 GAN 控制正则化:为纠正蒸馏过程中的控制信号衰减和生成模式坍缩,使用多个学生模型混合输出,并通过 GAN 损失直接对控制信号施加正则,强化学生对相机操作的响应能力,同时保留教师的多样性和长期记忆能力。
  • 推理时优化:进一步微调学生模型以适配具体场景,提升画面一致性与控制精度。

输出:可实时导航的动态三维世界视频流,支持交互式相机移动,发现未见过区域或回访已观察区域,且能维持数分钟的场景几何、外观和动态一致性。

与以往仅支持固定轨迹或短时生成的相机可控视频方法不同,Wonder 通过坐标场条件、稀疏记忆机制和针对性蒸馏策略的系统协同,首次实现了实时、长程、可自由探索的视频世界模型。

实验

实验设计概述

Wonder 的评估围绕两个维度:单帧到长期视频 的图像到视频世界建模,以及 动态场景重拍摄 的视频到视频世界建模。实验首先训练一个 老师模型,通过 多任务多时间尺度 策略生成数分钟的长视频,注入 稠密坐标场 作为相机控制信号;然后通过自回归蒸馏得到 学生模型,实现 16 FPS 的实时流式生成。评估指标覆盖生成质量(如 FVD)、相机控制精度(姿态误差),以及 长期一致性(跨帧几何 / 外观漂移)。对比基线包括现有视频扩散模型、自回归生成模型及交互式世界模型。

关键发现

  • 稀疏记忆机制 是核心推力:选择性关注少量上下文 token,使推理复杂度不随生成长度增长,从而支持分钟级稳定漫游。
  • 稠密坐标场 将相机运动转化为直观的视觉证据,相比传统参数向量,显著提升了学生对旋转和平移的跟随精度。
  • 蒸馏策略改进:引入 混合学生 和 GAN 控制正则,解决了自回归蒸馏中控制信号退化与生成多样性丢失的固有问题。

基线对比解读

相较于基于扩散的相机可控方法(如 AnimateDiff + ControlNet 拓展),Wonder 的 实时交互性 是本质优势——扩散模型通常需要多步采样,难以达到 16 FPS 的流式速率。与自回归世界模型(如 VideoPoet)相比,Wonder 通过坐标场和稀疏注意力,实现了更精确的空间控制与更低的长期漂移。不过,论文未给出与特定基线的定量数值,更多通过定性案例和消融实验证明各组件的有效性。

行业影响

落地场景

Wonder 作为实时、可操控摄像头的视频世界模型,直接面向需要交互式 3D 环境生成与探索的产品。典型场景包括:

  • 游戏与虚拟制作:从单张原画或一段视频自动生成可自由漫游的游戏关卡或影视预演场景,支持实时调整镜头视角,减少手动建模与渲染成本。
  • 电商与数字营销:为商品展示生成可交互的 3D 空间,用户可拖拽视角查看产品细节,或让静态场景“动起来”,提升沉浸式购物体验。
  • 机器人仿真与训练:利用模型生成的持久、一致的环境,为具身智能体提供多样性训练场景,支持摄像头运动下的视觉导航与交互任务。
  • 教育内容创作:从历史照片或插图生成可探索的虚拟博物馆、地理景观,支持交互式教学。

商业价值

  • 降本:将传统需要美术团队数周搭建的可交互场景,缩短为几分钟的模型推理,大幅降低 3D 内容生产成本。
  • 增收:交互式视频广告、虚拟展厅等新形态内容可提高用户参与度与转化率,带来直接广告或销售分成。
  • 体验升级:实时、分钟级长时一致性视频生成,打破现有 AI 视频“片段化”限制,使产品可用性从工具辅助跃迁为实时交互媒介,建立竞争壁垒。

与现有产品/工作流的接口

Wonder 以图像或条件视频为输入,输出可探索的持久世界,易于集成进现有视觉开发管线:

  • 输入即图像/视频:直接对接美术概念图、实物拍摄或现有视频片段,无需额外 3D 资产。
  • 实时推理优化:通过教师-学生蒸馏和稀疏注意力记忆机制,学生模型在 16 FPS 下保持低延迟,可作为插件嵌入游戏引擎(如 Unity、Unreal)或 Web 端多媒体框架。
  • 视频条件生成支持将已有动态场景重新拍摄,可接入剪辑软件(如 Adobe Premiere)的后期流程,提供智能运镜替代手动关键帧。
  • 开放 API 化:提供 RESTful 或流式接口,让各类应用(电商平台、教育软件)直接调用世界模型,无须深入理解扩散模型细节。

具体落地用例

  1. 在线家居设计平台:用户上传房间照片,模型实时生成可四周环视的 3D 漫游视频,自由更换家具摆放视角,无需等待离线渲染。平台按生成次数收费或提供会员高级功能。
  2. 短视频创作工具:创作者提供一段手机拍摄的风景视频,Wonder 实时重新合成运镜效果(推拉摇移),自动生成电影感短片片段,直接导出到剪辑时间线,替代复杂的运动控制设备。

局限

  • 论文未明确讨论实时推理的硬件门槛,虽然声称 16 FPS 生成,但很可能依赖高端 GPU(如 A100/H100),在消费级设备上难以实时运行,限制了广泛部署和交互式应用的实用性。
  • 稀疏注意力记忆机制在极长时序(数分钟以上)时,检索精度和压缩比是否持续有效未验证;坐标场渲染的相机控制对剧烈旋转、快速变焦等运动的鲁棒性缺少定量消融,可能产生视觉伪影或几何不一致。
  • 多阶段训练(Teacher-Student 蒸馏 + GAN 正则 + MoS)复杂,超参数组合敏感,复现难度大;实验中仅展示特定场景(室内、自然景观),对动态物体密集、光照剧变或大规模环境的变化,泛化性和记忆持久性缺乏系统分析。
论文Jiacong Xu2026-07-28原文

相关内容