论文

WorldCraft: 从相机导航到交互式视频世界模型中的对象操控

WorldCraft: 从相机导航到交互式视频世界模型中的对象操控

最近基于视频的世界模型使像素级环境在相机层面变得可交互:用户可以移动视角,模型生成连贯的视觉延续。然而,其动作空间仍不完整:用户只能移动相机,无法操作单个物体。由于现实世界的交互本质上是物体为中心的,这类模型更接近被动的场景观察者,而非真正可操控的环境。 我们提出 WorldCraft,一个将交互式视频世界模型从相机导航扩展到物体级轨迹动作的框架。给定用户点击和手绘路径,WorldCraft 生成未来帧,其中选中的物体沿指定轨迹运动,同时相机继续导航场景。方法通过轨迹为中心的控制流程实现:首先,归一化世界轨迹(NWT) 在相机不变的参考坐标系中表示用户绘制的运动,并动态地将其重投影到当前相机姿态下,从而分离物体运动与相机引起的屏幕空间位移;然后,空间路径 LoRA(SP-LoRA) 通过模型的空间控制通路注入该世界空间信号,在保留预训练相机控制器的同时添加物体操控能力;最后,轨迹锚定状态持久化(TASP) 将世界轨迹视为持久空间状态,在轨迹条件生成后刷新自回归记忆,使移动物体在离开相机视野后仍能出现在更新后的位置。 实验表明,WorldCraft 实现了精确的物体控制,在仅使用相机评估时保持了视频世界模型的相机保真度,并在包含离屏移动的长自回归滚动中维持了物体状态一致性。

论文精读

TL;DR WorldCraft 将交互视频世界模型从仅相机漫游扩展到对象级轨迹操控,让用户点击并拖拽物体即可生成可控运动画面,同时保持相机自由,核心是通过世界坐标系轨迹、空间路径 LoRA 和状态持久化实现精准操控与长程记忆。

问题

问题背景

视频世界模型(video world models)旨在从像素级生成可交互的 3D 环境,但当前工作多聚焦于摄像机导航:用户可自由移动视角,模型生成连贯的新视角画面。

现有方法局限

主流视频交互模型(如 Genie、GameNGen 等)仅支持相机位姿控制,无法对场景中的单个物体施加动作。具体技术局限包括:

  • 动作空间单一:只能调节外参(如平移、旋转),缺少对象级轨迹输入,用户无法“点击并拖动”物体。
  • 空间语义缺失:模型未显式建模物体在世界坐标系下的独立运动,导致物体移动与相机位移耦合,难以实现解耦操控。
  • 记忆机制脆弱:自回归生成时,物体一旦离开视野便可能丢失状态,重新出现后无法保持在用户指定的新位置。

这使得模型更接近“被动观看者”,而非可真正干预的交互式环境。

为什么这个问题难且重要

对象级操控需解决三个深层技术挑战:

  1. 运动解耦:物体自身轨迹与相机运动引起的屏幕位移必须分离表示,否则操纵信号不精确。
  2. 控制注入:预训练视频世界模型已固化相机控制能力,新增对象操控路径需避免灾难性遗忘,且不能破坏原有生成质量。
  3. 持久状态管理:在长序列自回归中,物体移出画面后需在正确位置重现,传统 KV cache 或记忆机制难以维护此类空间对齐的状态。

业界关注度持续上升,因为可操控世界模型直接服务于具身智能仿真、交互式内容生成、视频游戏自动构建等方向,其中精细物体交互是核心需求。

行业类比

就像在游戏引擎中,开发者不仅需要自由摄像机,还需要脚本驱动的物体移动;WorldCraft 则相当于在视频生成世界模型里加入了“拾取物体并沿路径拖拽”的能力,让 AI 生成的环境从可看变为可操控。

核心洞察

  • 将对象操控与相机导航解耦为独立可控维度:WorldCraft 通过 Normalized World Trajectory (NWT) 在相机不变的世界坐标系中定义物体运动,并在每帧根据当前相机姿态动态重投影,明确分离了物体自身运动与相机导致的屏幕位移。这使得用户能够像在真实 3D 环境中一样同时独立控制“看哪里”和“移动什么”,超越了此前仅能被动切换视角的视频世界模型,首次在像素空间实现了完整的交互动作空间。
  • 以参数高效的方式为预训练世界模型注入新控制模态:Spatial-Pathway LoRA (SP-LoRA) 仅针对扩散模型中的空间控制通路进行低秩适配,将 NWT 信号注入而无需微调整个模型。这种做法不仅极大降低了训练开销,更关键的是保护了原有相机控制能力不被覆盖,示范了如何在已有的可交互模型上以极低成本扩展全新的动作维度,为大规模基础模型的轻量级能力升级提供了直接可复用的工程范式。
  • 轨迹锚定的状态持久化机制解决了自回归生成中的对象“失忆”问题:Trajectory-Anchored State Persistence (TASP) 将用户指定的世界轨迹作为时空锚点,在对象暂时移出视野后又回到画面时,利用该持久状态刷新自回归记忆,使对象准确重现于更新后的位置。这模仿了物理世界中物体存在的连续性,是生成式世界模型从短时“梦幻”走向长程一致交互的关键一步,为构建真正可深度漫游和反复操作的虚拟环境奠定了基础。

方法

WorldCraft 的输入是一段由 用户点击选中的物体 以及 手绘的运动轨迹,同时相机可自由导航。方法围绕三个核心模块展开:

1. 归一化世界轨迹 (Normalized World Trajectory, NWT)

屏幕空间轨迹随相机移动会引入虚假位移,因此 NWT 首先将用户绘制的 2D 屏幕轨迹 提升到 相机无关的世界坐标系。具体而言,利用场景深度估计与相机位姿,将每帧的轨迹点反投影到 3D 世界坐标,并对多帧观测进行迭代细化,得到一条时序上稳定的 3D 世界轨迹。在生成每一帧时,该世界轨迹根据当前相机位姿 动态重投影回屏幕,从而分离物体自身运动与相机运动带来的视图位移,保证轨迹信号仅编码被控对象的真实移动。

2. 空间路径 LoRA (Spatial-Pathway LoRA, SP-LoRA)

世界轨迹信号需注入预训练的视频世界模型。SP-LoRA 是一种 参数高效微调策略,仅对模型的空间控制通路(如空间注意力或跨帧特征融合模块)添加低秩适配器。这种设计有两个关键效果:

  • 精准注入:将 NWT 产生的屏幕空间轨迹(作为控制图或 embedding)直接送入空间注意力层,引导生成帧中对应物体的位置。
  • 能力保留:冻结原模型的主体权重,尤其是相机控制模块,使模型在获得物体操控能力的同时 仍能忠实响应用户的相机导航指令,避免灾难性遗忘。

3. 轨迹锚定的状态持久化 (Trajectory-Anchored State Persistence, TASP)

生成过程中,被操控物体可能暂时离开当前相机视野,在自回归生成时重新出现。标准自回归内存会因视野外帧的累积而丢失该物体状态。TASP 将 世界轨迹本身视作持久空间状态:在生成每一帧后,更新一个以世界轨迹为锚点的空间记忆,而非仅依赖图像 tokens。当物体离开视野再返回时,系统根据世界轨迹的当前位置刷新自回归记忆,使物体 在正确的更新位置上重现,实现长期一致性。

综上,WorldCraft 从 NWT 解耦运动、SP-LoRA 注入信号、TASP 维持状态,形成完整的“选定物体 → 路径控制 → 长期生成”管线。与仅支持相机级导航的 Genie 等视频世界模型相比,WorldCraft 首次在生成过程中赋予用户对单个物体的直接轨迹操控,使交互从“观察场景”升级为“操作场景”。

实验

实验部分从定量与定性两方面验证 WorldCraft 的物体轨迹操控能力。实验设计上,评估包含:(1) 相机-物体联合操控任务,用户点击物体并绘制路径,模型生成物体沿路径运动且相机可动态导航的帧;(2) 仅相机操控的保真度测试,确保新增的物体操控分支不损害基模型的相机控制性能;(3) 长时自回归推演,物体移出画面后再次出现时位置是否保持更新(即状态持久性)。基线包括基视频世界模型(仅相机交互)以及简单的 in-context 轨迹条件化方法。关键发现:WorldCraft 能准确驱动物体沿用户设定轨迹移动,同时相机运动保持平滑连贯,未出现退化;在物体移出视口并重入时,锚定轨迹使其出现在正确的新位置,解决了普通自回归记忆的遗忘问题;消融研究表明,归一化世界轨迹(NWT)和轨迹锚定状态持久(TASP)对性能至关重要。与基线对比:直接 in-context 条件化难以解耦物体运动与相机运动,导致轨迹不准或相机质量下降;WorldCraft 通过 NWT 将轨迹定义于世界坐标系,解耦了两者,实现了精准的独立控制,且在相机操控指标上与原基模型持平,体现了框架的即插即用特性。

行业影响

落地场景

WorldCraft 将交互式视频世界模型从纯相机导航拓展至物体轨迹操控,直接赋能以下产品的交互体验升级:

  • 视频创作与编辑工具:创作者可在视频片段中直接绘制物体运动路径,实时生成符合新轨迹的连续画面,省去逐帧手动调节或复杂 3D 合成的环节。
  • 游戏开发与虚拟制片:预演阶段允许导演或策划通过点选并拖拽场景物体来快速迭代关卡布局或镜头调度,大幅缩短概念验证周期。
  • 电商与数字营销:商品展示页支持用户交互式移动产品,实时观察在不同光照、角度下的外观,模拟“拿起查看”的体验。
  • 教育与培训模拟:在医学教学或设备操作演示中,学员可自主操控器官或部件的运动,观察因果变化,提升情境理解。

商业价值

  • 降本增效:通过轨迹驱动视频生成,取代高成本的动作捕捉、关键帧动画或物理模拟,尤其适合中小型工作室。预训练模型 + SP-LoRA 轻量适配,无需从头训练,显著降低算力门槛。
  • 体验差异化:交互式物体操控让静态视频变成“可玩内容”,增强平台用户粘性与停留时长(例如内容社区允许粉丝拖动明星同款物件生成动态二创)。
  • 快速资产复用:同一段场景视频可通过不同轨迹输入衍生出多种叙事版本,提高素材利用率,缩短广告或课程制作周期。

与现有产品 / 工作流的接口

WorldCraft 的轨迹控制管线可封装为易集成模块:

  1. 模型层:基于主流视频扩散模型(如 Stable Video Diffusion)做微调,以 SP-LoRA 作为 adaptor,不破坏原有相机控制能力。团队可将其打包成模型服务 API,或发布成 Hugging Face 格式权重,供现有生成式 AI 管线调用。
  2. 交互前端:提供 Web/移动端 SDK,捕获用户点选与轨迹绘制,转换为 NWT 世界坐标系信号,再传入推理后端。可嵌入编辑软件(如 ComfyUI 自定义节点)或浏览器端交互式播放器。
  3. 数据处理TASP 机制保证物体离开画面后重回视野时状态一致,这要求视频平台或游戏引擎能维护持久化的物体状态缓存,可与现有数字资产管理栈对接。

具体落地 Use Case

  • 电商互动商品秀:家具电商平台让买家在实拍房间视频中拖拽一张虚拟沙发,沿地面绘制移动路径,实时生成沙发平滑放置到不同角落的逼真视频,代替静态尺寸示意图,提升购买信心并减少退货。
  • 短视频模板创作:内容平台推出“魔术移动”模板,用户上传一段旅行视频,选中路人或车辆并画出“消失”路径,WorldCraft 自动生成物体随路径飞出画面的趣味短片,无需剪辑技能,激发 UGC 创作。

局限

  • **深度估计依赖**:NWT 构建于单目深度估计之上,用于将 2D 屏幕轨迹映射到 3D 世界坐标系。深度估计的误差会直接影响世界轨迹的精度,尤其在纹理稀疏或遮挡区域可能产生偏移,导致生成的对象运动与用户意图不一致。论文虽采用迭代锚点细化,但未量化深度噪声的鲁棒性,实际部署中可能需要更鲁棒的深度模块或在线修正机制。
  • **单对象交互假设**:当前框架仅支持选中单个对象并沿一条轨迹移动,未涉及多对象同时操控或对象间的物理交互(如碰撞、遮挡后的协调运动)。真实场景中用户往往需要同时移动多个实体,而模型对多轨迹的解耦控制能力尚未验证,限制了从“操控单个玩具”到“编辑复杂场景”的迁移。
  • **轨迹绘制的先验要求**:用户需要手动绘制目标轨迹,这要求对场景几何和期望运动有先验知识。相比未来可能出现的语言指引、拖拽式直观操作或纯目标任务描述,手绘路径的门槛较高,自动化程度不足。论文未讨论与高层语义指令的接口,降低了非专业用户的可用性。
论文Bohai Gu2026-05-24原文

相关内容