World in World:用 World Models 探索世界
自回归视频世界模型支持交互式、长时程探索,但灵活控制仍是难题:从新视角探索源视频,要求生成的 rollout 与记录事件保持同步、把观测内容放到请求视角、合理补全新暴露区域,并在回访时还原此前生成的外观。现有方法多依赖任务专用模块或额外训练来实现这些能力。 我们提出 World in World,一种免训练的推理期接口,把异构控制证据转换为带相机与时间标签的干净视觉状态,再由冻结因果视频模型的原生 self-attention 读取。证据涵盖源视频观测、目标视角场景投影、引导新暴露主体区域补全的 geometry renderings,以及滚动缓存之外的检索生成状态;每个证据源都带有 token 级支持与各自的可用性调度。 correspondence router 结合持久点身份与几何建立 token 对应关系,将受支持的 query 导向匹配的源视频 token;Evidence-wise attention CFG (EWA) 则利用同一次去噪前向传播的注意力响应,独立调节各辅助通道的额外贡献。 该共享接口在同一个冻结骨干上同时支持相机控制重渲染、长时程回访与人体动作迁移。我们在多样视角变化下的相机控制视频重渲染任务上评估 World in World,考察感知质量、时序一致性与相机跟随精度。
论文精读
TL;DR World in World 提出免训练推理接口,通过将多源视觉证据路由到冻结视频世界模型的自注意力中,实现相机控制重渲染、长时重访与人体运动迁移。
问题
问题背景
自回归视频世界模型(autoregressive video world models)已成为交互式、长时程视觉探索的核心工具,旨在让生成过程像在持续演化的视觉世界中漫游。然而,对生成过程施加灵活控制——例如从新视角重渲染一段既有视频——仍是一个待解难题。
现有方法局限
现有方案大多针对特定任务设计专用模块,或需要对预训练模型进行额外微调。例如,实现相机控制需要额外注入相机位姿编码,处理新暴露区域需要单独训练补全网络,恢复重访外观则依赖外部记忆缓存。这些方法存在三点局限:
- 任务耦合性强:每个控制目标对应独立组件,难以统一迁移到新的控制信号或组合任务;
- 额外训练成本:修改或扩展模型需要重新训练,破坏原始模型泛化性,且不同基础模型间迁移困难;
- 多目标冲突:同步性、视角准确性、补全合理性与重访一致性同时满足时,各模块输出可能相互干扰,缺乏全局协调机制。
为什么这个问题难且重要
该问题的难度源于多个要求的交织:
- 时间同步:生成的 rollout 必须与源视频事件保持时间对齐,不能出现动作错位或时序漂移;
- 空间一致性:在指定相机视角下准确放置已观测内容,同时为新暴露区域补全符合场景几何与外观的内容;
- 循环一致性:当相机重新访问已生成区域时,必须恢复之前生成的 appearance,避免出现视觉突变或纹理漂移。 这三个目标在自回归生成的逐步预测中相互牵制,尤其是模型权重被冻结时,无法通过反向传播调节内部表征。业界对训练无关(training-free) 控制方案高度关注,因为它允许在不重新训练大模型的前提下,快速适配不同控制需求,显著降低部署成本与迭代周期。
行业类比
类似数字孪生或自动驾驶仿真场景:给定一段真实道路视频,用户希望自由切换视角查看周围环境,但无需为每个新视点重新训练场景重建模型。一个统一的推理时控制接口可直接复用现有视频生成模型,实现交互式场景探索。
核心洞察
- 训练免微调的统一证据接口,让冻结视频世界模型具备多任务可控性。对比现有方法通常为特定任务设计模块或额外训练,World in World 仅通过推理时接口,将不同控制信号统一为相机/时间标记的视觉状态,并由冻结因果视频模型的自注意力读取,支持相机重渲染、长时重访、人体运动迁移。这种零训练、无任务特定模块的方案显著降低部署复杂度和计算成本,并提升对新任务的适应能力。
- 对应路由器与 token 级支持调度,解决长时生成中的时空对齐和未观测区域补全。对于重新渲染源视频,生成结果需与记录事件同步,并将观察内容置于请求视角,同时可信补全新暴露区域。该方法通过持久点身份与几何渲染建立 token 对应,引导查询注意力匹配源 token,并为每个证据源赋予 token 级支持与可用性调度,允许部分证据动态缺失。相比仅依赖图像条件或光流的方法,这种机制在处理复杂视角变化和长时重访时具备更强鲁棒性和可控性。
- EWA 利用同一去噪前向的注意力响应,实现无额外训练的证据感知 guidance。EWA 针对每个辅助证据通道,从去噪前向传播中提取注意力响应,独立调节该通道对生成过程的额外贡献,作用方式类似 classifier-free guidance 但应用于注意力层。这种设计无需微调即可在推理时动态控制不同证据的影响力,为可控视频生成提供细粒度、低成本的干预手段,并可灵活扩展到新的证据类型,因为调节信号直接从模型本身获取。
方法
输入与整体流程
World in World 在冻结的自回归视频世界模型之上,将相机控制、时间回访、人体运动迁移等异构控制信号统一为视觉证据(visual evidence),在推理阶段完成控制,无需额外训练。
关键模块
- 证据构建:将输入拆解为四类带时间 / 相机标签的干净视觉状态——①源视频观测(
source-video observations);②目标视角场景投影(target-view scene projections);③几何渲染(geometry renderings),用于补全新暴露区域;④从滚动缓存外检索到的已生成状态(retrieved generated states)。每类证据携带 token 级支持度与可用时间表。 - 对应路由(correspondence router):结合持久点标识与几何信息建立 token 对应关系,将受到支持的 query 引导向匹配的源视频 token。
- Evidence-wise Attention CFG (EWA):利用同一去噪前向传播中的注意力响应,独立调节每个辅助通道的额外贡献,避免不同证据之间的干扰。
输出
最终由冻结的因果视频模型通过原生 self-attention 读出这些证据,生成与源视频事件同步、视角正确、新区域合理补全、回访时恢复先前外观的视频 rollout。
与同类方法的差异点:现有方法通常为每个控制任务设计专用模块或额外训练,而 World in World 通过统一的训练无关推理接口,在同一冻结骨干上支持多种控制形式。
实验
实验设计
- 基于冻结的因果视频模型,测试相机控制重渲染(camera-controlled rerendering)在多样视点变化下的表现。
- 评估指标包括:感知质量、时间一致性、相机跟随精度。
- 对比对象为需要任务专用模块或额外训练的现有方法。
- 关键组件消融:correspondence router、Evidence-wise attention CFG (EWA)。
关键发现
- 通过原生 self-attention 路由异构视觉证据,模型无需微调即可保持与源视频事件同步,将观察内容放入请求视点,补全新暴露区域,并在回访时恢复此前生成的外观。
- token-level support 与可用性调度支持长时程回访;同一冻结骨干支持相机控制重渲染、长程回访、人体运动迁移。
与基线对比解读
- 基线多依赖专用模块或额外训练,部署与迁移成本高;本方法作为训练-free 推理接口,工程集成更轻,适合多任务复用。
- 论文未在摘要中披露具体数值对比,需查看实验部分进一步评估。
项目主页:World in World
行业影响
落地场景
- 电商商品展示:上传商品视频,推理时实时生成任意相机视角,消费者可自由旋转查看细节,无需多角度拍摄。
- 内容平台互动视频:对 UGC 视频提供“自由视角重渲染”滤镜,用户可改变原作相机轨迹,增加互动时长与创作工具价值。
- 工业培训与远程协作:录制操作演示,生成不同观察视角的教学视频,适配不同工位学习需求。
商业价值
- 降本:training-free 接口免去任务特定训练,节省 GPU 与数据标注成本;可复用现有冻结视频世界模型,快速部署。
- 体验提升:交互式探索提升用户沉浸感与停留时长,带动广告 / 订阅收入;电商场景降低退货率。
- 快速迭代:支持 camera path、geometry renderings 等灵活控制信号,无需重新训练即可扩展新控制模式。
与现有工作流集成
- 以 Inference-side plugin 形式接入现有视频生成服务,输入 source video + camera parameters,输出 rerendered frames,无需修改 backbone 权重。
- 需要环境几何与相机位姿,可利用现成 SLAM / 3D reconstruction 模块(如 COLMAP)产出 target-view scene projections 与 geometry renderings。
- 对模型要求:需 causal video model 具备原生 self-attention,兼容主流 AR/DiT 架构;EWA 基于 CFG 实现,可集成到现有采样循环。
具体 use case:
- 电商 3D 展示:电商平台上传单个产品视频,系统用 World in World 生成多视角浏览,消费者通过拖拽旋转观察商品,代替传统多角度摄影棚拍摄。
- 教育内容重渲染:在线课程录制讲师操作实验,学生可调整视角观察仪器细节,提升理解;平台无需为每个视角录制多机位。
局限
- 本方法高度依赖预训练世界模型的质量与几何重建的准确性。对于包含剧烈非刚性变形、复杂遮挡或透明/反射表面的动态场景,几何渲染与持久点身份可能失效,导致新暴露区域补全错误或 token 对应失配。此外,训练 free 接口无法修正 backbone 在特定数据分布上的偏差,视角变化过大时生成质量可能下降。该局限在论文中未充分讨论。
- 论文主要定量评估了 camera-controlled video rerendering,对于 long-horizon revisiting 和 human-motion transfer 仅提供定性展示,缺少定量指标和与训练基线的系统对比,因此泛化性未知。同时,方法需要离线几何重建和检索历史生成状态,推理时计算与存储开销较高,可能限制实时应用;EWA 中的超参数需要按证据通道手动调节,自动化程度不足。
- 与需要额外训练的专用模块相比,训练 free 接口在控制精度和视觉质量上可能仍存在差距,尤其在目标视角与训练分布差异较大时。此外,correspondence router 依赖外部几何信息(如深度、相机参数),这些信息在实际部署中可能不易获取或含噪声,影响鲁棒性。相关工作如基于微调的方法能更好地适应特定域,但本方法未提供公平对比。