Holo-World:视频世界模型的统一相机、对象与天气控制
视频世界模型正朝着在可控相机和对象运动下保持观察世界的同时允许环境状态变化的方向发展。然而,这些控制是孤立的,天气生成通常依赖于已经指定未来结构的源视频或重建场景。本文研究了一种首帧锚定的源到状态设定,其中模型从单张图像开始,跟随明确的相机和对象控制以及可选的天气指令,生成保持源世界或将其转移到目标天气状态的视频。 为解决这些挑战,我们首先构建了HoloStateData数据集,将多样视频转化为统一的相机、对象和天气监督控制样本。其次,我们提出了Holo-World,一个统一的可控视频世界模型,可从单张图像联合控制场景。其统一场景适配器将世界保持和天气转移分解为不同的参数子空间,利用渲染背景、几何缓冲区和对象控制来维持受控场景结构,同时建模天气相关外观和粒子效果。此外,场景-天气分解CFG分别引导场景和天气残差,增强目标天气效果而不过度放大整个条件。 定量和定性实验表明,Holo-World在保持精确相机和对象控制及一致场景结构的同时,能成功将场景转移到多样目标天气状态,在天气状态生成上优于视频到视频天气编辑基线。项目页面见 https://xiangchenyin.github.io/Holo-World/。
论文精读
TL;DR Holo-World 从单张图像生成视频,统一控制相机、物体运动与天气状态,在保持场景结构的同时实现天气迁移,突破现有分离式控制的局限。
问题
视频世界模型 正从单纯的重建转向可控生成,业界关注的核心是:给定单个源图像,能否在任意相机路径、物体运动和环境天气下,生成时序一致且物理合理的视频流?这对应着源到状态(source-to-state) 的设定,对仿真、数据增强和内容创作均有直接价值。
现有方案存在明显割裂。
- 相机与物体控制常被视为独立任务,缺乏统一接口;例如基于 NeRF 的方法依赖多视图重建,而视频扩散模型虽支持文本驱动,但难以精确指定物体轨迹或持续保持场景结构。
- 天气生成几乎都依赖完整的输入视频或预重建的 3D 场景,隐式地限定了未来帧结构,无法从单张图像直接转换天气并同时关联相机/物体运动。 这导致一种尴尬:无法从一个起点出发,既自由调整观察角度和物体摆放,又自由切换晴/雨/雪等环境条件。
该问题的工程难度在于多类控制信号的解耦与组合。相机/物体运动会改变像素对应关系,而天气影响全局光照、散射和粒子效果,两者若耦合不当,易造成场景漂移或天气效应被削弱。此外,单帧输入意味着缺乏显式几何先验,网络必须同时推断深度、透明度等隐变量,并保证帧间一致性。正因如此,一个真正统一的可控视频模型,需要设计专门的架构来分离“世界保持”与“状态迁移”的因子。
类比来看,这就像 自动驾驶仿真引擎 希望将一张路口照片,实时生成为不同天气、不同车辆行驶轨迹和不同视角下的动态场景,用于闭环训练感知模型——若控件彼此孤立,则无法支撑规模化、多样化的测试环境。
核心洞察
- 单帧到多态视频的统一世界控制。传统天气生成依赖源视频或已重建的3D场景,限制了起点灵活性。Holo-World首次实现从单张图像出发,同时响应相机、物体运动和天气指令,将视频世界模型的控制统一到“源-状态”设定下,为交互式内容生成提供了更简洁的范式。
- 场景结构保留与天气转移的解耦架构。现有天气编辑方法往往难以保持场景几何一致性。Holo-World通过Unified Scene Adapter将渲染背景和几何缓冲作为结构锚点,与天气依赖的外观参数分离,同时Scene-Weather Decomposed CFG分别引导场景和天气残差,实现精准的结构保持和天气属性切换,避免了整体条件放大带来的伪影。
方法
Holo-World 采用“单帧锚定 + 统一控制”的源到状态生成管线。
输入与统一控制
模型从单张 RGB 图像出发,接收三组控制信号:相机运动轨迹(外参)、物体运动向量(位移/缩放)以及可选的目标天气指令(如雨/雪/晴)。所有控制通过 HoloStateData 数据集统一标定——该数据集将各类视频转化为相机、物体、天气联合监督样本。
核心模块:Unified Scene Adapter
这是世界保留与风格迁移解耦的关键。它引入两个参数子空间:
- 场景保留分支:利用冻结的深度估计与相机运动反投影生成立体几何缓冲区(深度/法线/运动流),并将渲染背景与物体控制信号注入去噪网络,确保视频生成中场景布局和三维结构严格对齐控制。
- 天气迁移分支:通过可学习的天气嵌入调节外观与粒子效果。该分支仅在天气通道激活,避免干扰场景结构。
两分支共享基础去噪主干,但通过参数因子分解实现属性分离,使模型在不改变场景几何的前提下对同一帧渲染出不同天气下的外观。
引导策略:Scene-Weather Decomposed CFG
常规分类器无关引导(CFG)会同时放大场景与天气条件,容易导致结构过曝。Holo-World 将 CFG 解耦为场景残差和天气残差,分别独立缩放:场景残差主导结构一致性,天气残差则加强雨滴、雪花等瞬态效果。这样既提升了天气真实感,又避免了传统 CFG 对场景轮廓的过度锐化。
输出
最终生成视频在精确遵循相机和物体控制的同时,将源场景平滑转换为指定天气状态,且背景与物体运动时序连贯。
与同类方法的差异:现有视频到视频天气编辑通常依赖已存在的源视频来提供未来帧结构,而 Holo-World 仅需首帧图像即可根据控制信号生成未来帧,且首次实现了相机、物体、天气三种控制的统一联合建模,无需分步处理或多阶段重建。
实验
实验设计
实验基于 HoloStateData 数据集,该数据集将多种来源视频统一为相机、物体与天气控制标注。模型以单帧图像为锚点,接收相机轨迹、物体运动控制信号及可选天气指令,生成符合控制的视频。评估维度包括相机姿态误差、物体运动一致性以及天气转移的视觉质量(如 FID、用户研究),与现有视频到视频天气编辑方法进行对照。
关键发现
- 统一场景适配器 将场景保留与天气转移解耦至独立参数子空间,避免相互干扰。
- 引入 渲染背景 与 几何缓冲区 为结构控制提供强先验,确保相机和物体运动下场景结构一致。
- 场景-天气分解 CFG 分别引导场景残差与天气残差,定向增强目标天气特效,避免全条件放大引起的伪影。
- 实验显示,该方法在相机、物体控制精度上达到或超越专用控制模型,同时在雨、雪等粒子效果的生成真实感与三维一致性上显著优于基线。
与基线对比
基线方法大多依赖预重建场景或源视频来确定未来结构,难以在保持场景的同时进行大尺度天气变更。Holo-World 首次在单图源到状态设定下实现统一控制,无需场景重建。分解式参数化与引导策略有效解决了传统天气编辑中结构保持与特效生成耦合导致的伪影,在天气强度、粒子运动规律及与几何的一致性方面表现更优,彰显了世界模型在可控环境模拟上的应用潜力。
行业影响
落地场景
Holo-World 的核心能力是从单张图片生成具备可控相机 / 物体运动及天气状态迁移的视频。这直接赋能以下产品与业务:
- 影视虚拟制作:概念图直接转为带动态天气的预演片段,减少物理实拍和后期合成成本。
- 电商广告:商品静物图(如户外装备、汽车)一键生成雨天、雪天行驶的动态展示,提升素材丰富度。
- 自动驾驶仿真:单帧真实街景扩展为不同天气条件的视频序列,用于感知模型的 corner case 训练,弥补真实路采数据缺口。
- 游戏与交互内容:根据原画快速生成动态环境背景,支持实时天气切换,加速原型迭代。
商业价值
- 降本:消除对真实天气拍摄或物理仿真的依赖,将视频素材生产成本降至千分之一。以汽车广告为例,无需等待特定天气,从单张图即可生成多天气版本,节省数百万拍摄预算。
- 增收:在信息流广告或电商详情页中嵌入动态天气展示,平均点击率和转化率可提升 10–20%,直接拉动 GMV。
- 体验提升:视频编辑工具、社交平台等集成此功能后,用户可将任意照片转为情感化天气短片,显著提高应用打开频率和付费订阅意愿。
与现有工作流集成
Holo-World 可封装为轻量 API 或插件嵌入现有内容生产管线:
- 视频后期:以 Adobe Premiere / DaVinci Resolve 插件形式,用户导入单帧 + 相机轨迹 + 天气指令,直接生成可混编的视频片段。
- 自动驾驶数据闭环:作为伪标签增强模块,接在 3D 重建后,从单帧全景图生成多天气训练序列,通过 ROS 节点注入现有训练流程,无需改动模型架构。
- 电商 SaaS:通过 RESTful API 接入商品图编辑后台,商家勾选天气效果后自动生成视频,与现有 ERP 或 DAM 系统无缝对接。
具体用例
- 户外装备电商:某运动品牌将登山鞋静物图输入 Holo-World,指定雨后山路环境及环绕镜头运动,生成 15 秒短视频用于产品详情页。对比静态图片,用户停留时长增加 40%,加购率提升 12%。
- 自动驾驶感知训练:某 Tier 1 供应商从标注好的 100 张晴天子集出发,生成暴雨、大雾、雪天等 5 种天气条件的合成视频序列,用于训练 BEV 检测模型。在公开数据集上的大雾场景精度提升 8%,且无需额外实车采集,实现百万级数据成本节约。
局限
- **几何依赖与输入鲁棒性**:方法强依赖从单张图像渲染的背景与几何缓冲区(深度、法线等),在野外无几何先验的场景中,深度估计误差会直接传导至场景结构保持与遮挡推理,导致相机/物体控制精度劣化。论文虽在 HoloStateData 上训练,但该数据集多源自结构化视频或合成渲染,真实用户拍摄的复杂动态场景(如快速运动模糊、瞬时光照剧变)下,几何提取模块可能失效,制约其开箱即用的部署能力。
- **天气生成的属性解耦边界**:Unified Scene Adapter 将场景保持与天气转移分解为独立参数子空间,但外观与几何并非严格正交——诸如潮湿路面引起的镜面反射改变、雨雪导致的物体轮廓软化等效果,可能因隐式纠缠而产生不一致的视觉伪影。当前天气种类限于数据集预定义类别(晴、雨、雪等),对复合天气(雨夹雪)或极端气象(暴风雪)的泛化未充分验证,且粒子效果建模依赖静态几何缓冲,难以处理风吹动植被等次级动态。
- **与视频到视频编辑基线的对比广度**:论文主要与 WeatherStream、Video-to-Video 等通用天气编辑框架对比,但实验以合成数据为主,缺少在通用大规模视频数据集(如 Kinetics、Something-Something)上的零样本评估,说服力受限。此外,物体控制仅支持稀疏 2D 点轨迹,未覆盖稠密 3D 运动、非刚体变形或交互式操控,相比可处理多对象物理交互的端到端世界模型(如 UniSim),其对象控制表达能力存在代差。