论文

SolarWM: 开放数据与可扩展训练用于长时程视频世界模型

SolarWM: 开放数据与可扩展训练用于长时程视频世界模型

我们提出 SolarWM,一个全开放的基础框架,用于构建从数据准备到长时程推理的交互式视频世界模型。跨异构数据源和视频骨干网络的训练颇具挑战:数据集在时间尺度、相机几何、视觉质量、运动及标注风格上存在差异,而视频生成器则采用不同的表征和架构。朴素的数据混合与模型特定实现会产生不一致的监督信号,使结果难以复现和比较。 SolarWM 通过可重构多源数据引擎和骨干原生适配框架解决该耦合问题。数据引擎将来自 10 个数据集的 143 万规范片段转换为统一的、帧对齐的契约,涵盖视觉观测、度量相机几何、标注、质量元数据、选择决策及来源,同时将源处理与混合构建解耦。在共享的相机条件、训练和推理接口下,我们基于 Wan2.2、LTX-2.5 和 MiniMax-H3 实例化了四个 5B–33B 模型,同时保留其原生表征和目标。 我们采用统一的三阶段流程,结合双向适配、教师强制的自回归初始化与分布匹配蒸馏。得到的因果模型在仅基于 5 秒序列训练后,即可支持从分钟级到小时级展开的实时交互。通过开放数据、流水线、流程、权重及框架,SolarWM 为交互式世界模型研究提供了可复现且可扩展的基础。

论文精读

TL;DR SolarWM 开源可扩展的交互式视频世界模型框架,统一多源数据与三阶段配方适配 Wan2.2/LTX-2.5/MiniMax-H3,仅用 5 秒序列训练实现分钟到小时实时长时域生成。

问题

问题背景:交互式 视频世界模型 (video world models) 被视为通往通用智能的关键技术,近期发展迅速,但多数系统封闭、数据与训练细节不透明,难以复现和公平比较。

现有方法局限:跨异构数据源训练 视频世界模型 面临严重耦合。数据集在时间尺度、相机几何、视觉质量、运动模式、标注风格上差异极大;视频生成 backbone 使用不同表示(如 VAE 潜空间、DiT 架构)和训练目标。朴素的数据混合会导致不同来源的监督信号相互冲突,而模型特定实现又使训练流程与 backbone 强绑定,无法统一评估不同架构的效果。此外,缺少共享相机条件接口和统一数据契约,难以保证交互式控制的一致性。

为什么难/重要:核心挑战在于解耦数据源处理与混合构建,同时保持各 video backbone 原生表示和目标。训练只能在 5 秒短序列上进行,却要推理出分钟到小时级的长时程 rollouts,需要设计分布匹配蒸馏等策略。业界对可扩展、可复现的开放世界模型栈需求强烈,因为它关系到具身智能、游戏模拟、自动驾驶仿真等下游应用的迭代速度。

行业类比:类似于大语言模型发展早期,若没有统一 tokenizer 和预训练数据协议,各模型家族间的知识迁移与公平评测几乎无法进行。

核心洞察

  • SolarWM 的核心价值在于将多源数据处理与模型 backbone 彻底解耦:通过统一的 frame-aligned 数据契约和 backbone-native 适配框架,把 10 个异构数据集(不同时间尺度、相机几何、视觉质量、运动与 caption 风格)转换为一致监督,避免 naive mixing 带来的信号冲突,同时保持 Wan2.2、LTX-2.5、MiniMax-H3 各自的原生表示与训练目标。这比现有单一 backbone 或固定数据管线的 world model 更可复现、可扩展,工程上可从任意新数据源或新视频生成器快速接入,而无需重写核心训练逻辑。
  • 三阶段训练 recipe(bidirectional adaptation → teacher-forced AnyFlow initialization → DMD 蒸馏)是让因果模型在仅用 5s 序列训练后实现分钟到小时级实时交互的关键:先利用双向预训练获得强表示,再通过 teacher forcing 初始化自回归能力,最后用 distribution matching distillation 将非因果分布迁移到因果生成,避免直接长序列训练的高昂成本。与常见的长视频生成方案(如滑动窗口或粗到细)相比,该方法在保持单步推理效率的同时维持了长时程一致性,为交互式世界模型提供了实用的训练范式。

方法

输入与数据标准化

SolarWM 的输入是来自 10 个异构数据集的 1.43M canonical clips,差异体现在时序尺度、相机几何、画质、运动和标注风格。可重构多源数据引擎 将每个样本转换为统一的帧对齐契约,包含视觉观测、metric 相机参数、密集字幕、质量/运动元数据、过滤决策和 provenance。关键设计是解耦 源处理 与 混合构建,避免 naive mixing 造成监督信号不一致。

模型适配与相机条件

在统一相机条件 Fused-PRoPE 下,模型家族基于 Wan2.2、LTX-2.5、MiniMax-H3 实例化 4 个 5B–33B 模型,保留各 backbone 的原生表示与训练目标,实现 backbone-native adaptation。共享的训练和推理接口让异构架构可以公平比较。

三阶段训练流程

  1. 双向适配:先用双向预测目标适配预训练视频生成器,建立对相机和帧结构的理解。
  2. Teacher-Forced 自回归初始化:利用 teacher forcing 将模型转向因果生成,同时保持原生生成能力。
  3. DMD-based 因果训练:通过分布匹配蒸馏(DMD)将 teacher 分布蒸馏到因果模型,去除未来信息泄漏,使模型能在仅 5s 训练序列上推断长时程 rollout(分钟到小时级),并支持实时交互。

差异点

与多数工作绑定单一 backbone 和定制数据管线不同,SolarWM 通过解耦数据契约和 backbone-native 适配,首次在多个异构视频生成器上统一了世界模型训练与评测。

实验

实验设计

SolarWM 采用统一三阶段训练 recipe:双向适应、teacher-forced 自回归初始化、分布匹配蒸馏。在共享相机条件、训练与推理接口下,实例化四个 5B–33B 模型,分别基于 Wan2.2、LTX-2.5、MiniMax-H3,并保留各自原生表示与目标。数据引擎将来自 10 个数据集的 143 万 canonical clips 转换为统一的帧对齐 contract,解耦源处理与混合构建。训练仅使用 5s 序列,验证推理可扩展至分钟到小时级 rollout。

关键发现

  • 训练后的因果模型支持实时交互,rollout 长度从分钟到小时不等。
  • 多源数据引擎与 backbone-native adaptation 使不同架构模型在统一条件下可比、可复现。
  • 数据 contract 统一视觉观察、度量相机几何、caption、质量元数据、选择决策与 provenance,消除跨源监督不一致。

与基线对比解读

相比朴素数据混合和模型特定实现,SolarWM 通过统一 contract 与共享接口避免了不一致监督。相比常见双向视频生成,其 DMD-based causal training 提供因果生成能力,更适合交互式世界模型的长时推演。论文未给出具体数值指标,但框架级设计直接回应了可复现性和扩展性痛点。

行业影响

落地场景

  • 具身智能 / 机器人仿真:利用世界模型生成交互式视频环境,用于策略学习与 Sim2Real 数据增强,减少真实机器人采集成本。
  • 自动驾驶仿真:统一多源相机几何数据,生成长时程多视角驾驶场景,补充 corner case,加速感知与规划模型迭代。
  • 电商与内容平台:交互式商品视频生成(用户旋转视角、改变光照/背景),以及游戏/短剧的实时剧情生成。

商业价值

  • 降本:开源 1.43M 统一数据 + 三阶段训练配方,将 5s 短序列训练扩展至分钟/小时推理,显著降低数据准备和算力成本。
  • 可复现性:统一数据契约与 backbone-native 接口,减少团队间重复实验,加快产品验证。
  • 体验提升:实时交互能力(camera-conditioning + causal rollout)支持新型沉浸式广告、虚拟导购等付费场景。

与现有工作流接口

  • 提供共享 camera-conditioning / training / inference interface,可直接适配 Wan2.2、LTX-2.5、MiniMax-H3 等视频生成骨干,作为模块嵌入现有生成 stack。
  • 数据引擎输出统一 schema(视觉观测、metric camera、caption、质量元数据、provenance),可对接数据湖和 ML pipeline。
  • 发布权重与框架,支持 Hugging Face 部署、LoRA 微调垂直领域。

具体 use case

  1. 电商虚拟试穿:将商品视频生成升级为交互式,用户拖拽视角或更换场景,模型实时输出对应画面,提升转化率并降低拍摄成本。
  2. 自动驾驶仿真:基于 SolarWM 统一多源驾驶数据,生成不同天气、交通流下的长时程交互场景,用于端到端规划模型训练,减少真实路测依赖。

局限

  • 论文自身承认的核心局限在于训练序列长度与长时 rollout 之间的鸿沟:模型仅在 5s 片段上训练,依赖 teacher-forced 自回归初始化和 distribution matching distillation 外推至分钟级甚至小时级交互。这种外推机制缺乏在真实闭环交互中持续数十步以上的稳定性验证,长期来生成可能导致运动漂移、场景崩溃或相机轨迹偏离物理约束,需要在真实 agent 闭环或更长训练序列上进一步验证。
  • 可推断的局限主要来自数据引擎:10 个数据集、1.43M canonical clips 的规模相对有限,且数据集构成多集中于驾驶、室内和可控场景,对开放域极端动态、复杂物体交互和多主体行为的覆盖不足。统一数据契约在规范化相机参数、caption 和质量元数据时,可能丢失原始数据集的细粒度标注信息;同时 source-aware filtering 的决策规则未公开消融,可能导致某些高价值但低质量分数的样本被过度过滤,影响模型对长尾分布的泛化。
  • 与同类闭源 frontier 工作对比,SolarWM 采用开源 backbone(Wan2.2、LTX-2.5、MiniMax-H3)且最大参数规模仅 33B,在绝对视觉质量和复杂物理规律建模上可能弱于使用更大规模专有架构与私有数据的模型(如 Sora、Genie 系列)。此外,backbone-native adaptation 为保持通用性,需在统一接口上做折中,可能无法充分利用每个 backbone 的特有优化技巧(如 LTX 的 clean plate 处理或 MiniMax-H3 的 tokenizer 特性),从而限制单一 backbone 上的极致性能。
论文Junchao Huang2026-09-02原文

相关内容