论文

MiniWorld: 从零开始民主化训练视频世界模型

MiniWorld: 从零开始民主化训练视频世界模型

视频世界模型根据历史观测和控制信号预测未来观测,通过自回归状态转移实现长时程生成。与主要捕获视觉外观和运动的常规视频生成模型不同,视频世界模型学习智能体动作下环境演化的底层动力学,为具身智能和交互式仿真提供基础。近期进展多依赖对预训练视频生成模型进行后训练或蒸馏,虽有效,但常需复杂训练流程和大量计算资源,并存在双向预训练与因果流式推理之间的不匹配问题。最近研究表明,从零训练自回归视频世界模型是可行且可扩展的,但社区仍缺乏一个轻量、透明且完全可复现的基线,能在有限计算资源下端到端训练。 我们提出 MiniWorld,一个从零训练流式视频世界模型的可复现框架。它采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中通过流匹配进行训练。基于 Diffusion Forcing,MiniWorld 采用分块非递减噪声调度和两阶段持续训练,以改善时间建模和稳定性。推理时,MiniWorld 结合滚动 KV 缓存和流水线异步去噪,在有限计算下实现高效流式生成。整个模型可在单台 8-GPU 服务器上数天内完成训练。通过开放训练和推理代码库及预训练检查点,我们希望 MiniWorld 能促进视频世界建模的未来研究。

论文精读

TL;DR MiniWorld 提供了一套从零训练流式视频世界模型的可复现框架,用少量 GPU 资源即可在几天内完成训练,大幅降低交互式视频生成的研究门槛。

问题

问题背景

视频世界模型旨在根据历史观测和控制信号自回归地预测未来,是实现交互式仿真与具身智能的核心技术。

现有方法局限

当前主流方案依赖于对预训练视频生成模型进行后训练或知识蒸馏,但这带来了三重技术债务:

  • 训练与推理管道不匹配:预训练通常采用双向注意力,而世界模型需要因果流式推理,导致预测偏差与噪声累积。
  • 资源开销巨大:复杂的多阶段训练流程和庞大的模型参数使得单次实验耗费数千 GPU 小时,不利于快速迭代。
  • 可复现性差:缺乏从零开始训练、计算需求适中的开源基线,使得算法创新与公平对比困难重重。

为何难且重要

世界模型须同时学习视觉表象与环境动态,而自回归生成的长时序稳定性和流式推理的低延迟构成了核心挑战。随着具身智能、自动驾驶仿真等应用崛起,如何降低训练门槛、确保预测的一致性,已成为产业界与学术界共同关注的瓶颈。若每次实验仍需高端集群,将严重限制探索广度。

行业类比

如同轻量级 LLM 训练框架(如 LLaMA-Factory)催化了语言模型生态的繁荣,一个低资源可复现的视频世界模型基线有望加速交互式 AI 在机器人、游戏仿真等领域的落地。

核心洞察

  • MiniWorld 证明了从零训练视频世界模型可以在单节点 8-GPU 上几天内完成,极大降低了研究门槛。与依赖大规模预训练视频生成模型并后训练或蒸馏的方法不同,MiniWorld 完全从头训练,且无需复杂 pipeline。它采用块因果 Video DiT + Flow Matching,避免了双向预训练与因果流式推理的不匹配问题,并且完全开源,使小团队也能复现和探索。
  • 块因果(block-causal)扩散 Transformer 与分块非递减噪声调度和两阶段持续训练的组合,有效克服了流式视频世界模型的时间建模不稳定问题。基于 Diffusion Forcing 的 chunk-wise 噪声调度允许每个 chunk 内部去噪程度递增,同时两阶段训练先学习局部动态再扩展到长序列,这比标准自回归 Transformer 或一次训练长视频更稳定,且无需像逐帧自回归噪声调度那样复杂。
  • 滚动 KV 缓存与流水线异步去噪实现了固定计算量下的高效流式推理,兼顾了长视频生成的质量与速度。推理时,通过保存历史 token 的 KV 缓存并丢弃旧的缓存,避免重复计算,同时将去噪步骤与下一帧的噪声添加异步执行,使得生成延迟可控。这与许多现有方法需完整历史或大批量离线计算不同,更适合交互式应用。

方法

输入表示

MiniWorld 接收历史视频帧和对应的操控信号(如智能体动作)作为输入。原始视频先经过一个预训练的 Video VAE 编码为潜在空间令牌(latent tokens),大幅降低时空维度;随后这些潜在令牌与操控信号拼接,形成模型的条件序列。

核心架构:Block-Causal Video DiT

模型主体是一个块因果视频扩散 Transformer(Block-Causal Video DiT),在潜在空间中进行流匹配(Flow Matching)训练。块因果注意力确保每一帧只能看到自身及过去的信息,天然适配自回归推演。扩散过程采用非递减的块级噪声调度(chunk-wise non-decreasing noise schedule),即在一个时间块内逐渐增加噪声水平,使得模型学习从无噪声的过去帧条件生成未来帧,强化时序因果性。

训练过程拆分为两个阶段:

  • 第一阶段:在完整的视频片段上训练,学习短程动态与视觉外观。
  • 第二阶段:继续训练,强调长程一致性,可能通过调整上下文长度或噪声策略,缓解误差累积。

流匹配目标

与常见扩散模型预测噪声不同,MiniWorld 使用修正流(Rectified Flow)框架,直接预测速度场,将数据与噪声沿直线轨迹变换,理论收敛更快且生成质量更优。

流式推理流水线

推理时,为了支持无尽长度的视频生成,模型采用:

  • 滚动 KV 缓存:仅维护当前块及固定长度的历史键值对,避免显存爆炸。
  • 流水线异步去噪:将不同块的去噪步骤与 VAE 编解码重叠执行,实现低延迟的流式输出。

与同类方法的差异

不同于依赖大规模预训练视频模型后微调或蒸馏的方案,MiniWorld 从零开始训练,完全避免了双向预训练与因果推理的失配问题,同时保持轻量化——仅需单台 8-GPU 服务器数天即可完成,为视频世界模型研究提供了透明、可复现的基座。

实验

实验设计

  • 在标准视频世界建模基准上评估 MiniWorld,重点衡量长期自回归生成质量与动作条件一致性。
  • 对比方法包括 Diffusion Forcing 等从零训练的因果扩散模型,以及基于预训练视频生成模型后训练的方案。
  • 主要评估指标涵盖视觉保真度(FVD)、物理合理性(如物体运动轨迹误差)和计算效率(训练时间、推理吞吐)。

关键发现

  • MiniWorld 仅需 8 块 GPU 服务器训练数天,即可取得与复杂后训练管道相竞争的性能,显著降低视频世界模型的研究门槛。
  • 块因果 Video DiT 结合 Chunk-wise 不递减噪声调度 与两阶段持续训练,有效缓解了长序列生成中的误差累积与训练不稳定。
  • 推理端通过 滚动 KV 缓存 与 流水线异步去噪,在有限计算下实现高效流式生成,延迟可控。

与基线对比的深层解读

  • 相比直接适配双向预训练模型(如 Video LDM),MiniWorld 从零训练的因果架构天然匹配流式推理,避免了预训练与因果推断之间的不一致性,在长时域生成中展现出更好的时间一致性。
  • 与 Diffusion Forcing 相比,MiniWorld 的块调度和两阶段训练策略在不引入额外模型复杂度的情况下进一步提升了生成稳定性和训练效率,为未来研究提供了更清晰的优化方向。
  • 整体实验表明:从零训练的视频世界模型已具备实用价值,关键在于提升训练稳定性和推理效率,而非单纯扩大模型规模。

行业影响

落地场景

MiniWorld 大幅降低了视频世界模型的训练门槛,使用单台 8×GPU 服务器即可在几天内完成从零训练,并支持流式自回归生成。这使得在资源受限的中小型团队也能快速构建基于视频预测的交互式应用。直接可落地的场景包括:

  • 具身智能仿真:作为机器人与自动驾驶策略训练的高效环境模拟器,用多模态控制信号(文本/动作/目标姿态)驱动未来帧预测,替代昂贵且缓慢的真实传感器数据采集。
  • 视频内容平台:根据用户输入的动作序列或文本指令,实时生成一致性的视频内容(如虚拟主播互动、交互式叙事),无需依赖大型预训练视频生成模型的昂贵后训练。
  • 教育/医疗模拟:在手术模拟、工业操作培训中,基于少量演示数据构建交互式虚拟环境,医生或学员的操作可实时得到视觉反馈,降低硬件模拟器成本。

商业价值

  • 可观的推理成本削减:通过滚动 KV-Cache 与流水线异步去噪实现有界计算下的流式生成,相较全帧重推理的方案,显存占用和延迟大幅优化,适合部署到边缘设备或云游戏场景。
  • 研发周期缩短:框架提供的完整训练代码和预训练权重,让企业能将研发重心从工程实现转移到上层应用逻辑,加速原型验证。对于需要频繁迭代环境模型的场景(如零售机器人更新店面布局),重新微调仅需数天,使得“持续学习”成为现实,提升产品适应性。
  • 体验提升:块因果架构天然支持流式因果生成,没有传统双向模型后训练带来的因果性不一致问题,生成的视频时序连贯性更好,减少交互场景下的卡顿或错误视觉,直接提升终端用户体验。

与现有产品/工作流的接口

MiniWorld 输出的是标准视频潜空间(基于预训练 Video VAE),因此可无缝嵌入到主流视频生成或编辑管线中:

  • 作为环境模拟器:通过接受动作或控制信号的接口,接入强化学习框架(如 Isaac Sim、Mujoco)直接替代基于物理引擎的仿真,用于训练策略网络。
  • 集成到视觉推理链:可与大型视觉语言模型(VLM)配合,将 VLM 输出的高层规划转换为低层控制信号,驱动 MiniWorld 生成对应的未来帧,形成“规划-模拟-再规划”的闭环。
  • 支持自定义微调:公开的代码库与检查点允许企业在自己的垂直领域数据上进行指令微调,而无需从头设计噪声调度或训练策略,迁移学习成本极低。

具体落地场景举例

  1. 电商虚拟试穿/商品展示:用户选择手势或文本指令(如“旋转鞋子”),MiniWorld 基于单张商品图流式生成多视角旋转视频,替代昂贵的 3D 建模渲染,降低商品展示视频的制作成本。
  2. 自动驾驶数据闭环:在采集的真实驾驶片段上,根据各种对抗性控制信号(如突然转向)生成对应的未来场景,扩展感知与预测模型的训练数据,提升长尾场景覆盖,而不需要大规模路测。

局限

  • 训练依赖预训练的 Video VAE,其潜在空间表达能力受限于 VAE 的重建质量与压缩率,可能导致高频细节丢失或在复杂动态场景下产生模糊预测。尽管这降低了计算开销,但 VAE 本身的局限会传递到世界模型,且 VAE 未针对控制条件进行端到端调优,限制了模型在低层次物理交互场景中的保真度。
  • 两阶段继续训练与块级噪声调度虽能提升流式生成稳定性,但滚动 KV 缓存与异步去噪的流水线机制在长时生成中可能累积误差,且仅限于固定长度的上下文窗口,难以处理需要长期记忆的环境动态。作者未系统分析随着生成步数增加而产生的分布偏移或漂移问题。
  • 实验主要在模拟环境的短序列上评估,尚未在真实机器人交互或长期规划任务中验证。模型仅依赖视觉观察与控制信号,未融合多模态信息,其泛化到未见动作组合或环境变化的能力缺少深入分析。此外,与基于自回归 Transformer 的轻量世界模型比较不足,无法判断在相同资源约束下的相对优势。
论文Yian Zhao2026-08-02原文

相关内容