论文

MilliVid: 用于视频生成中长程一致性的分层潜在变量

MilliVid: 用于视频生成中长程一致性的分层潜在变量

视频生成模型的能力不断增强,但长程一致性仍是挑战,因为即使仅生成几十帧也需要极长的 transformer 序列长度,这在实践中不可行。本文表明,通过在多尺度 token 空间中进行 coarse-to-fine rollout 可以缓解这一问题。 方法简单:首先预训练一个自编码器,将每帧压缩为 token 的层次结构,层级从典型潜在分辨率到每帧仅几个 token。最粗的层级捕捉场景布局和语义等关键信息,而较细的层级补充高频外观和纹理。随后,训练一个视频扩散模型,采用 coarse-to-fine rollout 生成这些 token。通过在每一步 rollout 中精心控制生成帧的细节层级及其作为上下文的范围,模型能够保持几何和物体永久性的长程一致性,同时减少对感知不重要的细节的长程一致性计算开销。 在长段 Minecraft 视频的自定义数据集上验证,相比现有基线,该方法生成了明显更一致的 rollout 结果。

论文精读

TL;DR MilliVid 通过层次化多尺度 token 与粗到细扩散生成,大幅降低长视频建模的序列长度瓶颈,在保持场景布局与物体持久性的同时显著提升长距离一致性,在 Minecraft 长视频上超越基线。

问题

问题背景

视频生成模型在文生视频、世界模型等方向进展迅速,但长距离一致性(如物体持久存在、场景几何稳定)仍是落地瓶颈。业界高度关注如何让模型在生成长达数百帧的视频时,保持时空连贯。

现有方法局限

主流方案采用单一尺度潜空间编码,通过 Transformer 注意力处理所有帧。然而,由于注意力复杂度随序列长度平方增长,生成长视频时上下文窗口急剧膨胀。即便只生成几十帧,序列长度也已超出硬件可承受范围。

  • 全分辨率帧级生成:每帧都需高维 token 表示,显存与计算量难以控制。
  • 稀疏上下文或滑动窗口:虽可降低复杂度,但牺牲了对远处帧的直接访问,导致物体外观或位置逐渐漂移。
  • 粗粒度压缩:直接大幅降低单帧分辨率会丢失高频纹理细节,使画面模糊。

为什么这个问题难/重要

保持长程一致性需模型在推理时“记住”并复用远距离的视觉信息,这与当前注意力机制的平方代价相矛盾。在自动驾驶、机器人仿真、游戏内容生成等需要长时域连续输出的场景中,一致性缺失会破坏物理合理性,使生成内容无法用于决策。学界与工业界均亟需一种计算代价可控且能捕捉全局结构的生成范式。

行业类比

类似自动驾驶中的多尺度 BEV 特征——粗粒度特征捕捉道路拓扑与全局关系,细粒度特征补充障碍物等高分辨率信息,二者协作才能实现高效且可靠的规划。

核心洞察

  • 该工作通过预训练层次化自编码器,将视频帧压缩为多尺度潜在表示,其中粗粒度token捕获场景布局与语义,细粒度补充纹理细节,从而将全局一致性与局部细节建模解耦。与使用固定单一分辨率的潜在空间(如CogVideo、Stable Video Diffusion)或仅执行级联超分的做法不同,MilliVid的层次化潜在表示在同一编码器内学习,确保各尺度间语义对齐,且粗粒度token数量极少(每帧仅数个),使得长程注意力能够在计算可承受的序列长度下有效建模,避免了对整个长序列进行全注意力计算的爆炸性开销。
  • 提出粗到细滚动生成策略,先以最粗粒度生成全部视频帧,再逐步添加细节,每一步仅对更粗粒度的上下文进行长程注意力,从而在保持几何与物体持久性的同时,大幅降低计算消耗。这不同于传统的级联扩散模型(如先生成低分辨率视频再超分),因为所有生成步骤共享同一扩散模型权重,且粗粒度仍保留语义信息而非纯粹的下采样像素。该策略使得模型在生成时能够规划全局运动与场景结构,再填充高频纹理,有效避免了长视频生成中的漂移与物体消失问题,相比FramePack等利用帧打包的方法,能更灵活地控制一致性粒度。

方法

输入

原始视频帧序列,无需额外标注,期望生成长时间一致的连续视频。

关键模块

层次化自编码器

首先预训练一个 多尺度 VQ 自编码器,将每一帧压缩为 层次化 token。编码器输出多个尺度的特征图,经向量量化后得到离散 token 序列:最粗尺度每帧仅数个 token,编码场景布局、物体恒常性等全局语义;最细尺度 token 数量与常规潜在分辨率相当,补充高频纹理。解码器从所有尺度 token 重建原始帧,确保层次化表征的信息完整性。

扩散模型与由粗到精推演

基于层次化 token 训练一个 视频扩散模型(DiT 架构),在 token 空间上施行扩散过程。生成时采用 由粗到精的推演策略

  1. 从纯噪声开始,先在所有帧上并行生成最粗尺度的 token,利用完整时序上下文建立长程几何与语义一致性
  2. 以已生成的粗 token 为条件,逐步生成更细尺度的 token;细尺度生成仅在局部时间窗口内进行,既保证了外观细节,又大幅降低了注意力计算量。 训练时采用对应噪声调度,让模型学会在不同尺度上逐步去噪。

输出

生成的长视频在几何布局、物体存在等方面保持长期稳定,同时细节丰富。推理速度因粗尺度全局与细尺度局部的分工而得到优化。

与同类方法的差异

不同于 级联模型(先生成关键帧再插值)或单尺度全注意力模型,MilliVid 在同一层次化潜在空间中统一建模,粗 token 直接作为细 token 生成的条件信号,避免了多阶段训练的不一致;也不同于仅压缩空间而时序仍全注意力的方案,我们将长程一致性的计算聚焦在粗 token 上,显著节省资源,同时保持感知上至关重要的全局连贯性。

实验

实验设计

  • 数据集:自制 Minecraft 长视频数据集,考验长时间跨度的几何、语义与物体持久性一致性。
  • 方法:预训练层次化自编码器将每帧压缩为粗到细的多尺度 token,再训练视频扩散模型以粗到细 rollout 方式逐步生成 token,并通过控制每个 rollout 步中帧的细节级别与上下文窗口,平衡长程一致性与计算开销。
  • 对比基线:与标准视频扩散模型、同等训练的级联模型(cascaded)、可访问更多帧上下文的架构(如 FramePack)等比较。

关键发现

  • 最粗层级 token(仅数个 per frame)捕捉了场景布局、语义等关键结构信息,细层级 token 负责高频纹理;粗到细生成能维持几何与物体持久性,避免长视频中物体无端消失或变形。
  • 对感知不重要的高频细节,模型减少了其在长程上下文中的计算资源分配,从而以更低算力实现强一致性,大幅缓解了长序列 transformer 的序列长度瓶颈。

与基线对比深度解读

  • 相比直接在全分辨率长序列上训练的基线,MilliVid 的 rollout 一致性显著更高,证明层次化多尺度 token 是解决长程一致性的有效途径。
  • 级联模型(cascaded)对比,层次化 latent 提供了更平滑的粗到细过渡,避免了级联中多个独立模型间的误差累积。
  • 研究发现,即使给予基线模型访问更多帧上下文的能力,其一致性提升仍不及 MilliVid 的层次化方法,说明并非上下文越长越好——关键在于在恰当的抽象层级上维护一致性,粗粒度长程上下文 + 细粒度短程纹理的策略取得了更优的权衡。

行业影响

落地场景

MilliVid 的多尺度分层潜变量生成技术,特别适合需要长时间、连贯视频生成的产品与业务,例如:

  • 虚拟世界 / 游戏内容自动生成:利用其长程一致性,为开放世界游戏(如 Minecraft)自动创建数分钟乃至更长的连贯游玩录像,降低手动录制成本。
  • 视频内容平台:为视频创作者提供可控的长视频续写或风格化工具,生成具有物体永久性(object permanence)的场景序列,减少前后矛盾。
  • 具身智能 / 机器人仿真:生成长期一致的仿真视频,用于训练和评估具身 agents 在长时间交互中的规划能力。

商业价值

  • 降本:传统长视频生成需要高显存的 Transformer 处理长序列,MilliVid 通过粗到细生成(coarse-to-fine rollout)减少对长序列的关注,使长视频生成能运行在更经济的硬件上,同时推理速度可能提升(原文未给出推理时间对比,但从计算量角度看,粗层级 token 数量极低,可大幅缩减计算)。
  • 体验提升:对于需要保持场景布局、物体永久性的应用,MilliVid 能显著减少画面跳变与逻辑矛盾,提升生成内容的可信度与用户留存。

与现有产品 / 工作流的接口

MilliVid 可作为一个即插即用的长视频生成模块集成进现有视频生成流水线:

  • 预训练层次化自编码器(Hierarchical Autoencoder) 可单独训练后部署,为任何视频生成模型提供多尺度 token。
  • 粗到细扩散模型 可替换现有视频扩散模型主干,尤其适合那些已经采用自回归或滑窗生成长视频的框架(如 FramePack、VideoPoet),只需将上下文窗口内的帧替换为相应层级的 token 即可。
  • 与现有视频编辑 / 控制工具的接口:可为 ControlNet 类方法提供多尺度条件,实现粗细粒度的控制。

具体落地 use case

  1. 电商虚拟试穿与场景展示:为服装电商生成模特在连续场景中行走的长视频,保持衣物褶皱与光影的长期一致性,避免传统方法中帧间抖动。
  2. 教育仿真与培训视频生成:为医学或工业培训生成长时间、第一人称视角的规范操作视频(如手术流程),要求器械位置、视角变换前后一致;MilliVid 的粗层级 token 捕获布局语义,可确保关键步骤逻辑连贯。

局限

  • **数据集单一且领域特殊**:实验仅在 **Minecraft 游戏视频** 上进行验证,该场景具有块状几何结构和重复纹理,缺乏真实世界的多样性与复杂动态(如人类动作、自然气象变化)。尽管作者声称该方法适用于更通用领域,但并未在标准视频生成基准(如 UCF-101、Kinetics)或真实长视频上提供量化结果,其泛化能力存疑,可能过度依赖低熵的 Minecraft 环境。
  • **粗到细生成可能引入结构模糊**:在分层展开过程中,粗粒度 token 负责全局布局,细粒度 token 补充细节,但若粗粒度预测出现偏差(如物体位置漂移),后续细粒度生成会固化错误且难以纠正。论文未充分分析 **误差传播** 问题,也未与 **一次性生成所有细节** 的方法进行公平对比以量化该风险。此外,多尺度潜在空间的解耦性未经验证,可能限制了在需要精细纹理控制的场景下的应用。
  • **推理效率并非显然优于现有方法**:该方法虽声称减少长程一致性的计算量,但实际推理需执行多次扩散反向过程(每个尺度一次),且高层 token 仍需处理长序列,总计算量可能不亚于优化后的长上下文 Transformer(如使用局部注意力的模型)。论文未报告 **实际推理延迟与显存占用**,也未与 **FramePack** 等近期高效方法在可比算力下进行一致性对比,实用性难以评估。
论文Ishaan Preetam Chandratreya2026-06-08原文

相关内容