论文

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

当前无训练的无限帧长视频生成面临两大挑战:训练-推理不匹配(训练时模型处理完整噪声,推理时需逐步去噪,导致噪声跨度差异)以及长期时序一致性不足。为此,本文提出 MIGA 方法,通过以下创新解决上述问题: 1. 两阶段对齐机制:在训练阶段引入过渡步骤,减小输入模型的噪声跨度,有效缓解训练与推理的鸿沟。 2. 双重一致性增强机制:结合自修正方法(修正早期高噪声帧的错误)与长程帧引导方法(利用后期低噪声帧的全局信息指导生成),共同提升时序连贯性。 实验在 VBench 和 NarrLV 数据集上进行,结果显示 MIGA 在长视频生成质量与一致性上达到最先进性能。项目主页见 https://xiaokunfeng.github.io/migahomepage/。

论文精读

TL;DR MIGA 针对无限帧长视频生成,通过两阶段对齐缓解训练-推理错配,并结合自反射与长程帧引导的双重一致性增强,实现无需训练的连贯长视频 SOTA 效果。

问题

问题背景

视频生成模型在合成数秒短视频上表现优越,但电影、游戏、世界模拟等应用场景亟需生成长时间连贯视频。帧级自回归框架(如 FIFO-diffusion)凭借恒定内存消耗实现无限帧生成,成为 train-free 长视频生成的前沿范式,但其生成质量受限于两个关键瓶颈。

现有方法局限

  1. 训练-推理不匹配:模型训练时接收固定长度的噪声序列,而推理时采用自回归逐帧扩展,导致模型输入的实际噪声跨度与训练分布严重偏离。这种 gap 引起噪声预测偏差,并在多步扩散过程中累积误差,使画面质量骤降。
  2. 长期一致性缺失:自回归生成仅依赖相邻帧约束(如时序注意力或帧间光流),无法建模长程时空依赖,导致视频后期出现物体畸变、运动不连续甚至场景崩溃。现有方法如窗口注意力或时序平滑只能局部缓解,缺乏从早期高噪帧到后期低噪帧的全局矫正机制。

为什么这个问题难/重要

扩散模型的自回归推理是一种分布外(out-of-distribution)操作,微小的输入偏移会在迭代去噪中被指数级放大,而重新训练基础模型又面临计算成本与灾难性遗忘的挑战。长程一致性要求模型理解全局叙事与复杂运动,这本质上需要高维时空建模。当前业界对长视频生成需求急剧增长,解决上述难题可直接赋能数字内容生产、AI 仿真环境和虚拟世界构建,避免高昂的训练开销,具有极高工程落地价值。

行业类比

这类似大语言模型生成长文本时,仅凭前文 token 预测下一 token 容易发生主题漂移,若缺少全局规划与一致性引导,生成内容将逐渐失控;train-free 长视频生成同样亟需“扩散过程的对齐”和“长程注意力”机制来维持连贯性。

核心洞察

  • **MIGA 通过限制噪声跨度的两阶段对齐(TTA)机制,弥合帧级自回归生成中的训练-推理偏移。** 传统 FIFO-diffusion 直接将完整噪声窗口送入模型,与训练时的去噪分布严重不匹配,导致开头帧质量差且误差沿序列传播。TTA 先以部分噪声帧预热、再逐步过渡到全噪声窗口,使模型始终工作在接近训练分布的区间,从而在不增加计算开销的前提下显著提升长视频生成的稳定性和一致性。
  • **MIGA 的双重一致性增强(DCE)从自反射校正和长程帧引导两个互补维度强化时序一致性。** 自反射校正利用同一帧在不同去噪步骤中的预测差异,动态修正早期高噪声帧;长程帧引导则借助后段低噪声帧的大范围上下文来约束当前帧的生成。与仅依赖滑动窗口局部一致性的方法不同,DCE 通过闭环修正和远期信息注入联合遏制误差累积,使长视频中的物体外观和运动轨迹更加连贯。

方法

MIGA 基于帧级自回归扩散框架(如 FIFO-diffusion),在不增加额外训练的前提下,将预训练短视频模型扩展为无限长视频生成器。其核心输入为预训练视频扩散模型与文本提示(支持多提示分段控制),输出连贯的长视频序列,整个过程在恒定显存下完成。

两阶段训练-推理对齐(TTA)

标准帧级自回归推理中,滑动窗口内的帧会被重复加噪去噪,导致实际输入模型的噪声幅度分布偏离训练时的习惯,产生 训练-推理间隙TTA 通过两个阶段缓解这一问题:

  • 阶段一 采用偏大的噪声跨度进行全局规划,快速建立粗粒度时序结构;
  • 阶段二 将噪声跨度收紧至与训练分布更接近的范围,对细节进行精细化去噪。 这种方法使模型在推理时始终工作在熟悉的噪声区间,显著抑制了误差累积。

双一致性增强(DCE)

为解决长视频中的时序抖动与内容漂移,DCE 引入两种互补机制:

  • 自我反思(Self-Reflection):对窗口内早期生成的高噪声帧进行回顾性修正——这些帧在首次生成时因上下文不足而质量偏低,将其重新送入模型,借助后续已生成的清晰帧信息进行“再加工”,从而减少闪烁。
  • 长程帧引导(Long-Range Frame Guidance):从更远的历史窗口(覆盖范围更广)中提取低噪声帧作为干净参考,通过特征注入或注意力引导当前帧的生成,增强物体、纹理的长期一致性。

工程启示与差异点

MIGA 整套机制不涉及模型微调,可直接叠加于大多数视频扩散模型(如 VideoCrafter2Wan2.1)。相比 FIFO-diffusion 仅依赖简单的滑动窗口,MIGA 通过主动对齐噪声分布与多尺度的帧间指导,在 VBenchNarrLV 上取得最优长期一致性,且计算开销增加极少。其核心差异在于将一致性增强从“被动维持”转为“主动修正与引导”,更适合真实世界中需要稳定长视频的应用场景。

实验

实验设计

MIGA 在 VBenchNarrLV 两个长视频生成基准上进行评估,与多种 无训练帧级自回归方法(如 FIFO-diffusion)以及部分训练基模型对比。所有实验基于开源基础视频生成模型(如 VideoCrafter2 与 Wan2.1)运行推理,重点衡量 长期时间一致性 与整体视频质量。消融研究验证了 两阶段训练-推理对齐 (TTA)双重一致性增强 (DCE) 各自模块的贡献。

关键发现

  • TTA 机制 通过降低送入模型的噪声跨度,有效缩小了训练与推理间的分布偏移,使基础模型在自回归生成中表现更稳定。
  • DCE 中的自反思 (self-reflection) 能够纠正早期高噪声帧,而 长程帧引导 (long-range frame guidance) 利用后期低噪声帧的宽覆盖信息来引导生成,二者协同显著提升视频的时序一致性。
  • 在 VBench 的各项子指标(如背景一致性、运动平滑性)上,MIGA 均取得最优结果,同时生成效率与 FIFO-diffusion 持平,未引入额外计算负担。

与基线的深度对比

相较于 FIFO-diffusion,MIGA 的核心区别在于主动管理噪声跨度,而 FIFO-diffusion 直接将完整噪声潜变量送入模型,导致训练-推理错配。此外,FIFO-diffusion 缺乏后期帧对前期帧的显式修正,仅依赖逐帧滑动窗口,长期一致性不足。MIGA 的双重一致性增强借鉴了 多帧信息聚合 的思想,但比传统基于训练的方法更轻量且通用。与训练基方法(如多阶段级联生成)相比,MIGA 保持模块即插即用,不需要针对长视频重新训练,显著降低了部署成本,同时在对比实验中展现了有竞争力的长期视频质量。

行业影响

落地场景

MIGA 的免训练长视频生成能力可直接嵌入现有视频生成管线,适合需要连贯长镜头的应用场景。例如:

  • 影视与游戏制作:快速生成场景一致的长镜头,用于概念验证或背景素材,减少逐帧渲染成本。
  • 内容平台与广告:创作者可使用 MIGA 生成具有叙事连续性的长视频,提升内容生产效率,降低剪辑门槛。
  • 虚拟世界与仿真:在自动驾驶仿真、元宇宙漫游等场景中,生成环境变化平滑的长序列,增强模拟真实感。

商业价值

  • 降本:免训练特性避免昂贵的模型微调,仅通过推理策略改进即可实现无限帧生成,降低计算开销。
  • 体验提升:双一致性增强机制显著改善长视频的时序连贯性,减少镜头跳变与内容漂移,提升用户观看体验,进而提高内容平台的留存与互动率。
  • 灵活部署:方法不依赖特定基座模型,可移植至现有主流视频生成框架(如 VideoCrafter2Wan2.1),企业可快速集成,缩短产品化周期。

与现有产品/工作流的接口

MIGA 采用帧级自回归推理框架,可与现有视频生成 API 或开源模型无缝结合。例如:

  1. 作为推理增强模块:在调用 diffusersComfyUI 等管线时,用 MIGA 替换原生调度器,实现长视频生成,无需重新训练权重。
  2. 集成至视频编辑工具:插件形式为 RunwayMLCapCut 等工具增加“长视频续写”功能,用户只需提供首帧或文本提示。
  3. 云服务扩展:视频生成云平台(如 PikaGenmo)可将其作为高级生成选项,提供按需付费的无限帧生成服务,提升产品差异化竞争力。

具体落地用例

  • 电商商品展示:自动生成多角度、长时间的商品展示视频,保持纹理与光影的一致性,代替昂贵的实拍,降低商品视频制作成本。
  • 教育视频自动生成:输入教学提示词,生成连续的长演示视频(如实验操作、历史演变),减少人工编排与后期剪辑时间,加速内容产出。

局限

  • - **基础模型依赖与通用性限制**:MIGA 建立在帧级自回归框架(如 **FIFO-diffusion**)之上,要求底层预训练视频生成模型具备逐帧去噪与条件生成能力。一旦更换基础模型或模型架构显著变化,两阶段对齐与双重一致性增强的超参数、噪声跨度调度均需重新人工适配,难以即插即用。同时,无训练属性虽然避免了微调开销,但也意味着生成质量的天花板完全由基础模型决定,对于极端运动模糊、快速场景切换或复杂物理交互时,基础模型自身的限制会被逐帧传递并放大,MIGA 的校正能力可能不足。
  • - **超长视频的累积误差与漂移**:尽管 **自反射(self-reflection)** 和 **长程帧引导(long-range frame guidance)** 旨在保持时间一致性,但当前设计主要关注早期高噪声帧的校正和近邻帧引导。当视频延长至数百帧后,用于引导的低噪声帧本身可能已包含微小伪影,这些伪影会作为条件反向影响后续生成,导致内容逐渐漂移(如物体变形、颜色偏移)。论文未提供超长序列(如 >500 帧)的定量一致性分析,仅凭有限长度的评测难以证明“无限帧”的有效性。
  • - **推理效率开销未完全透明**:虽然方法维持了**常量显存占用**,但自反射步骤需要额外一次去噪迭代来修正早期帧,长程帧引导也需要扩大注意力窗口或维护额外历史帧缓冲区,两者均增加了单帧推理时间。论文在效率分析中可能仅比较了显存峰值,未充分报告吞吐量(帧/秒)与端到端延迟,这在实时应用(如流式生成)中会成为瓶颈。与仅用简单滑窗的方法相比,MIGA 的实际推理耗时可能高出数倍,限制了其在高分辨率长视频批量生成中的实用性。
论文X. Feng2026-05-18原文

相关内容