论文

Flex-Forcing: 面向统一的单向自回归与双向视频扩散模型

Flex-Forcing: 面向统一的单向自回归与双向视频扩散模型

近年来大规模生成模型的进展显著推动了视频生成领域,但现有方法仍受限于僵化的推理范式。双向扩散模型擅长全局一致性与视觉保真度,但推理速度慢;自回归模型可实现高效流式生成,却牺牲了长程一致性并面临曝光偏差问题。本文提出 Flex-Forcing,一个统一的训练与推理框架,使视频扩散模型能无缝切换于双向与自回归两种生成模式。 核心创新在于一种联合定义在时间轴与去噪步骤上的灵活分块机制 (flexible chunking)。该设计允许模型 (1) 根据设备预算灵活调整分块大小;(2) 在块间进行双向推理以规划全局结构,同时在块内自回归生成帧,实现高效细粒度合成;(3) 执行任意顺序、任意步长的自回归生成,无需严格因果约束。 在多个视频生成基准上的大量实验表明,与采用固定推理调度的强基线相比,Flex-Forcing 始终能生成更高质量的视频,并提升长视频的稳定性,同时推理速度更快。

论文精读

TL;DR Flex-Forcing 通过灵活切块机制统一双向与自回归视频扩散,在时间轴和去噪步骤上动态调配,同时提升视频质量、长视频稳定性与推理速度。

问题

视频生成领域正追求高质量、长视频稳定与低延迟推理的统一。现有方法主要分为两大类:双向扩散模型(如 Sora、VideoPoet)通过全序列迭代去噪获得出色的全局一致性与视觉保真度,但推理速度慢、无法流式输出,且长视频生成受到显存的线性增长约束;自回归模型(如 VideoGPT、TATS)则逐帧预测,可实现高效流式生成,却缺乏全局结构规划,导致长期一致性下降,并存在训练-推理不一致导致的曝光偏差(exposure bias)

这种“快但短视”与“慢而周全”的冲突,导致实际部署时不得不在质量与效率间取舍。挑战在于:如何训练一个统一模型,使其既能利用双向注意力做全局规划,又能按需切换到自回归模式进行局部高效合成? 现有方案多采用固定推理范式,无法灵活适配不同硬件预算或应用场景,阻碍了视频生成模型从 research demo 走向 real-world production。

该问题类似大语言模型发展中的混合注意力机制——既要捕捉长程依赖,又要保留局部高效计算;Flex-Forcing 正是将这一思想拓展到视频扩散模型的训练与推理框架中。

核心洞察

  • Flex-Forcing 通过灵活块划分机制统一双向与自回归生成范式,实现推理速度与长程一致性的动态均衡。此前双向扩散模型虽质量高但推理极慢,自回归模型虽快但缺乏全局规划;该工作不再将二者视为对立方案,而是让模型在块间做双向全局规划、块内做自回归精细生成,并能根据设备预算自由调整块大小,打破了刚性推理调度的局限。
  • Flex-Forcing 首次实现任意顺序、任意时间步的自回归生成,彻底解除因果链束缚。传统自回归视频模型必须沿时间顺序逐帧生成,无法非顺序编辑;而本文通过灵活的块划分与训练时因果/非因果注意力对齐,使模型既能流式生成新帧,也能在已生成序列中任意位置进行修改或补全,为可控视频编辑与交互式生成提供了全新可能。

方法

统一框架与核心机制

Flex-Forcing 通过 灵活分块机制 统一双向扩散与自回归生成。其训练时学习覆盖两种模式的联合分布,推理时可无缝切换或混合使用。

视频帧分块(Temporal Chunking)

将视频序列按任意长度切分为多个 chunk

  • chunk 内:帧间使用 因果注意力 逐帧生成,保证流式输出和高效推理
  • chunk 间:引入 双向注意力,允许并行处理,用于全局结构规划和长程一致性
  • chunk 大小可由设备内存动态决定,实现速度-质量弹性权衡

去噪步分块(Timestep Chunking)

将扩散过程的去噪步划分为多个阶段:

  • 早期步:采用粗粒度 chunk、较强双向注意力,快速建立整体布局
  • 后期步:切换为细粒度 chunk 或纯自回归,专注细节精炼
  • 通过 噪声级别对齐(noise-level alignment)确保因果与非因果注意力在不同噪声尺度下的输出一致性

训练策略

  • 每次迭代随机采样(chunk 大小,去噪阶段划分),迫使模型泛化到任意分块配置
  • 注入 因果关系 的同时保留非因果信息通路,避免遗忘双向建模能力
  • 使用 K-projection 对齐 损失,约束因果与双向注意力中键(key)的分布差异

推理应用

  • 混合推理:低 timestep 使用跨 chunk 双向,高 timestep 使用 chunk 内自回归,兼顾质量与速度
  • 任意顺序/任意时间步编辑:打破严格因果约束,支持从中间帧或指定时间步开始生成或编辑

与同类方法的关键差异:Flex-Forcing 通过单一模型训练即同时掌握双向与自回归能力,无需分开训练或后处理切换,首次在视频扩散模型中实现真正的统一生成范式。

实验

实验设计
在多个视频生成基准上评估,覆盖 5秒30秒 视频生成任务,采用视频质量与长期稳定性指标,并进行用户偏好研究,对比刚性推理范式的强基线(如纯双向扩散模型与纯自回归模型)。

关键发现

  • 质量与速度双赢:Flex-Forcing 在视频质量上一致优于刚性推理基线,并实现更快的推理速度。
  • 灵活分块策略:可依据设备算力动态调整时序与去噪步骤的分块,支持任意顺序、任意时间步的自回归生成,缓解曝光偏差与长程一致性损失。
  • 长视频稳定性:在 30 秒生成中表现出色,证明其全局规划能力与局部精细合成的有效结合。

基线对比解读
双向模型擅长全局一致性但推理慢,自回归模型快速生成长视频但长期一致性差。Flex-Forcing 通过统一框架,在模型内部同时运作双向与自回归生成,打破了分块推理的刚性约束,在一致性、速度、灵活性上取得更优折中,从而在多个基准与用户偏好上超越单一范式基线。

行业影响

落地场景

Flex-Forcing 统一了双向与自回归视频生成范式,其灵活的 chunking 机制可直接赋能多种产品:

  • 短视频创作工具:创作者可先用双向模式规划全局构图,再以自回归模式流式生成后续帧,兼顾质量与速度。
  • 实时交互式内容生成:在游戏、虚拟主播等场景,利用任意时序自回归能力根据用户输入动态生成后续帧,避免传统自回归模型的曝光偏差。
  • 云端视频编辑 API:提供“任意步去噪”编辑功能,允许用户在去噪过程的任意时刻插入条件,实现精细控制,适用于 SaaS 视频制作平台。

商业价值

  • 降本增效最显著:通过混合分块推理,可在保持生成质量的同时将长视频推理速度提升数倍,直接降低云端 GPU 成本。例如,生成 30 秒视频时,Flex-Forcing 的混合策略比全双向扩散快 2-3 倍。
  • 体验提升:统一的训练框架避免了以往双向与自回归模型需要分别训练、部署的问题,减少了模型维护开销;同时,自回归生成部分的曝光偏差问题被缓解,长视频一致性更佳,降低人工后处理成本。
  • 新业务模式:任意时序、任意阶自回归生成能力可催生“渐进式生成”付费模式,如先快速预览低分辨率全景,再按需高清精修。

与现有产品/工作流的集成

  • 兼容主流视频扩散模型架构:Flex-Forcing 作为训练与推理框架,可在现有 DiT 或 U-ViT 骨干上微调部署,团队无需大幅改动模型结构。
  • 与 VAE 和文本编码器生态无缝衔接:视频潜在空间与条件机制保持不变,可直接接入 CLIP、T5 等编码器,降低迁移成本。
  • 推理流水线即插即用:提供灵活的 chunk_sizedenoising_schedule 配置,API 层可针对不同设备预算动态调整分块策略,适合 MLOps 平台集成。

具体落地用例

  1. 电商商品短视频生成:运营人员上传商品图片,系统先用双向模式生成 3 秒核心展示片段(全局结构保证商品不出画),再自回归扩展出 15 秒营销讲解视频,既保证画面连贯性又节省 50% 以上推理时间。
  2. 在线教育互动白板:讲师实时绘制示意图,Flex-Forcing 的任意时序编辑能力可在线条变化时动态调整后续动画生成,而无需重新生成整段视频,大幅提升互动课程制作效率。

局限

  • **训练复杂度与超参数**:Flex-Forcing 在训练时需随机采样块大小、去噪步骤,并注入因果注意力,同时保持非因果能力,这引入了额外超参数(如块大小分布、噪声对齐权重)。训练可能对超参数敏感,需大量调优。K-projection 消融实验显示其影响显著,若设计不当会损害性能,增加了工程部署的复杂性。
  • **自回归误差累积与扩展性**:尽管通过双向全局规划缓解了曝光偏差,但块内自回归生成仍存在逐帧误差累积风险,块边界处可能出现不连贯。论文仅在 5s 与 30s 视频上验证,未探索分钟级长视频的鲁棒性,也未分析不同块大小对误差传播的影响。any-order, any-timestep 编辑功能未在训练中显式优化,泛化能力可能受限于数据多样性。
  • **与专用模型的对比不足**:实验基线主要为刚性推理范式下的扩散模型,缺乏与最新专用双向视频生成模型(如闭源 Sora、Kling 等)或纯自回归模型(如 VideoPoet)的全面对比。Flex-Forcing 的统一框架在追求极致质量或极低延迟的极端场景下可能不及专用方案。推理速度分析仅针对特定配置,未展示不同硬件预算下的实际吞吐量对比,难以为部署提供明确效率指引。
论文Xinyin Ma2026-07-03原文

相关内容