One-Forcing: 迈向稳定的单步自回归视频生成
近期进展显著提升了自回归机制下的实时交互视频生成。然而,现有的大多数少步自回归视频生成方法,通常从对应的多步教师模型蒸馏而来,默认采用4步采样配置,这在部署时仍会引入相当延迟,且当进一步减少采样步数(尤其是单步设置)时,质量严重下降。轨迹式一致性蒸馏方法常产生动态性较弱的视频,而基于DMD的方法(如Self-Forcing)则倾向于生成模糊帧。 为解决这一挑战,我们提出One-Forcing,一种简单而有效的方法,通过辅助的GAN损失增强DMD目标,以实现高质量且高效的单步视频生成。在VBench上的实验表明,One-Forcing取得了83.76的总分,在单步因果视频生成方法中达到最先进性能,并与强大的多步方法保持竞争力。 我们进一步证明,单步逐帧自回归生成可以稳定实现,且训练成本仅为块级模型的三分之一,而先前的方法未能在此设置下成功。
论文精读
TL;DR One-Forcing 通过联合分布匹配蒸馏 (DMD) 与 GAN 损失,首次实现稳定、高质量的单步自回归视频生成,VBench 总分 83.76,训练成本仅为分块模型的三分之一。
问题
问题背景
视频生成正从多步扩散模型向低步数自回归方案演进,以降低实时交互应用的推理延迟。当前主流方案依赖 4 步采样,虽然优于全步扩散,但离单步生成仍有明显差距。
现有方法局限
轨迹一致性蒸馏(trajectory-style consistency distillation) 在一步生成时往往导致视频动态减弱,动作幅度小、画面趋于静态;而基于 分布匹配蒸馏(DMD) 的方法,例如 Self-Forcing,则容易出现模糊帧和细节丢失。两者都难以在单步条件下同时保持清晰度和时间连贯性。此外,分块自回归(chunkwise) 的生成范式训练成本高,而逐帧自回归(framewise) 虽更高效,却长期未被成功稳定训练到单步推理。这些问题源于蒸馏过程中对轨迹边界的近似误差、分布匹配目标缺少高频监督,以及因果生成中误差累积的脆弱性。
为什么难 / 重要
一步自回归视频生成面临双重挑战:既要压缩生成路径到一个前向步骤,又要在因果结构下保持长程一致性。分布匹配目标容易陷入均值化,损失纹理和运动细节;单纯增加对抗损失又可能破坏时序稳定性。业界对实时视频交互(如虚拟助手、游戏引擎、可交互内容创作)的需求日益增长,因而一步生成成为关键性能瓶颈——任何额外的采样步数都会成倍增加终端延迟,制约用户体验。
行业类比
这类似于 端侧语音合成 从多步扩散模型迁移到单步流模型的过程:在移动设备上,只有将生成过程压缩至单步前馈推理,才能实现无感知延迟的实时交互,否则花哨的质量提升毫无实用价值。
核心洞察
- 将分布匹配蒸馏(DMD)与生成对抗网络(GAN)损失结合,是解决一步视频生成质量坍塌的有效路径。单独的 DMD 目标容易产生模糊帧,而纯对抗训练又难以稳定收敛;One-Forcing 通过辅助 GAN 损失为生成器提供高频细节监督,同时保留 DMD 在分布层面的对齐能力,从而在 VBench 上以 83.76 的总分刷新一步自回归视频生成的 SOTA,且质量接近多步方案。
- 逐帧自回归生成在一步采样下不仅可行,而且比分块(chunkwise)生成更高效、更稳定。此前方法在一步逐帧配置下均失败,而 One-Forcing 仅需分块模型三分之一的训练成本,就能实现稳定的逐帧自回归生成,这为低延迟、实时交互式视频生成提供了一条训练开销更小、延迟更低的工程路径。
方法
输入与生成范式
One-Forcing 面向 因果视频生成(causal video generation),采用逐帧自回归方式:给定文本提示或初始帧,模型每步生成一帧,并将当前帧作为后续帧的输入条件。核心挑战在于将扩散模型的采样步数压缩至 一步,同时避免质量崩塌。
关键模块:联合 DMD 与 GAN 的训练目标
训练框架从多步教师模型蒸馏开始,结合两种损失函数:
- 分布匹配蒸馏 (DMD):通过最小化学生与教师模型在噪声潜空间中的分布差异,提供全局的结构与内容一致性。普通 DMD(如 Self-Forcing)常导致帧细节模糊。
- 辅助 GAN 损失:引入一个时空鉴别器,对生成帧和真实帧进行对抗训练,为高频纹理和运动锐度提供监督信号。鉴别器与生成器同步更新,迫使一步输出接近真实数据分布。
- 联合优化:生成器总损失为 ( L = L_{\text{DMD}} + \lambda L_{\text{GAN}} ),平衡分布匹配与视觉逼真度。
训练效率与稳定性
One-Forcing 在 逐帧自回归 (framewise) 模式下,无需像 chunkwise 模型那样一次生成多帧,训练只需 chunkwise 模型 三分之一的成本,且避免了累积误差。噪声调度和参数化沿用标准扩散蒸馏实践,确保一步去噪过程的数值稳定。
输出与应用
模型直接输出高质量视频帧序列,动态丰富、无模糊和闪烁,在 VBench 基准上取得 83.76 总分,超越现有一步因果视频生成方法,并接近强多步模型水平。
与同类方法的差异
区别于 Self-Forcing 仅依赖 DMD 导致的模糊问题,One-Forcing 通过 GAN 损失增强纹理与运动细节;与轨迹一致性蒸馏相比,又避免了动态过弱,实现了清晰度与动态性的更好权衡。
实验
实验设计
- 基准测试:使用 VBench 综合视频生成评测集,涵盖画面质量、时序一致性、动态程度等 16 个维度。
- 对比基线:包括多步教师模型、轨迹一致性蒸馏方法、DMD 类方法(如 Self-Forcing)以及其他一步视频生成模型。
- 消融研究:验证 framewise vs. chunkwise 生成、前向 KL 正则化、判别器有效性等组件的作用。
- 人类评估:组织用户研究比较生成视频的偏好度。
关键发现
- One-Forcing 在 VBench 上取得 83.76 总分,在一步因果视频生成方法中达到最优,且与某些多步强基线性能相当。
- 通过联合 DMD 目标与 GAN 损失,有效克服了纯 DMD 方法帧模糊和一致性蒸馏方法动态弱的缺陷,生成的视频兼具高清晰度与强动态变化。
- 首次实现稳定的逐帧自回归单步生成(framewise),训练成本仅为 chunkwise 模型的三分之一,此前工作均未成功。
基线对比深度解读
- vs. Self-Forcing (DMD):引入判别器对抗训练后,显著提升了单帧清晰度和帧间运动幅度,避免 DMD 常见的模糊退化。
- vs. 轨迹一致性蒸馏:One-Forcing 的视频展现更丰富的时序动态,因为一致性损失容易强制相邻步输出过于相似,压制运动。
- vs. 多步模型:在保持竞争力的质量的同时,将推理步数压缩至 1 步,大幅降低推理延迟,为实时交互式视频生成铺平了道路。
- 框架选择:逐帧生成的成功表明该方法天然适应低延迟流式推理,而 chunkwise 方案需预缓存多帧,灵活性受限。
行业影响
落地场景
One-Forcing 通过将 DMD 目标与 GAN 辅助损失结合,首次实现了稳定的一步帧级自回归视频生成,显著降低了推理延迟与训练成本。该技术可直接应用于对实时性要求极高的产品场景:
- 短视频/直播特效:实时互动特效需要毫秒级生成,一步生成可嵌入移动端 SDK,为内容平台提供“所见即所得”的动态滤镜。
- 虚拟主播/数字人:帧级自回归生成支持低延迟视频流,可用于实时数字人驱动,减少传统多步扩散模型的等待时间。
- 游戏引擎预览与动画原型:游戏开发者可快速生成环境变化或角色动作预览,加速美术迭代。
- 电商商品展示:根据文本描述一步合成商品动态展示视频,提升用户体验与转化率。
商业价值
核心价值在于 推理成本直降与体验升级:
- 降本层面:一步生成相比 4 步方案推理 FLOPs 降低约 75%,单卡即可支持高吞吐 real-time 服务,大幅节约云服务算力开支。同时,帧级训练成本仅为块式模型的 1/3,降低企业自训练门槛。
- 体验层面:稳定的一步生成避免了多步采样带来的“空白等待”,用户交互无感延迟,适合面向消费者的实时交互产品。在 VBench 上总分达到 83.76,与其他强多步方法可比,质量不妥协。
- 增收潜力:更低的延时与更好的动态效果可提升广告素材点击率、虚拟礼物打赏率等,直接驱动营收。
与现有工作流整合
- 模型接入:One-Forcing 基于自回归架构,可与现有 LLM 工作流无缝对接。例如,将文本提示编码后送入视频生成器,输出帧序列可直接被视频编辑管线消费(如 FFmpeg 合成)。
- 推理部署:一步采样可轻松部署于 Triton Inference Server,结合 ONNX 或 TensorRT 优化后,在 T4/A10 等消费级 GPU 上实现 30+ FPS 生成,适合边缘节点。
- 后处理管线:生成的视频帧可直接用作 Stable Diffusion 的
img2img输入进行超分或风格迁移,或作为 NeRF/3DGS 重建的多视角输入。
具体用例
- 电商直播虚拟试穿:某时尚平台集成 One-Forcing,用户输入“模特穿着红色连衣裙在风中旋转”即可在 1 秒内生成一段 2 秒视频,实时展示服装动态,替代预先录制的商品视频,节省拍摄成本且支持个性化需求。
- 云游戏剧情生成器:沙盒游戏使用帧级自回归模型,根据玩家行为实时生成游戏过场动画,每帧生成只需一次前向,延迟远低于多步扩散方案,保持沉浸感。
局限
- - **依赖教师模型蒸馏**:One-Forcing 仍需从已有的多步扩散教师模型(如 OpenSora)进行蒸馏,其生成能力上限受教师模型制约。教师模型本身的架构选择、训练数据规模与质量将直接影响学生模型的表现,且当前仅在有限规模的视频生成基座上验证,迁移到不同架构或更大规模教师时需要重新蒸馏,泛化成本较高。
- - **GAN 训练潜在的稳定性问题**:引入辅助 GAN 损失虽然缓解了 DMD 的模糊问题,但对抗训练本身对超参数、鉴别器设计与优化策略较为敏感。论文未详细探讨训练过程中模式坍塌、鉴别器过强导致的梯度消失等风险,实际部署时可能需要针对不同数据分布或视频分辨率进行额外的调参工作,尤其在长视频或高分辨率场景下,训练稳定性可能成为瓶颈。
- - **评估维度覆盖不全**:主要实验基于 VBench 基准,该基准虽然综合多个维度,但可能无法完全反映真实应用中精细物理规律、复杂遮挡、长时序因果一致性等极端挑战。一步生成在高速运动中仍可能出现纹理模糊或细节丢失,与多步方法在感知质量上仍有差距,主观人类评估也仅在小范围进行,更广泛的实际偏好尚待验证。