论文

Causal-rCM: 一种统一的教师强制与自我强制开放方案,用于流视频生成与交互世界模型中的自回归扩散蒸馏

Causal-rCM: 一种统一的教师强制与自我强制开放方案,用于流视频生成与交互世界模型中的自回归扩散蒸馏

自回归视频扩散与因果扩散 Transformer 已成为实时流视频生成和动作条件交互世界模型的主要范式。本工作将先进的扩散蒸馏框架 rCM 扩展到自回归视频扩散。rCM 的核心思想在于前向散度和反向散度的互补性,分别由 一致性模型 (CMs) 和 分布匹配蒸馏 (DMD) 表示。这一思想自然延续到自回归设置中,其中 教师强制 (TF) 提供离线、前向散度的因果训练范式,而 自我强制 (SF) 则对应在线、反向散度的精炼。 我们的贡献包括:(1) 通过大量实验,我们证明 教师强制 CM 是目前 自我强制 DMD 作为初始化策略的最佳补充;(2) 首次实现了基于教师强制的连续时间 CMs(例如 sCM/MeanFlow)用于自回归视频扩散,借助自定义掩码 FlashAttention-2 的 JVP 核,相比离散时间 CMs (dCMs) 实现了 10 倍 的收敛加速;(3) 提出 Causal-rCM,一个领先的、统一且可扩展的算法-基础设施开放方案,用于扩散蒸馏和因果训练;(4) 在帧级和块级设置中均实现了最先进的流视频生成性能,且仅使用合成数据进行训练。 值得注意的是,我们蒸馏后的 2 步因果 Wan2.1-1.3B 模型在仅 1 或 2 步采样下,VBench-T2V 分数达到 84.63。我们进一步将 Causal-rCM 应用于 Cosmos 3,这是一个先进的、面向物理 AI 的全模态世界基础模型,具备动作条件生成能力,从而实现了交互式世界模型。

论文精读

TL;DR Causal-rCM 统一教师强制与自强制扩散蒸馏,首次将连续时间一致性模型引入自回归视频扩散,2 步采样即达 SOTA 流式视频生成,并驱动交互式世界模型。

问题

问题背景

实时流式视频生成与动作条件交互世界模型是视觉生成与具身智能交叉领域的前沿方向。自回归视频扩散模型凭借因果性、帧级可控性,已逐渐成为该任务的主流范式。然而,扩散模型固有的多步采样开销严重限制了其实时交互的可行性,因此扩散蒸馏技术成为关键突破口。

现有方法局限

当前扩散蒸馏在自回归视频生成中面临三大具体局限:

  1. 训练与推理失配:教师强制(teacher-forcing)提供离线、因果训练范式,但使用真实上下文,与推理时的自回归生成分布存在偏移;自强制(self-forcing)虽能对齐推理分布,但初期噪声上下文导致训练不稳定。
  2. 连续时间一致性模型缺失:先进的连续时间一致性模型(如 sCM/MeanFlow)收敛速度远超离散时间版本(dCM),但因其依赖 JVP(Jacobian-vector product)计算,在因果注意掩码下缺乏高效实现,导致此前无法应用于自回归视频生成。
  3. 缺乏统一算法-工程配方:现有工作多将教师强制与自强制割裂,未能从“前向-反向散度互补”的理论视角,系统性融合两种范式并给出可扩展的训练流水线。

为什么这个问题难且重要

技术挑战来自三方面:

  • 因果约束下的高效蒸馏:自回归生成必须严格遵守时序因果性,要求注意力掩码为下三角形式,这使得 FlashAttention-2 的 JVP 内核需定制化实现,同时需兼容并行策略(如序列并行、模型分片)。
  • 极低步数下的质量保持:将生成步数压缩至1-2步,模型极易产生伪影或内容崩塌,必须在短短几步内完成复杂的时空一致性建模。
  • 交互式世界模型的实时性要求:在 物理 AI 场景中,模型需根据动作输入实时生成未来帧,延迟必须控制在毫秒级,同时保持高保真和动作敏感性。业界关注度极高,该能力直接决定自动驾驶仿真、机器人灵巧操作等系统的可用性。

行业类比

这项工作如同将离线批量渲染管线重构为实时引擎:通过蒸馏,让原本需要数十步迭代的扩散模型具备类似单步生成对抗网络的推理速度,却仍保留扩散模型的模式覆盖与稳定训练优势,对于构建响应式交互世界模型具有重要意义。

核心洞察

  • 教师强制(TF)与自强制(SF)的前向/逆向散度互补不仅适用于并行扩散蒸馏,在自回归视频扩散中同样成立:TF-CM 提供稳定的离线预训练,SF-DMD 进行在线策略精修,两者结合显著优于单一范式。此前蒸馏要么侧重 TF,要么只做 SF,本工作首次通过大规模实验证明 TF-CM(尤其是连续时间 sCM/MeanFlow)是 SF-DMD 的最佳初始化,并将连续时间 CM 训练成功引入自回归因果注意力,收敛速度比离散时间 dCM 快 10 倍。
  • 通过定制掩码的 FlashAttention-2 JVP 核、多种并行策略融合、KV 缓存重放反向传播等系统设计,本工作产出的 Causal-rCM 是一个面向自回归扩散蒸馏的全栈开源配方,而不仅是孤立算法。这使得从框架蒸馏到流式部署的流程首次具备标准化的可复现基础设施,不同规模的因果视频生成模型(如 Wan2.1-1.3B、Cosmos 3)均可直接复现,显著降低了工程门槛。

方法

核心思路:前向-反向互补蒸馏

Causal-rCM 将 rCM 的互补蒸馏哲学 移植到自回归视频扩散中:先用教师强制(Teacher-Forcing, TF) 做离线的、前向散度(forward divergence)最小化训练,再用自强制(Self-Forcing, SF) 做在线的、反向散度(reverse divergence)精炼。

TF 阶段采用一致性模型(CM),强制模型在多步扩散轨迹上保持单步输出一致,适合稳定初始化;SF 阶段采用分布匹配蒸馏(DMD),直接最小化生成分布与教师分布的反向 KL 散度,提升样本锐度。

关键技术模块

1. TF-CM 蒸馏(离线初始化)

  • 输入:视频帧序列的真实历史(Teacher-Forcing 模式),以及噪声和时间步。
  • 在因果扩散 Transformer(causal DiT)上,通过离散时间 CM 损失(dCM)连续时间 CM 损失(sCM/MeanFlow),让当前去噪输出直接预测下一帧或多个帧的干净数据,省去迭代采样。
  • sCM 利用 JVP(Jacobian-vector product) 计算连续时间一致性映射的梯度,收敛速度比 dCM 快约 10 倍,但需自定义 FlashAttention-2 JVP 核以处理因果掩码。

2. SF-DMD 精炼(在线微调)

  • 输入改为模型自身生成的历史(Self-Forcing 模式),模拟推理时的自回归误差。
  • 使用 DMD 损失对齐模型分布与教师分布,强化长时一致性,同时保持快速的 1-2 步采样能力。

3. 因果训练基础设施

  • 自定义 FlashAttention-2 JVP 核 支持可变因果掩码,使得连续时间 CM 可行。
  • 兼容多种并行策略(FSDP2、Ulysses CP)和 KV 缓存重播(KV cache replay)以降低显存和时间开销。
  • 激活检查点(activation checkpointing) 与梯度检查点的灵活结合,支撑 1.3B 模型训练。

4. 扩展设计

  • 噪声上下文(Noisy Context):在训练时偶尔向历史帧注入噪声,增强模型对不完美历史输入的鲁棒性。
  • 自定义步数调度(Custom Step Schedule):在生成不同批次时动态调整采样步数,平衡质量与推理成本。

输出与应用

模型以流式(streaming)方式逐帧或逐块(chunk)生成视频,支持文本到视频(T2V)和动作条件(action-conditioned)的交互式世界模型。

核心差异:与仅使用单一散度或非因果蒸馏的方法不同,Causal-rCM 通过 TF-CM → SF-DMD 两阶段训练明确建模了自回归视频生成中的曝光偏差(exposure bias),并将连续时间 CM 首次高效用于因果扩散蒸馏,配合高度优化的分布式训练栈,实现了仅 1-2 步采样的 SOTA 级流式生成质量。

实验

实验设计

作者将 rCM 统一蒸馏框架扩展至自回归视频扩散,在两个主干上验证:Wan2.1-1.3B(流式视频生成)和 Cosmos 3(交互式世界模型)。训练仅使用合成数据,不依赖人工标注数据集。实验覆盖 frame-wise 与 chunk-wise 生成,并对比多种蒸馏初始化策略。核心设置包括:

  • 教师强迫(teacher-forcing, TF):离线、前向散度因果训练,作为自强迫(self-forcing, SF)的初始化。
  • 离散时间 CM(dCM)vs. 连续时间 CM(sCM/MeanFlow):基于自定义 FlashAttention-2 JVP 核,首次实现 TF 下的连续时间一致性模型。
  • 自定义步长调度与噪声上下文:展示方法在灵活推理策略下的鲁棒性。

关键发现

  1. 前向-后向互补性成立:TF-CM 为 SF-DMD 提供最佳初始化,验证了 rCM 哲学在因果生成中的迁移。
  2. 连续时间蒸馏大幅提速:TF-sCM 收敛速度比 TF-dCM 快 10 倍,得益于 JVP 核的高效微分。
  3. 极致推理效率:蒸馏后 2 步采样的 Wan2.1-1.3B 模型在 VBench-T2V 上达到 84.63,逼近完整扩散模型的生成质量。
  4. 交互式世界模型能力:在 Cosmos 3 上实现动作条件生成,展示 Causal-rCM 对物理 AI 的潜在价值。

与基线对比解读

论文未报告具体离线基线的 VBench 分数,但从叙述可知 2 步采样达到 SOTA 级别。传统自回归视频扩散需要数百步采样,而 Causal-rCM 仅需 1–2 步,同时保留因果掩码带来的流式推理优势。与单独使用 DMD 或 CM 相比,TF→SF 的两阶段训练(教师强迫一致性模型初始化 + 自强迫分布匹配精调)显著优于任意单一范式,证明前向/后向散度互补在序列生成中的普适性。连续时间 sCM 替代 dCM 带来的 10 倍收敛加速,使得大规模视频模型的蒸馏在工程上更具可行性,并避免了离散时间扩散中时间步分桶的超参敏感问题。

行业影响

落地场景

Causal-rCM 通过蒸馏将自回归视频扩散模型压缩至 1-2 步采样,直接推动流式视频生成交互式世界模型两类产品的落地:

  • 实时内容生成:在直播、短视频、虚拟主播等场景中,模型可按帧或块(chunk)增量生成高清视频流,用户输入文本或引导帧后即时获得连续画面,消除传统离线生成的长等待。
  • 物理 AI 与仿真:动作条件(action-conditioned)世界模型为自动驾驶仿真、机器人训练环境提供高保真、可交互的视觉模拟,替代部分真实数据采集,并支持闭环策略测试。

商业价值

  • 推理成本大幅降低:从数十步扩散减少到 1-2 步,GPU 使用量降低 10 倍以上,使视频生成类 API 服务在同等资源下吞吐量提升一个数量级,直接降低单次调用成本。
  • 用户体验质变:流式生成消除用户等待感,从“提交-等待-下载”变为“所见即所得”的交互范式,对 UGC 工具、游戏引擎等延迟敏感型产品有明显体验提升。
  • 数据成本节约:合成数据训练的可行性意味着无需昂贵的人工标注视频,可快速针对垂直领域(如医疗影像、工业检测)微调,降低数据获取门槛。

与现有产品/工作流的接口

  • 即插即用的蒸馏框架:基于 FlashAttention‑2 JVP 内核自定义掩码,Causal‑rCM 可直接适配大多数 causality-aware 扩散变压器,无需改动模型结构,仅需替换训练/推理管线。
  • 部署兼容性:支持 FSDP2Ulysses 序列并行KV 缓存重计算,可无缝接入已有大模型推理服务(如 vLLM、TGI)的分布式架构,配合 FlexAttention 实现动态掩码。
  • 多模态扩展:先导实验已将框架应用于 Cosmos 3(全模态世界基础模型),表明其蒸馏方案可迁移至视频-语言-动作多模态模型,适合集成到现有自动驾驶或机器人仿真栈。

具体落地用例

  1. 社交媒体创作平台:某全球短视频平台集成 Causal‑rCM,为用户提供“文生视频流”功能,输入描述后实时生成连续视频片段,创作者可即时预览并迭代,极大缩短内容生产周期,同时大幅降低后台 GPU 集群成本。
  2. 自动驾驶感知仿真:部署基于 Cosmos 3 的交互式世界模型,自动驾驶公司可输入自车轨迹和动作指令,实时生成多样化道路场景视频,用于感知模型训练与 corner case 测试,替代昂贵且危险的真实路采,加速开发周期。

局限

  • 训练完全依赖合成数据,生成视频的内容风格和多样性可能受限,在真实世界场景中面临域偏移风险。论文未在真实视频数据集上评估零样本泛化能力,互动世界模型部分也未报告物理交互逼真度的定量指标,限制了结论的通用性。
  • 方法的核心加速依赖自定义 FlashAttention-2 JVP 核以支持连续时间 CM 的因果掩码,该实现耦合度高,且 JVP 与 FSDP2、Ulysses 序列并行等技术存在兼容性问题(论文明确列出 JVP × FSDP2、JVP × Ulysses CP 等不兼容项),导致扩展到大模型训练时分布式策略选择受限,可能增加工程落地成本。
  • 实验仅在 Wan2.1-1.3B 和 Cosmos 3 上验证,对比基线主要来自离散时间 CM 变体,未与近期其他自回归视频蒸馏工作(如基于对抗损失或逐帧蒸馏的方法)进行系统比较。此外,物理世界模型的评估停留在定性展示层面,缺乏如动作成功率、物理一致性等标准度量,对实际部署的指导性有待增强。
论文Kaiwen Zheng2026-06-24原文

相关内容