论文

Video DeltaNet:面向直播视频生成的视频原生混合注意力

Video DeltaNet:面向直播视频生成的视频原生混合注意力

视频扩散模型在去噪过程中需反复处理长时空 token 序列,使注意力成为主要计算瓶颈。线性注意力 虽在近期大语言模型中被广泛采用,但直接迁移到视频模型往往无法保留高质量生成所需的细粒度交互。 我们提出 Video DeltaNet(VDN),将局部 Softmax 注意力 与双向线性记忆相结合以建模长程视频上下文。其线性分支引入 Video Delta Attention(VDA),通过联合融合空间 token 实现逐帧记忆更新。两条支路分别采用独立的输出投影与可学习门控进行校准,并配合分阶段的 teacher-alignment 训练策略,将新路径逐步引入预训练模型。 我们将 VDN 实例化于 MiniMax H3 上,在 video-to-video 交互中采用该混合注意力,而涉及文本或音频的交互仍保留 Softmax。结合八步蒸馏与优化的 SGLang 服务栈,VDN-H3 在 8 块 NVIDIA B200 GPU 上以 6.70 秒完成 14.3 秒、768p 视频的 DiT 去噪,相较同卡数下 50 步稠密 H3 基线实现 14.5 倍 加速。

论文精读

TL;DR Video DeltaNet 将局部 Softmax 注意力与双向线性记忆结合,在 MiniMax H3 上实现 14.5 倍 DiT 去噪加速,同时保持视频生成质量。

问题

问题背景

视频扩散模型在去噪过程中需反复处理长时空 token 序列,注意力机制成为主要计算瓶颈。业界对实时、长时长视频生成(如直播场景)的需求日益增长,要求模型在保证质量的同时大幅降低推理延迟。

现有方法局限

  • 全量 Softmax 注意力: 计算复杂度随序列长度平方增长,对高分辨率、长视频不可承受,典型如 50 步 dense H3 基线在 8 卡 B200 上耗时数十秒。
  • 直接套用线性注意力: 已在 LLM 中广泛使用,但视频生成需要保留精细的时空交互,线性化常导致细节丢失、运动一致性下降,生成质量退化。
  • 简单混合方案: 若只是拼接局部 softmax 与全局线性分支,缺乏有效的输出校准与训练策略,难以在预训练模型上稳定迁移。

为什么这个问题难且重要

视频生成同时面临长程上下文建模与局部细粒度保真度的双重约束。长程依赖需要高效的信息聚合,而细粒度交互(如物体边缘、纹理)依赖精确的注意力权重。线性注意力计算效率高但表达力有限,softmax 表达力强但扩展性差。如何在架构层面融合两者、并通过训练策略让预训练模型平滑适应新分支,是工程落地的核心挑战。此外,推理端还需协同优化服务栈(如 SGLang)与蒸馏步数,才能将理论加速转化为实际吞吐。

行业类比

类似大语言模型在处理超长上下文时采用 Sliding Window Attention + Linear Memory 的混合架构(如 Mistral、RWKV 的变体),视频生成领域也需要一种“视频原生”的混合注意力,在有限算力下支撑高质量实时生成。

核心洞察

  • Video Delta Attention (VDA) 提出帧级更新机制:每帧将所有空间 token 联合更新一次线性记忆,而非逐 token 更新。这与 LLM 中直接迁移线性注意力不同,后者通常按 token 顺序更新,会破坏视频帧内空间耦合与细粒度交互;VDA 利用帧内空间冗余和帧间时序依赖性,在保持线性复杂度的同时,保留生成所需的帧级结构信息,为视频原生线性注意力提供了更符合物理意义的归纳偏置。
  • VDN 采用混合注意力架构,将局部 Softmax 注意力与双向线性记忆结合,并通过可学习的门控和分离输出投影校准两个分支。与全线性或全 Softmax 方案相比,这种解耦使模型能针对视频模态分配计算资源:Softmax 分支处理短程空间细节,线性分支捕捉长程上下文,同时保留文本/音频交互的 Softmax 路径,避免多模态信息损失。这一设计为视频扩散模型中的注意力模块提供了新的解耦思路,兼顾生成质量与计算效率。

方法

输入与整体流程

Video DeltaNet (VDN) 针对视频扩散模型 DiT 去噪过程中的注意力瓶颈,输入为长时空 token 序列。它不改变 DiT 主干,而是将原有的全量 Softmax 注意力替换为混合注意力架构:对 video-to-video 交互使用混合注意力,对涉及 text 或 audio 的交互保留原始 Softmax,以权衡效率与质量。

关键模块

  • 局部 Softmax 注意力:使用滑动窗口限制 token 交互范围,保留短距离细粒度特征,避免长序列全量 Softmax 的平方复杂度。
  • 双向线性注意力 + Video Delta Attention (VDA):线性分支负责长程上下文,采用逐帧更新策略:每帧的空间 token 联合更新一次 memory,而非逐 token 更新,大幅降低线性注意力的状态更新频率,同时提升对视频帧内空间相关性的利用。
  • 双分支融合:两个注意力分支各自拥有独立的输出投影,并通过可学习 gates 进行校准融合,避免某分支主导输出。
  • 训练策略:采用 staged teacher-alignment 将新通路逐步引入预训练模型,先在低学习率下微调线性分支,再开放 gate 和输出投影,最后进行八步蒸馏对齐教师分布,稳定泛化。

输出与效率

在 MiniMax H3 上实例化后,配合优化 SGLang serving stack,八步蒸馏模型在 8 块 NVIDIA B200 上完成 14.3 秒 768p 视频 DiT 去噪仅需 6.70 秒,相比 50 步 dense H3 基线同卡数加速 14.5 倍。

与直接应用线性注意力的方法不同,VDA 通过帧级联合更新和局部 Softmax 分支互补,在显著降低计算量的同时保持视频生成所需的高频细节交互。

实验

实验设计

基于 MiniMax H3 模型,引入 VDN 混合注意力架构。视频-视频交互采用 局部 Softmax 注意力 + 双向线性记忆,文本/音频交互保留 Softmax。通过 staged teacher-alignment 逐步引入新通路,并使用 八步蒸馏 和优化 SGLang 栈。在 8 块 NVIDIA B200 上评估 14.3 秒 768p 视频的 DiT 去噪时间。

关键发现

  • 去噪时间:6.70 秒,相对 50-step dense H3 基线加速 14.5×。
  • 该结果表明视频原生的线性注意力混合方案可显著降低长序列视频生成的计算开销。
  • 从图 1 可见质量与效率的匹配(具体质量指标未在摘要中披露)。

基线对比解读

50-step dense H3 基线使用全 Softmax 注意力,计算随序列长度平方增长。VDN 通过用线性分支处理长程视频上下文、Softmax 保留局部精细交互,在保持生成质量的同时大幅降低 attention 计算量。八步蒸馏进一步压缩步数,与 SGLang 优化叠加实现 14.5× 端到端去噪加速。

行业影响

落地场景

Video DeltaNet(VDN) 面向实时视频生成,尤其适用于直播场景:电商虚拟主播 通过文字或音频驱动实时生成带货画面,内容平台 的互动剧、游戏直播 虚拟分身等。模型可在 8 张 B200 GPU 上以 6.70 秒完成 14.3 秒 768p 视频 DiT 去噪,约 0.47 倍实时,满足准实时生成需求。

商业价值

  • 降本:14.5× 加速使同质量视频所需 GPU·小时数大幅下降,直接降低推理成本;八步蒸馏减少去噪步数,缩短管线延迟。
  • 增收 / 体验提升:实时生成能力解锁互动型视频产品,如实时虚拟人直播带货,降低对真人主播依赖;低延迟与流畅画面可提升观众留存和转化。
  • 相比 dense H3 基线,吞吐大幅提升,支持多路并发直播流。

与现有产品/工作流的接口

  • 模型层:VDN 以 MiniMax H3 为底座,仅替换 video-to-video 注意力为混合结构,text/audio 交互保留 Softmax,便于在既有 DiT 视频模型上增量改造。
  • 推理层:提供优化后的 SGLang serving 栈,支持八步蒸馏推理,可对接现有 vLLM/SGLang 生态。
  • 部署:开放权重(Hugging Face)与 GitHub 实现,企业可快速接入自建视频生成服务,无需从零训练。

局限

  • **泛化性受限**:论文仅在 MiniMax H3 单一架构上验证 VDN,且依赖八步蒸馏与定制 SGLang 服务栈实现加速。虽然 H3 是代表性 DiT 模型,但其他视频 DiT(如 CogVideoX、HunyuanVideo)的注意力模式和 token 布局不同,直接迁移 VDN 需要额外适配工作,其有效性尚未得到跨架构验证。部署时需重写推理服务栈(如边界 gather、decay bridge 等优化),这提高了实际落地的工程门槛。
  • **多模态交互未完全线性化**:VDN 仅将线性注意力应用于视频-视频交互,文本和音频条件仍保留 Softmax 注意力。在带复杂文本/音频条件的生成场景(如直播语音交互、动态字幕)中,计算瓶颈可能转移至条件分支,整体加速收益下降。此外,混合架构增加了模型复杂度和参数数量(额外输出投影、门控),可能影响训练稳定性和内存占用。
  • **帧级更新可能牺牲细粒度时空交互**:VDA 逐帧更新记忆,虽然减少了计算并保持空间整体性,但不同于 token 级线性注意力,跨帧的 token 间细粒度关联被压缩到帧级状态。对于快速运动、遮挡变化或精细纹理演化,可能导致局部细节失真。与 Mamba 或 Gated Linear Attention 等逐 token 方法相比,VDA 在理论表达力上存在差距,文中也未提供针对高速运动场景的专门评估。
论文Haocheng Xi2026-09-17原文

相关内容