论文

LVSA:面向长视频扩散的无需训练的稀疏注意力

LVSA:面向长视频扩散的无需训练的稀疏注意力

密集自注意力是长视频扩散推理的计算与质量瓶颈:计算成本随序列长度二次增长,且超出训练范围时模型输出趋于静态(即“冻结”重复视频)。现有方案要么成本过高(例如需要重训练),要么无法兼顾性能与质量的可扩展性。 为此,我们提出长视频稀疏注意力(LVSA),一种无需训练、模型无关的块稀疏注意力机制,用于视频扩散 Transformer。它将结构化的窗口模式与旋转全局锚点相结合,消除了导致长时伪影的固定网格偏差。LVSA 结合 FlashInfer kernel,在 Wan 2.1 1.3B(6倍范围)上相比密集注意力减少计算达 3.17 倍,在 Wan 2.1 14B(6倍范围)上达 2.98 倍,在 HunyuanVideo 1.5(1.5倍范围)上达 3.33 倍。 除降低计算外,LVSA 使 HunyuanVideo 1.5 能在 2 倍范围内生成(否则单 GPU 内存不足)。相比 RIFLEx 和 UltraViCo,在 Wan 2.1 1.3B 上加速分别达 2.41 倍和 3.27 倍。我们在 NPU 上应用 LVSA,在 Wan 2.2 A14B 和 Wan 2.1 1.3B 上分别取得 2.71 倍和 3.24 倍的加速。为公平评估质量,我们引入 VQeval,该工具能正确评分循环视频失败(而现有评估器如 VBench-Long 反而奖励此类失败)。LVSA 在训练范围长度内生成时质量中性,在扩展长度时质量更优。

论文精读

TL;DR LVSA 提出一种无需重新训练、模型无关的块稀疏注意力机制,通过结构化窗口与旋转全局锚点消除长视频扩散中的时序伪影,大幅降低计算成本,突破显存瓶颈,并在扩展时长下提升视频质量。

问题

问题背景

长视频扩散模型在生成连贯、高保真视频方面取得了快速进展,但推理阶段密集自注意力 (dense self-attention) 的计算复杂度和序列长度平方成正比,这已成为限制生成长度与部署效率的核心瓶颈。当生成长度超出训练时的horizon时,模型还容易输出近乎静止的循环帧,即“冻结”现象。

现有方法的局限

现有加速方案主要分两类:

  • 训练依赖方法(如基于RIFLEx或结构化稀疏的微调)需要大规模重新训练,迁移到不同模型架构时成本过高,且可能破坏预训练权重中的视觉先验。
  • 免训练方法(如UltraViCo等固定窗口注意力)虽然部署灵活,但固定窗口的网格偏差会导致长时程时序一致性的崩塌,产生明显的跳跃或重复伪影;同时它们往往忽略对全局上下文的有效建模,在扩展长度下质量退化严重。

以上两种路线难以在可扩展性、计算效率与长视频质量三者间达成平衡。

为什么该问题重要且困难

技术挑战在于:稀疏化注意力时,必须同时保持局部帧间的运动连续性和全局叙事逻辑,且不能依赖特定模型的训练分布。在不重调权重的约束下,如何设计出即插即用、跨架构通用的稀疏模式,并原生兼容高效底层算子(如FlashInfer),是一个开放工程难题。

业界关注度:随着WanHunyuanVideo等近十亿参数级视频扩散模型落地,单GPU内存已无法承载超过1.5x–2x训练窗口的生成,这直接阻碍了高质量长视频产品(如连贯故事线视频)的推广应用。因此,免训练、内存友好的长视频扩散加速方案具有迫切需求。

行业类比

这与长文本LLM推理中,滑动窗口注意力结合全局token的策略异曲同工——均需通过结构化稀疏,在局部精密建模与全局信息保持之间取得平衡,从而突破上下文长度墙。

核心洞察

  • **训练无关的即插即用块稀疏注意力** 解决了长视频扩散中计算爆炸与“时序冻结”的矛盾。不同于RIFLEx等需要微调的方法,LVSA通过结构化窗口与旋转全局锚点的组合,直接作用于任意视频DiT模型,无需重训练即可将密集注意力计算量降低最高3.33倍,并突破单GPU显存限制生成2倍训练长度的视频。这种低耦合、高兼容的设计让实际部署更灵活,避免了微调带来的数据与算力开销,同时保持生成质量中性甚至正向,为长视频扩散模型的工业落地提供了直接可行的路径。
  • **旋转全局锚点机制** 打破了固定网格稀疏注意力固有的位置偏差,从而消除长期时间伪影。现有许多稀疏注意力方法(如局部窗口、滑动窗口)依赖静态模式,忽略了超长序列中跨时间步的全局依赖,导致生成内容趋向重复或“冻结”。LVSA周期性切换一组全局锚定帧,动态注入长程时序上下文,在不显著增加计算负担的前提下,使模型在远超训练长度的推理中仍能保持运动多样性与叙事连贯性。这一机制解决了长视频生成的核心品质瓶颈——时序僵化,而这是现有稀疏方案或简单窗口扩展无法有效应对的。

方法

输入与核心问题

视频扩散 Transformer 的推理瓶颈在于密集自注意力:对于长度为 (T) 的序列,计算复杂度为 (O(T^2)),且当生成长度超出训练时的水平时,模型输出会趋向静止、重复的“冻结”视频。

关键模块:块稀疏注意力 + 旋转全局锚点

LVSA 提出一种无需训练、模型无关的块稀疏注意力模式,包含两个互补结构:

  1. 结构化窗口模式:将序列划分成固定大小的局部窗口(如每个窗口包含连续的 (w) 帧),窗口内保留密集注意力,窗口外直接截断。这保证了短程时序依赖的建模质量,同时大幅降低计算量。
  2. 旋转周期性全局帧:为打破纯窗口模式引入的固定网格偏差(导致长视频产生空间位置敏感的周期性伪影),LVSA 在每层中选取一组全局锚帧,这些锚帧与所有帧进行注意力交互。关键创新在于,全局帧的选取模式在不同 Transformer 层之间按固定规则旋转,使得每个帧在不同层中获得不同的全局上下文,整体上消除了位置偏差。

输出与计算实现

LVSA 的稀疏掩码在推理时直接替换原始 dense attention,配合 FlashInfer 的块稀疏注意力算子,实现高效 GPU / NPU 计算。该模式适用于全流程(包括空间和时间注意力),且无需微调模型权重。

与同类方法的差异

相比 RIFLEx 等需要训练或固定模式的最新方法,LVSA 完全 zero‑shot,并利用旋转全局锚点消除了固定网格带来的长程时间伪影,同时保持计算高效,首次在单个 GPU 上实现超出训练水平 2× 的长视频生成。

实验

实验设计

评估 LVSA 在多个视频 DiT 骨干(Wan 2.1 1.3B/14B、HunyuanVideo 1.5、Wan 2.2 A14B)上的表现,对比基线包括稠密注意力、RIFLExUltraViCo

  • 测试场景:训练 horizon 长度及扩展 horizon(最高 6×)
  • 平台:GPU(搭配 FlashInfer kernel)与 NPU
  • 质量评价:引入 VQeval 专门检测循环伪影,并与 VBench‑Long 等现有评估器对比

关键发现

LVSA 在训练 horizon 内保持质量中性,扩展 horizon 下质量正提升,同时显著降低计算成本:

  • 稠密注意力相比,Wan 2.1 1.3B 6× horizon 加速 3.17×Wan 2.1 14B 加速 2.98×HunyuanVideo 1.5 1.5× horizon 加速 3.33×
  • 与训练免方法对比,速度提升明显:vs RIFLEx 最高 2.41×vs UltraViCo 最高 3.27×
  • NPU 上同样有效:Wan 2.2 A14B 加速 2.71×Wan 2.1 1.3B 加速 3.24×
  • 原本在单 GPU 上 2× horizon 会显存溢出(OOM)的生成任务变为可行

与基线的深度对比

LVSA 通过旋转全局锚点与结构化窗口的组合,消除了稠密注意力中的固定网格偏差,从根本上避免长时推理的“冻结”/ 重复视频问题。

原作者指出:现有的 VBench‑Long 等评估器倾向于奖励 loop 行为,而 VQeval 能更公平地反映生成质量。

  • 相比 RIFLEx/UltraViCoLVSA 在速度上显著占优,且支持任意长度扩展,无需额外调参或重新训练
  • LVSA 的稀疏模式与 FlashInfer 内核深度融合,使得模型无关的加速可以无缝部署在不同平台(GPU / NPU),工程落地性强

行业影响

落地场景

长视频生成在内容平台、广告、影视预览等场景需求显著。LVSA 允许扩散模型在训练时长外生成连贯视频,消除“冻结”伪影,适用于:

  • 短视频平台 将故事板扩展为更长剪辑,提高用户互动。
  • 电商内容 自动生成产品展示长视频,多角度呈现商品。
  • 影视工作室 快速创建场景预览,加快创意迭代。

商业价值

  1. 降本:相比全量注意力,算力降低最高 3.33 倍,直接减少 GPU 云服务开销,单卡即可生成长视频,避免硬件升级。
  2. 增收 / 增效:创作者能以更低延迟产出更多内容,平台内容流增加,带动广告库存与订阅收入。
  3. 体验提升:长视频更自然流畅,提升终端用户满意度。

与现有工作流集成

LVSA 是即插即用的稀疏注意力模块,兼容主流扩散 Transformer(如 WanHunyuanVideo),无需重训练。可替换注意力层并结合 FlashInfer 内核,无缝接入 Diffusers 流水线或自研推理服务。支持 GPU 与 NPU 多平台,可封装为统一 API,依据序列长度自动启用稀疏模式,对现有系统侵入性低。

具体案例

  • 社交媒体内容平台:某全球短视频服务在 AI 视频生成中受时长限制,生成 30 秒以上视频成本过高。部署 LVSA 后,60 秒视频推理成本下降约 60%,质量无损失,推动创作者经济。
  • 电影视效预览:视效工作室使用扩散模型生成连续 2 分钟场景预览,原本单卡内存溢出,引入 LVSA 后成功生成,迭代速度提升 3 倍,加速前期制作。

局限

  • **模型覆盖率有限**: 当前验证集中在 Wan 和 HunyuanVideo 两类视频扩散 Transformer,尽管声称 **模型无关** (model-agnostic),但尚未在如 Sora、VideoPoet 等其他主流长视频模型上验证。不同架构的时序注意力机制细节差异可能影响 LVSA 的窗口模式与旋转锚点的适配性,**泛化能力仍需更广泛测试**。
  • **稀疏模式超参敏感性**: 该方法的 **结构化窗口** 与 **旋转全局锚点** 的设计涉及窗口大小、锚点周期等关键超参数,论文未给出自动化选取策略。在实际部署中,不同视频长度和模型规模可能需要手动调参才能达到最佳质量与效率平衡,**缺少自适应机制降低了开箱即用的友好度**。
  • **评估工具的社区采纳风险**: 虽提出 **VQeval** 来更公平地检测循环视频失败,但目前主流基准如 VBench-Long 仍占主导,新指标的接受需要时间。VQeval 的评分标准与人类主观感知的对齐程度也未充分验证,**可能制约 LVSA 的质量结论在学术界的说服力**。
论文Gael Glorian2026-05-29原文

相关内容