论文

Forcing-KV:面向高效自回归视频扩散模型的混合KV缓存压缩

Forcing-KV:面向高效自回归视频扩散模型的混合KV缓存压缩

自回归(AR)视频扩散模型采用流式生成框架,能够实现长时视频生成与实时响应,Self Forcing 训练范式即为其典型代表。然而,现有AR视频扩散模型因历史帧间冗余的KV缓存导致注意力计算复杂度过高和显存开销巨大,严重限制了可扩展性。 针对此问题,本文首次将KV缓存压缩引入自回归视频扩散领域。我们观察到主流AR扩散模型的注意力头在样本和去噪步骤中展现出截然不同且稳定的注意力模式与功能角色。基于头功能专门化的实证研究,将注意力头划分为两类:静态头(关注自回归块间过渡与帧内保真度)和动态头(控制帧间运动与一致性)。 据此提出 Forcing-KV,一种混合KV缓存压缩策略:对静态头执行结构化静态剪枝,对动态头基于段间相似性进行动态剪枝。在保持输出质量的前提下,该方法在单张 NVIDIA H200 GPU 上实现超过 29 FPS 的生成速度,同时降低 30% 缓存显存;在 480P 分辨率下,LongLive 和 Self Forcing 分别获得 1.35x 和 1.50x 加速,在 1080P 分辨率下进一步达到 2.82x 加速。代码与演示视频见 https://zju-jiyicheng.github.io/Forcing-KV-Page。

论文精读

TL;DR Forcing-KV 将自回归视频扩散模型的注意力头分为静态头和动态头,对前者做结构化静态剪枝、对后者做分段相似度动态剪枝,在单卡 H200 上实现 30% KV 缓存缩减与最高 2.82 倍生成加速。

问题

自回归 (AR) 视频扩散模型借助流式生成框架,如 Self Forcing 训练范式,实现了长时视频的实时生成。然而,现有方法为每一历史帧保留完整的键值 (KV) 缓存,导致注意力的计算复杂度和显存开销随帧数急剧膨胀,严重制约了模型的可扩展性。

现有方法的局限

  • 全量缓存策略:保存所有历史帧的 KV 缓存,使注意力复杂度呈平方级增长,在长视频或高分辨率场景下显存占用极易超出硬件极限。
  • 通用压缩方法失效:直接套用 LLM 中的 KV 缓存压缩(如 token 丢弃或量化)会忽略视频扩散模型中不同注意力头的功能差异,导致破坏关键的帧间运动信息或帧内保真度,生成质量大幅下降。
  • 缺乏头级别的定制化:观察发现,视频扩散模型的注意力头可明确分为静态头(关注 AR 块间过渡与帧内细节)和动态头(负责帧间运动与一致性),但之前的工作并未利用这种功能特化来设计差异化压缩策略。

挑战与重要性

自回归视频生成模型的多帧、多次去噪迭代特性,使缓存总量成倍放大,高分辨率下尤为突出。设计一种既能维持生成质量又能大幅降低显存与计算量的策略极具挑战:需要对不同功能的注意力头进行精确的角色识别,并在不同去噪步和视频样本间保持稳定的剪枝依据。该问题直接影响实时视频生成、交互式应用及云服务成本,业界对高效长视频生成的需求迫切。Forcing-KV 在 NVIDIA H200 GPU 上实现 >29 fps、30% 缓存缩减,并在 480P 下加速 1.35 − 1.50×、1080P 下加速 2.82×,证明其工程价值。

类似于 LLM KV 缓存压缩 对长文本生成的效率革命,Forcing-KV 为自回归视频扩散模型量身打造了头级别混合剪枝方案,成为实时视频生成迈向高分辨率、长时长应用的关键效率突破。

核心洞察

  • **注意力头存在功能分化且高度稳定**:研究发现自回归视频扩散模型中的注意力头可明确划分为“静态头”(侧重块间过渡与帧内保真)和“动态头”(侧重帧间运动与一致性),并且这种功能分化在不同样本和去噪步骤间保持稳定。这一发现为 KV 缓存压缩提供了头粒度的结构性先验,区别于以往将所有注意力头视为同质性的通用压缩方法,能够更有针对性地设计非对称策略,避免对关键功能头造成破坏。
  • **混合压缩策略精准匹配不同头的功能需求**:Forcing-KV 对静态头采用结构化静态剪枝,利用其规律性注意力模式保留全局结构;对动态头采用基于段落相似度的动态剪枝,自适应保留运动关键帧。这种头功能解耦的非对称压缩设计,在保持视频质量的同时实现了单卡 29 FPS 生成、30% 缓存减少,以及高分辨率下高达 2.82 倍加速,突破了现有通用 KV 缓存压缩方法在视频扩散模型上的效率瓶颈。

方法

输入与整体流程

Forcing‑KV 的输入是自回归视频扩散模型(如 Self ForcingLongLive)在流式生成过程中产生的逐帧 KV 缓存。由于模型以分块(chunk)形式自回归预测未来帧,历史帧的 KV 缓存会线性增长,导致注意力计算和显存开销爆炸。

Forcing‑KV 通过离线头剖分 → 静态头结构剪枝 → 动态头相似性剪枝三条流水线,对每个注意力层的 KV 缓存进行选择性压缩,大幅降低冗余。

关键模块

1. 离线头剖分(Offline Head Profiling)

在推理前,通过少量预热样本(无需重新训练)分析所有注意力头的功能分化

  • 静态头:注意力权重高度集中于当前 chunk 的起始和结束 token,负责跨 chunk 的平滑过渡与帧内保真。这类头对位置结构敏感,信息高度可预测。
  • 动态头:注意力分散在多个历史帧上,专注捕捉帧间运动和时序一致性,对内容变化敏感。 分类依据头注意力模式(如 chunk discontinuity 指标)和其在生成任务中的因果作用,且跨样本、跨去噪步骤高度稳定。
2. 静态结构剪枝(Static Structural Pruning)

针对静态头,根据其结构化的注意力分布,保留对当前 chunk 最重要的固定位置的 KV 对(如 chunk 边界 token),丢弃其余位置。剪枝模式(保留哪些位置)在一次剖分后固化,推理时直接按掩码抽取,实现常数级缓存缩减,且几乎不损失质量。

3. 动态相似性剪枝(Dynamic Similarity Pruning)

针对动态头,无法用固定模式概括其注意力范围。采用段级相似度在线动态选择关键 KV:将历史缓存按帧分组,计算各组与当前查询的注意力分数,只保留相似度最高的若干段。该过程自适应视频内容变化,在降低缓存的同时保留对运动建模必需的历史信息。

输出与工程收益

最终,每一层注意力计算的 KV 缓存量被混合压缩,输出精简后的 KV 张量,直接替换原缓存参与注意力运算。在 NVIDIA H200 上实现单卡 29+ FPS 的生成速度,且缓存内存减少约 30%,在 480P 分辨率下实现 1.35×~1.50× 加速,1080P 下可达 2.82× 加速,同时视频质量(VBench 等指标)与 Full KV 相比无明显下降。

与同类方法的差异:现有 KV 缓存压缩(如局域注意力、H2O、FastGen)多针对单阶段自回归文本模型,对视频扩散中混合静态/动态头特性缺乏专门设计;Forcing‑KV 首次针对视频扩散模型的“头功能稳定分化”进行混合压缩,实现结构性剪枝与内容自适应剪枝的协同,在极低质量损失下取得更高加速比。

实验

实验设计

  • 评估基于两种主流的 AR 视频扩散模型:LongLiveSelf Forcing,涵盖 480P 与 1080P 分辨率。
  • 基线设置:与 Full KV Cache 及其他 KV 缓存压缩策略进行对比,并通过 VBench 等自动指标和用户调研衡量生成质量保持度。
  • 离线阶段完成头部画像,将注意力头分为静态头动态头;在线推理时分别应用结构化静态剪枝和段间相似度动态剪枝。
  • 消融研究验证头部画像有效性、混合压缩的必要性,以及动态相似度剪枝的方法选择。

关键发现

  • AR 视频扩散模型中的注意力头呈现稳定且可复现的功能特化:静态头 聚焦于自回归块间的过渡与帧内纹理保真,动态头 则支配帧间运动与全局一致性。
  • 利用该特性,Forcing-KV 的混合压缩在维持生成质量的同时,将 KV 缓存内存占用减少 30%,单 H200 GPU 吞吐超过 29 fps
  • 在 480P 下,LongLiveSelf Forcing 的推理速度分别提升 1.35 倍1.50 倍;在 1080P 下加速达 2.82 倍,且 VBench 各维度分数无明显下降。
  • 压缩优势随分辨率和注意力窗口尺寸增大而放大,表现出清晰的扩展律,证明该方法能有效抑制因帧数增加而二次增长的注意力内存开销。

与基线对比及工程启示

  • 相比均匀淘汰或随机丢弃等启发式压缩,Forcing-KV 在同等压缩率下** VBench 质量保持最优**,关键在于头级差异化处理:静态头的结构化剪枝保护了帧内结构,动态头的相似度剪枝在不破坏帧间连贯性的前提下减少冗余。
  • 相较于 LLM 中常见的 KV 缓存优化(如滑动窗口、分数淘汰),本方法专门针对视频扩散模型的时空注意力模式设计,避免简单移植造成的质量损失。
  • 工程落地启示:① 对于实时流式视频生成,该方案将显存与延迟降至单卡高端 GPU 可承载范围,无需多卡并行或量化;② 离线头部画像+在线组合剪枝的部署方式不依赖模型重训练,易于集成到现有 AR 视频扩散框架中;③ 为后续结合量化、蒸馏等其它压缩手段提供了清晰的模块化基础。

行业影响

落地场景

自回归视频扩散模型 的推理效率问题直接制约其在互动娱乐、实时内容生成和长视频创作中的应用。Forcing-KV 的混合 KV 缓存压缩策略可将生成速度提升至 29 FPS 以上,并减少 30% 的缓存内存,使模型能在单张 GPU 上支撑高分辨率、长时长的实时视频流生成。

典型落地场景包括:

  • 直播与互动媒体:实时生成虚拟主播、游戏角色动态背景或交互式叙事内容,要求低延迟和高帧率。
  • 视频编辑与特效工具:快速预览 autoregressive 扩散模型生成的视频片段,加速创意迭代。
  • 合成数据生成:为自动驾驶、机器人等领域的感知模型批量生产多样性视频数据,提升吞吐量。

商业价值

降本增效 是核心价值。自回归扩散模型推理时,历史帧的 KV 缓存是显存瓶颈,Forcing-KV 在不损失生成质量的前提下压缩缓存,使相同硬件能处理更长序列或更高分辨率,直接降低单帧生成成本。

  • 硬件成本:在 NVIDIA H200 上,480P 分辨率下实现 1.35–1.50 倍 加速,1080P 下可达 2.82 倍 加速,意味着相同吞吐需求下可减少 GPU 数量,或提升现有集群的产出。
  • 服务延迟:对于实时应用,29 FPS 的生成速度已接近视频播放帧率,可构建端到端低延迟 AI 视频服务,改善用户体验。
  • 规模化:随着视频长度和分辨率的增长,KV 缓存压缩带来的收益愈加明显(论文观察到缩放规律),有利于进入长视频生成和超高清内容市场。

与现有产品/工作流的接口

该方法可作为 插件式模块 集成至现有自回归视频扩散框架(如 Self ForcingLongLive),无需重新训练模型。集成步骤清晰:

  1. 离线头部分析:运行少量样本,对注意力头按静态/动态进行标注,该过程离线完成,一次标注可复用。
  2. 推理时注入策略:在扩散模型的每步去噪过程中,对静态头实施结构化剪枝,对动态头根据片段相似度动态剪枝。
  3. 兼容性:可与现有量化技术(论文验证了无缝整合)叠加,进一步压缩内存。
  • 对于已部署 Diffusion Transformer (DiT) 架构的团队,只需在注意力层之后插入缓存压缩逻辑,无需更改模型权重或训练流程。
  • 项目提供了 代码及演示,便于快速原型验证。

具体落地用例

用例 1: 短视频创作平台的 AI 辅助工具

  • 场景:平台为创作者提供“文字生成视频”功能,生成一段 30 秒的 1080P 视频通常需数分钟,且需多卡并行。
  • Forcing-KV 集成:通过压缩 KV 缓存,将推理速度提升至接近实时,用户可在几秒内获得高保真视频预览,提升创作效率,降低平台算力成本,使更多用户可同时使用该功能。

用例 2: 自动驾驶仿真数据生成

  • 场景:用自回归扩散模型合成连续多视角驾驶视频,用于训练感知模型,但生成大量长序列视频时算力成本高。
  • Forcing-KV 集成:在数据生成流水线中应用 KV 缓存压缩,使单卡可生成更长的驾驶场景,且保持帧间一致性,大幅降低百万帧级别数据集的合成成本。

局限

  • **离线头部剖析依赖**:Forcing-KV 需要预先执行离线头部剖析(offline head profiling)以区分静态头与动态头。该过程涉及对多个样本和多步去噪的分析,虽在论文中被认为是稳定的,但引入额外的计算开销,且当模型经过微调或应用于全新的视频分布时,原有的头部分类可能不再适用,需重新剖析,限制了即插即用性。对实际工程而言,离线剖析的自动化和对分布漂移的鲁棒性尚未被充分探讨。
  • **压缩策略的信息丢失风险**:结构化静态剪枝对静态头进行粗粒度的 KV 丢弃,虽能显著减少内存,但可能误删对某些帧间过渡仍有贡献的细节,在生成长视频时可能逐渐累积误差。动态相似度剪枝依赖片段间相似度阈值,对于运动剧烈或场景切换频繁的视频,保持必要信息的能力可能下降,导致运动一致性受损。目前缺乏对临界场景的定量失败案例分析。
  • **对比基线有限与泛化性不足**:论文主要与全 KV 缓存及少数通用压缩方法(如 token merging)对比,未充分涵盖近期针对 LLM 的高效 KV 压缩策略(如 StreamingLLM、H2O)在视频扩散模型上的适配版本。此外,实验仅集中在 LongLive 和 Self Forcing 两个模型上,方法在其他 AR 视频扩散架构(如不同噪声调度、不同注意力配置)上的有效性有待验证,可能限制其作为通用压缩方案的推广。
论文Yicheng Ji2026-05-10原文

相关内容