论文

VC-Attention: 面向低位注意力的 Value Smoothing 与 Softmax Casting

VC-Attention: 面向低位注意力的 Value Smoothing 与 Softmax Casting

Diffusion Transformers 在视频生成上达到 SOTA,但长时空序列使 attention 成为部署的主要开销,可部署的低比特 kernel 必须同时兼顾精度与速度。 精度受 outlier 制约:block 的量化 scale 由最大元素决定,典型元素被压缩到很窄的可表示范围内。已有工作平滑 query 与 key,但 value outlier 没有固定的 channel 或时空结构,仍是输出误差的主要来源。速度则受 softmax 制约:低比特 Tensor Cores 只加速两次矩阵乘法,中间的高精度指数运算反而成为 datacenter GPU 上最长的 pipeline 阶段。 我们提出 VC-Attention,一个免训练的低比特 attention 框架,用 Value smoothing 与融合的概率 Cast 同时解决这两个问题: - V-Smooth 通过轻量在线聚类重排 value token,使同一硬件 block 内的 token 更容易一起量化;它只量化减去 block 均值后的残差,并从 online softmax 已维护的 row sum 还原该均值。 - ExpCast-FP8 用一次 fused multiply-add 把 log-domain 分数直接映射为 E4M3 概率码,省去 FP32 指数运算与格式转换。 我们在 B200、B300、H200、RTX PRO 6000 与 RTX 5090 上实现了 VC-Attention。在 Wan2.2、LongCat-Video、HunyuanVideo-1.5 与 MiniMax-H3 上,VC-Attention 相比低比特 baseline 提升保真度;attention kernel 相比 BF16 FlashAttention-4 在 datacenter Blackwell 与 Hopper 上加速 1.46-1.59x,在工作站显卡上加速 2.3-3.6x;端到端生成分别快 1.13-1.19x 与 1.36-1.70x。

论文精读

TL;DR VC-Attention 针对视频生成低比特注意力的精度与速度瓶颈,用 V-Smooth 在线聚类平滑 value 离群值、ExpCast-FP8 直接编码 softmax 概率,训练免费且实现最高 3.6 倍注意力加速。

问题

问题背景

视频生成 Diffusion Transformers 依赖长时空序列注意力,推理时注意力是主要部署成本,低比特量化是必要加速手段。

现有方法局限

  • 精度方面:块量化尺度由块内最大值决定,导致典型值可表示范围窄。已有工作平滑 Q/K,但 value 异常值无固定通道或时空结构,仍主导输出误差。
  • 速度方面:低比特 Tensor Core 只加速矩阵乘,softmax 的 FP32 指数运算成为 GPU 流水线最长阶段,导致高精度 exp 成为瓶颈。

为什么这个问题难/重要

  • 技术挑战:value 异常值分布无规律,需要在线聚类或动态 token 重排来改善量化效果,但额外开销必须极小;同时 softmax 需要直接映射到 FP8 概率码,消除格式转换和高精度指数,要求融合操作保持数值精度。
  • 业界关注:视频生成模型在数据中心和边缘设备部署日益普及,注意力核的精度与速度直接决定端到端生成效率和输出质量,低比特方案若能保持 FID/CLIP 指标不降,将大幅降低推理成本。

行业类比

类似 LLM 激活量化中的 outlier 问题,但视频 value 异常值非结构化更强,仅靠逐通道平滑无效,必须结合 token 级重排与均值补偿。

核心洞察

  • 值量化瓶颈的突破在于对 value tokens 进行在线聚类重排并只量化残差,而非沿用 Q/K 平滑思路。V-Smooth 通过轻量在线聚类将值 token 重新排列,使同一硬件块内的 token 量化特性一致,再减去块均值仅量化残差,均值由 online softmax 维护的 row sum 无损恢复。这与先前工作仅平滑 Query 和 Key 不同,因为 value outliers 不遵循固定通道或时空结构,平滑无法应对;V-Smooth 的训练无关设计直接针对值分布的非结构性,在不增加训练成本下提升低比特注意力精度。
  • softmax 加速的关键在于将指数运算与格式转换融合为单次 FMA,而非只加速两侧矩阵乘。ExpCast-FP8 把 log-domain scores 直接映射到 E4M3 概率码,消除了 FP32 exp 和后续 cast,使低比特 Tensor Core 流水线中的 softmax 阶段不再成为最长瓶颈。相比常见 low-bit attention 只优化 QK^T 和 PV 两个矩阵乘而让高精度 softmax 串行等待,ExpCast-FP8 从指令级融合角度压缩了中间表示,是端到端 kernel 加速 1.46-1.59x(数据中心)和 2.3-3.6x(工作站)的核心来源。

方法

输入与整体流程

输入为 Transformer 注意力中的 Q、K、V 张量,在低比特部署中分别量化到 INT4/FP8 等低位宽。VC-Attention 包含两条并行优化路径:

  1. V-Smooth 值平滑:针对 V 的异常值问题。先通过轻量在线聚类对 value tokens 重排序,使同一硬件 block 内的 token 分布相似、量化步长更合理。然后对每个 block 减去 block mean 得到残差,仅量化残差;block mean 从在线 softmax 已经维护的行和 row_sum 中恢复,不引入额外高精度累加开销。
  2. ExpCast-FP8 直接概率编码:针对 softmax 的指数运算瓶颈。将 log-domain scores 直接映射为 FP8 E4M3 概率编码,用一次乘加 fma 完成,省去 FP32 exp 与后续格式转换,将 softmax 融合进矩阵乘法流水线。

输出与差异

输出为低比特注意力结果,误差相比基线显著降低,同时在 B200/H200 等 GPU 上端到端生成速度提升 1.13–1.70 倍。与仅平滑 Q/K 的 SmoothQuant 类方法不同,VC-Attention 首次针对 V 的结构化异常值做在线聚类与残差量化,同时将 softmax 概率直接编码为 FP8,消除高精度指数瓶颈,整个流程训练免费。

实验

实验设计

  • 在 Wan2.2、LongCat-Video、HunyuanVideo-1.5、MiniMax-H3 四个视频 DiT 模型上验证,覆盖 datacenter 与 workstation GPU。
  • 方法为 training-free,无需微调;将 V-Smooth 与 ExpCast-FP8 融合进 attention kernel,并与低比特基线及 BF16 FlashAttention-4 对比速度与生成保真度。
  • 部署硬件包括 B200、B300、H200、RTX PRO 6000、RTX 5090。

关键发现

  • V-Smooth 通过在线聚类重排 value token,使硬件块内 token 量化更均匀;仅量化去均值后的残差,并从 online softmax 已维护的 row sum 恢复均值。
  • ExpCast-FP8 用一次融合乘加将 log 域分数直接映射为 E4M3 概率码,消除 FP32 指数与格式转换。
  • attention kernel 相比 BF16 FlashAttention-4:datacenter Blackwell/Hopper 提速 1.46–1.59×,workstation 卡提速 2.3–3.6×;端到端生成速度提升 1.13–1.19× 和 1.36–1.70×。

与基线对比解读

  • 以往工作通常只平滑 Q/K,value 异常值无固定 channel/时空结构,仍是主要误差来源;V-Smooth 直接针对 value 进行 token 级聚类平滑,不依赖离线统计。
  • 低比特 Tensor Core 只加速两个矩阵乘,中间高精度 softmax 成为最长 pipeline stage;ExpCast-FP8 把 softmax 也纳入低比特路径,因此端到端提升明显。
  • 方法无需训练,可即插即用于不同模型与硬件,对实际部署有直接参考价值。

行业影响

落地场景

VC-Attention 面向 Diffusion Transformer 视频生成模型,用于降低长时空序列注意力计算开销,尤其适合:

  • 云端视频生成 API:短剧、广告素材批量生产,在数据中心 GPU (B200/H200) 上提升并发吞吐;
  • 工作站/消费级 GPU 上的本地创作工具 (RTX 5090 / RTX PRO 6000),支持实时预览与快速迭代。

具体场景:电商内容团队生成商品营销视频,将分钟级等待缩短至秒级,支持多版本 A/B 测试;短视频平台创作者工具集成后,在本地消费级 GPU 上实现近乎实时的 AI 视频合成与渲染。

商业价值

主要走降本增效路线:低比特注意力减少显存占用和计算能耗,注意力内核在 Blackwell/Hopper 上比 BF16 FlashAttention-4 快 1.46–1.59x,端到端生成提速 1.13–1.19x;在工作站 GPU 上内核加速 2.3–3.6x,端到端 1.36–1.70x。这直接降低单次推理成本,允许同硬件服务更多请求,同时改善用户体验(更低延迟支持交互式生成)。对按量计费的视频生成 API,可提升毛利率。

与现有工作流接口

VC-Attention 为训练无关方法,可无缝替换现有注意力算子,无需重新训练模型。可集成到推理优化栈(如 TensorRT、vLLM、FlashAttention 生态)中:

  • 作为低比特注意力插件,支持 FP8 Tensor Core 的硬件即可启用;
  • 提供融合预处理与分组调度,额外开销低,适合生产环境直接部署。

配合已有 FP8 量化推理流程,可进一步降低视频生成服务整体延迟与成本。

局限

  • **训练无关但依赖数据分布**:V-Smooth 的在线聚类和分组 schedule 基于固定超参数(如簇数、分组间隔),虽然论文声称轻量,但在不同序列长度、批次大小或不同视频内容分布下可能需要重新调整才能保持量化质量。论文仅在四个视频生成模型上验证,未展示对更广泛架构(如纯文本 Transformer 或图像生成模型)的迁移效果,实际部署时可能需要针对具体模型做 profiling 和超参数搜索。
  • **ExpCast-FP8 的精度边界未充分量化**:将 log-domain 分数直接映射到 E4M3 概率代码,消除了 FP32 softmax,但 E4M3 的动态范围和精度有限,对于注意力权重分布极端(如某些 token 概率接近 0 或 1)的层,可能引入额外的数值误差。论文汇报了整体保真度指标(如 FVD 等)无明显下降,但未逐层分析误差分布或给出理论误差上界,无法排除在特定层出现离群退化。
  • **硬件与实现耦合紧密**:实现针对 B200/B300/H200/RTX PRO 6000/RTX 5090 等特定 GPU 的 Tensor Core 特性和内存层次做了深度优化,扩展到其他架构(如 AMD、移动端或未来 GPU)需要重新实现 fused kernel 和分组策略。论文未开源代码(截至 arxiv 版本),复现门槛较高,限制了研究社区进一步验证和改进。
论文Xingyang Li2026-09-14原文

相关内容