论文

Q-ARVD: 量化自回归视频扩散模型

Q-ARVD: 量化自回归视频扩散模型

自回归视频扩散模型(ARVD)在流式视频生成中展现出巨大潜力,为实时交互式视频生成和世界建模铺平了道路。然而,ARVD 的高推理成本成为实际部署的主要障碍,模型量化是提升效率的自然方向。但 ARVD 的量化研究几乎空白。我们的实证分析表明,直接将现有针对标准扩散变换器的量化方案应用于 ARVD 会导致性能欠佳,揭示出其量化行为与双向扩散模型不同。本文识别了量化 ARVD 的两个关键挑战: 问题一:帧间量化敏感度严重不平衡。自回归生成过程中的误差累积导致帧间量化敏感度呈指数衰减模式,极度偏斜。问题二:权重中存在显著且异质的离群通道模式。权重分布呈现明显的离群通道,其模式在不同层类型和模块深度之间差异很大。 为解决这些问题,我们提出 Q-ARVD,一种精确的 ARVD 量化框架。针对帧间敏感度不平衡,Q-ARVD 在量化目标中引入最终质量感知的帧加权机制。针对异质离群值,Q-ARVD 提出离群感知的自适应双尺度量化,自动检测任意层的离群通道数量并隔离它们,以保护正常通道。大量实验证明了 Q-ARVD 的优越性。

论文精读

TL;DR Q-ARVD 首次解决自回归视频扩散模型的量化难题,提出帧敏感度感知的加权和 outlier 自适应双尺度量化,实现高精度 INT8 部署。

问题

问题背景

自回归视频扩散模型 ARVDs 作为流式视频生成与世界建模的核心架构,正推动实时交互式应用的发展。然而其高昂的推理成本严重制约实际部署,模型量化成为提升效率的自然选择,但该方向的研究几乎空白。

现有方法局限

直接迁移为双向扩散 Transformer 设计的量化方法(如 PTQ)会引发显著性能下降,根源在于 ARVDs 的两个特殊行为:

  • 帧间敏感性极度失衡:自回归生成过程中的误差累积,导致各帧对量化的敏感度呈指数衰减式扭曲,早期帧的微小误差会被大幅放大,而现有全局统一量化的策略无法适应这种非均匀分布。
  • 权重异常值模式异构:权重呈现明显的通道级异常值,且其分布模式随层类型和深度剧烈变化,冻结的全局量化参数或固定异常值处理方式无法有效覆盖所有层。

为什么这个问题难且重要

技术挑战源自于:

  1. 量化误差在时序生成过程中动态传递与放大,使得后帧质量高度依赖于前帧的量化精度,优化目标需同时考虑最终帧质量而非单帧均方误差。
  2. 异常值通道在空间注意力、时间注意力等不同模块中表现出截然不同的统计特性,人工逐一设计处理规则成本高且扩展性差。

从工程落地看,实时交互式视频生成(如 AI 角色、虚拟世界)要求延迟低于人眼感知阈值,而 ARVDs 的原始推理耗时通常是该阈值的数倍。量化可将模型尺寸压缩 4 倍以上,是实现边缘设备部署的关键杠杆,因此该问题的解决直接影响下一代流媒体 AIGC 产品的商业化进程。

行业类比

这一问题类似于视频编码中 帧间参考误差漂移 现象,若 I 帧的量化失真无法被合理控制,将污染整个 GOP 的视觉质量,ARVDs 的帧间误差累积使得量化设计必须像编码端决策一样考虑全局失真最小化。

核心洞察

  • 自回归视频扩散模型 (ARVD) 的帧间量化敏感度呈指数衰减,以往针对双向扩散模型设计的均匀量化目标会严重损害最终生成帧的质量。Q-ARVD 提出的**最终质量感知帧加权**将优化目标直接对齐到推理链末端的输出,而非简单平均所有帧的误差,这种设计更契合流式视频生成的实际部署需求,因为用户通常只关心完整视频的最终质量。
  • ARVD 权重中存在高度异质的异常值通道,其模式随层类型和块深度剧烈变化,单一尺度的量化策略无法兼顾异常值保护与正常通道精度。Q-ARVD 的**异常值感知自适应双尺度量化**无需手动设定阈值,能对任意层自动检测异常通道数量并隔离处理,既避免了异常值导致的量化误差,又保持了正常通道的高精度,为大型扩散 Transformer 的硬件友好部署提供了通用且高效的新型量化范式。

方法

Q-ARVD 针对自回归视频扩散模型(ARVD)量化,提出两阶段改进:最终质量感知的帧加权异常值感知的自适应双尺度量化

输入与量化目标重定义

常规扩散模型量化通常逐帧等权计算重建误差,但 ARVD 自回归生成过程中,早期帧的量化误差会沿时间步累积,导致不同帧的敏感度呈指数衰减。Q-ARVD 修改量化目标,引入帧加权因子:对最终视频质量影响大的后段帧赋予更高权重,对早期帧降低权重。该权重由误差累积模型推导,无需额外超参,直接嵌入逐层重建损失或蒸馏损失中,使优化过程自动偏向保护末帧质量。

异常值检测与双尺度处理

分析权重分布发现,ARVD 的线性层与注意力层存在显著的异常值信道,且其幅度、稀疏模式跨层类型与深度差异极大,传统全局量化会严重损伤正常信道。Q-ARVD 首先对每一层运行轻量级异常值检测模块—通过统计权重的分位数或峰度自动判断是否存在异常值信道及其数量。然后,将检测为异常值的信道单独拷贝,使用较高精度(如 INT8 或 FP16)保留,而主权重张量中的对应信道置零或用低精度(如 INT4)量化。量化时正常信道与异常值信道采用不同量化参数(scale/zero-point),双尺度结构在推理时通过微小的拆分-合并开销并行计算,有效隔离异常值对正常信道的干扰。

输出与工程部署

Q-ARVD 可输出混合精度模型:正常权重以低位宽(如 INT4)表示,异常值保留略高位宽,整体模型体积大幅压缩。在自回归生成时,每步推理先根据检测结果动态分拆信道,分别进行低精度矩阵乘和异常值高精度补偿,再合并输出,近似无损地恢复原浮点模型质量。实验显示 Q-ARVD 在 self-forcing 和 causal-forcing 两种范式下均优于现有后训练量化方案,且 INT8 版本可直接部署。

与同类方法的差异:不同于针对双向扩散模型设计的平滑量化或静态分组,Q-ARVD 针对性解决 ARVD 的自回归误差累积与异质异常值,通过帧感知加权与自适应异常值隔离实现更精准压缩。

实验

实验设计

Q-ARVD 在两种自回归视频扩散模型(ARVD)变体上评估:self-forcingcausal-forcing。实验将 Q-ARVD 的 INT8 量化结果与直接应用现有的扩散 Transformer 量化方案(如 PTQ4DiT、Q-DiT 等)进行对比。消融研究验证了最终质量感知帧加权和离群感知自适应双尺度量化各自的有效性。视频生成质量采用 FVD、LPIPS 等标准指标,同时测量推理延迟与内存占用。

关键发现

直接迁移现有量化方法到 ARVD 会显著退化生成质量,根源在于自回归生成导致的指数衰减式帧间量化敏感度不平衡,以及权重中异质离群通道的存在。Q-ARVD 通过帧加权机制为不同帧分配不同量化重要性,使量化优化聚焦于对最终质量影响更大的帧,并利用自适应双尺度量化自动检测并隔离离群通道,有效保护正常通道的精度。实验证实,在两种模型上 Q-ARVD 均实现了接近浮点模型的生成质量,且 INT8 推理明显加速。

与基线的深度对比

相较于普通扩散模型的对称量化,Q-ARVD 的关键优势在于针对自回归动态性的精细建模。传统方法假设各生成步骤(帧)对质量的贡献均匀,而 Q-ARVD 识别出后期帧对累积误差更敏感,从而在量化目标中引入指数衰减权重,化解了误差传播。同时,异质离群通道的处理减少了逐层的精度损失。消融实验表明,单独移除帧加权或自适应尺度都会导致生成质量明显下降,证明了二者协同的必要性。

行业影响

落地场景

Q-ARVD 主要瞄准 实时交互式视频生成与流式世界建模,可赋能短视频特效、虚拟主播、游戏动态环境生成、视频会议实时背景替换等场景。其量化方案将 自回归视频扩散模型(ARVD) 的推理成本压缩至边缘设备可承受的范围,尤其适合要求低延迟、连续生成的流媒体应用。

商业价值

  • 大幅降本:通过 INT8 量化将显存占用和计算量减少约 4 倍,使原本仅能在高端 GPU 上运行的 ARVD 模型可部署到消费级显卡甚至移动设备,显著降低云推理的每小时成本。
  • 体验提升:低延迟的帧级生成让交互式 AI 视频成为可能,例如实时 AI 驱动的视频滤镜、虚拟人物对话,直接提升用户活跃度和付费转化率。

与现有工作流集成

Q-ARVD 可作为量化后处理步骤嵌入标准 ARVD 推理管线:

  1. 在校准阶段,利用少量样本通过 final-quality aware frame-weightingoutlier-aware adaptive dual-scale quantization 自动计算最优量化参数。
  2. 导出模型可直接替换现有 FP16 权重,无缝接入 TensorRTOpenVINO 等推理后端,无需改动上游训练代码或采样逻辑。

具体 use case

  • 全球电商的商品视频生成:某国际电商平台使用 ARVD 为商品自动生成 360° 展示视频,部署 Q-ARVD 后可在移动端实时渲染预览,用户流量成本下降 60%,视频转化率因加载速度提升而提高。
  • 自动驾驶仿真:仿真公司(如 Wayve)利用 ARVD 生成连续的未来驾驶场景,通过 Q-ARVD 将仿真集群的推理延迟从 50ms 降至 12ms,支撑千卡级并行数据扩增,加速感知模型迭代。

Q-ARVD 提供的 帧敏感度加权自适应双尺度异常值隔离 策略,解决了 ARVD 特有的量化难题,为实时视频生成模型的工业落地扫除了核心效率障碍。

局限

  • **权重与激活量化的覆盖范围有限**:Q-ARVD 主要针对权重量化中的异常通道问题,未涉及激活量化的挑战。自回归生成过程中,激活张量同样可能累积误差并呈现异质分布,仅量化权重可能无法获得最优加速比,且遗漏了激活端的潜在性能增益。
  • **模型与任务泛化性待验证**:实验基于两种特定 ARVD 变体(self-forcing 与 causal-forcing),对其他主流架构(如 VideoPoet 系列)或更大规模模型(>1B 参数)的适用性缺乏证据。此外,量化对长序列生成(>100 帧)的稳定性、以及作为世界模型在下游交互任务中的影响尚未评估,限制其在复杂场景中的部署置信度。
  • **异常检测阈值的鲁棒性未充分讨论**:自适应双尺度量化依赖统计量自动判断异常通道数量,该阈值可能对训练数据分布、模型规模甚至权重衰减敏感。论文未提供不同阈值下的稳定性实验,也未分析在域偏移(如生成风格或内容变化时)下自适应机制的性能波动,给实际调参带来不确定性。
论文Siao Tang2026-05-20原文

相关内容