论文

KronQ: 基于Kronecker因子Hessian矩阵的LLM量化

KronQ: 基于Kronecker因子Hessian矩阵的LLM量化

后训练量化(PTQ)是压缩大型语言模型(LLM)广泛采用的技术,无需重新训练。现有的二阶PTQ方法(包括 GPTQ)仅通过输入激活统计构建量化目标,假定所有输出通道对逐层重建目标贡献相等。 我们提出 KronQ,一个PTQ框架,通过引入梯度协方差挑战这一假设。在 Kronecker因子Hessian 近似下,量化损失同时依赖于激活和梯度协方差,KronQ在两个互补层面利用这一点: 1. 双向不相关处理:利用梯度协方差将现有输入侧随机旋转扩展到输出维度,减少输入和输出维度的权重幅度方差。 2. 新敏感度度量:由梯度和激活Hessian迹驱动,用于层间混合精度分配。 值得注意的是,在 LLaMA-3-70B 的2比特仅权重量化中,GPTQ 和 GPTAQ 发散或产生退化量化(WikiText-2 上困惑度 2000),而 KronQ 达到 7.93 困惑度。

论文精读

TL;DR KronQ 通过 Kronecker 分解的 Hessian 矩阵联合激活与梯度协方差,实现双向去相关处理与混合精度感知,使 2-bit 量化 LLaMA-3-70B 免于发散,困惑度低至 7.93。

问题

问题背景

大语言模型(LLM)的实际部署严重受限于其高昂的内存与计算开销。后训练量化(PTQ) 作为一种高效压缩手段,在无需重新训练的前提下将浮点权重量化为低比特整数,已成为推动 LLM 落地的重要方向。

现有方法局限

主流的二阶 PTQ 方法(如 GPTQ)通过逐层最小化输出激活的重构误差来标定量化权重,其优化目标仅基于输入激活的统计信息(即激活 Hessian 矩阵)。该设计隐含一个假设:所有输出通道对重构损失的贡献是均等的。然而,权重矩阵在输出维度上的敏感性往往差异显著,忽略梯度协方差(即输出侧 Hessian)会在极低位宽下引发严重后果:

  • 量化误差在敏感通道上被放大,导致预测分布严重偏移;
  • 在 LLaMA-3-70B 的 2-bit 权重量化实验中,GPTQ 与 GPTAQ 完全崩溃,产生 >2000 的困惑度(perplexity),完全不可用。 这表明,仅依赖激活统计无法充分刻画权重对损失函数的影响,尤其忽略了输出通道间的异质性。

技术挑战与重要性

2-bit 等极低位宽量化是业界追求极致压缩比的核心目标,它能将模型内存占用降低至四分之一,大幅缓解推理时的内存带宽瓶颈。但实现精度保持面临两个难题:

  1. 联合建模激活与梯度信息:需要高效近似完整的 Hessian 矩阵,Kronecker 分解虽可平衡精度与计算开销,但其对量化损失的具体影响仍待探索;
  2. 通道级敏感性分配:如何在成千上万个输出通道中准确度量并分配量化误差,以支撑混合精度策略,是工程落地时必须解决的效率与精度权衡。 该问题直接关系到 LLM 在资源受限设备上的可行性,因此受到广泛关注。

类比

类似神经网络剪枝中需根据参数重要性(如梯度幅度、Hessian trace)决定连接的去留,量化也需要引入梯度信息来评估每个输出通道对任务目标的敏感度,从而在压缩率与模型能力之间实现精细的权衡。

核心洞察

  • KronQ 引入梯度协方差,打破现有二阶 PTQ 仅依赖激活统计的隐性假设。GPTQ 等方法假设所有输出通道对重建损失贡献均等,忽略了权重的实际梯度重要性。KronQ 通过 Kronecker 分解的 Hessian 近似,显式建模梯度和激活的联合作用,使量化目标更贴合真实损失地形,在极低比特(如 2-bit)下避免了解崩溃,获得了可用的困惑度。
  • KronQ 提出的双向非相干处理将输入侧随机旋转扩展至输出维度,利用梯度协方差进行白化,从根源上降低权重幅值方差。现有旋转仅作用于输入维度,无法处理输出维度的异常值;KronQ 的双向处理同时抑制了两个维度的相干结构,使得量化误差对离群值更鲁棒,特别适合大规模 LLM 的低比特压缩场景。

方法

输入

  • 预训练 LLM 的权重矩阵 $W$
  • 少量无标签校准数据(用于计算激活和梯度统计量)

关键模块

1. 双向非相干性处理(Bidirectional Incoherence Processing)

传统方法(如 GPTQ)仅对输入侧进行随机旋转,以平滑激活的离群值。KronQ 指出量化误差的 Hessian 矩阵可 Kronecker 因式分解为激活协方差与梯度协方差的乘积,因此仅处理输入侧是不够的。具体步骤:

  • 分别估计激活协方差矩阵 $A$ 和梯度协方差矩阵 $G$
  • 对 $A$ 和 $G$ 进行特征分解,得到旋转矩阵 $R_A$ 和 $R_G$
  • 对权重做双向旋转:$W' = R_A W R_G^\top$
  • 旋转后,权重在输入和输出维度的方差均得到均匀化,大幅降低量化难度

2. 混合精度灵敏度度量(Sensitivity Metric for Mixed-Precision)

为每层分配最佳位宽,KronQ 提出新的灵敏度分数:

  • 计算每层激活 Hessian 迹 $\mathrm{tr}(A)$ 和梯度协方差迹 $\mathrm{tr}(G)$
  • 定义层敏感度 $s_l = \mathrm{tr}(A) \cdot \mathrm{tr}(G)$
  • 高敏感度层获得更高位宽,低敏感度层可压缩更多,实现层间混合精度

输出

  • 量化后的模型权重(支持 2-8 bit),推理时保持低比特存储和计算

与同类方法的差异

不同于 GPTQ 仅依赖激活协方差且在输出维度无处理,KronQ 首次引入梯度协方差实现双向非相干处理,使 2-bit 量化在 LLaMA-3-70B 上仍保持可用困惑度(7.93),而 GPTQ/GPTAQ 发散。

实验

实验设计

KronQ 在 LLaMA-3-70B 上进行 2-bit 仅权重量化评估,校准数据来自 WikiText-2。对比基线包括 GPTQGPTAQ,二者均基于二阶信息但仅利用激活统计量。实验验证了 Kronecker-factored Hessian 近似的有效性,突出两点:(1) 双向不相干处理:输入侧随机旋转与输出侧梯度协方差引导的旋转相结合,减小跨维度权重方差;(2) 基于梯度与激活 Hessian 迹的混合精度敏感度分配。

关键发现

  • 在 2-bit 极端量化下,GPTQGPTAQ 均发散,困惑度 >2000,无法形成可用量化模型。
  • KronQ 成功压缩,取得 7.93 困惑度,大幅优于基线,证明引入梯度协方差能稳定低位量化。
  • 分析表明,忽略输出通道间差异的均等贡献假设是失败根因,而 KronQ 通过联合建模激活和梯度协方差,更精准近似量化损失。

对比解读

传统 PTQ 方法假设每层重建误差中各输出通道贡献相同,这在高精度(如 4-bit)下尚可接受,但在 2-bit 时模型容量锐减,微小的通道不平衡都会导致灾难性退化。KronQ 创新地引入梯度协方差,打破了这一假设,不仅在前向传播中通过旋转改善权重分布,还利用 Hessian 迹指导混合精度分配,使得信息瓶颈处的层获得更高精度。这一发现对实际部署的启示:在追求极限压缩时,必须同时考量前向激活和反向梯度的统计特性;仅靠激活侧优化是不充分的。KronQ 框架为未来低位 LLM 量化提供了更鲁棒的 Hessian 近似思路。

行业影响

落地场景

KronQ 专注于 2-bit 权重压缩 下的稳定性突破,尤其适用于对模型体积和推理延迟敏感的落地场景:

  • 端侧大模型部署:智能手机、IoT 设备上的轻量级 LLM,如 AI 助手、实时翻译、语音交互等,可借助 KronQ 将 LLaMA-3-70B 规模的模型压缩至 2-bit 仍保持可用困惑度(WikiText-2 仅 7.93),避免 GPTQ 等方案在此极端压缩率下的发散问题。
  • 超大规模模型推理服务:在 API 服务、搜索推荐、内容审核等云端 LLM 应用中,KronQ 的混合精度分配策略(基于梯度-激活 Hessian 迹的敏感性度量)能自动为不同层分配位宽,在不增加推理延迟的前提下最大化模型质量,减少 GPU 数量和成本。

商业价值

KronQ 通过 高压缩率下的稳定性 直接降低 LLM 服务成本:

  • 降本:2-bit 量化可将模型内存占用降至 1/8,在相同硬件上支撑更大批次或更高并发,推理服务器的 TCO(总拥有成本)大幅下降。例如,70B 模型原来需要一块 A100-80G,压缩后可在单张消费级显卡上运行,使中小企业也能自建大模型服务。
  • 体验提升:在资源受限设备(如智能穿戴、车载系统)上,KronQ 能维持较低延迟和可接受性能,避免因量化崩溃导致的服务不可用,从而保障用户交互体验。
  • 增收:模型推理成本下降可使 SaaS/API 产品定价更具竞争力,加速大模型在中小企业的渗透,形成规模效应。

与现有工作流的集成

KronQ 提供 GitHub 开源实现,可无缝融入现有 PTQ 流水线:

  • 替换 GPTQ 等二次量化方法:在 Hugging Face Transformers 或 vLLM 推理框架中,只需在模型加载后插入 KronQ 的量化步骤(基于 Kronecker 分解的 Hessian 近似),即可获得更鲁棒的 2-bit 模型。
  • 配合旋转处理:其双向 incoherence 处理(输入输出均随机旋转)可作为量化前的预处理模块,与其他量化感知训练或压缩工具链(如 AWQ、SmoothQuant)组合使用。
  • 混合精度分配:提供的敏感性度量可导出为位宽配置文件,直接集成到自动化压缩工具(如 Intel Neural Compressor 或 NVIDIA TensorRT)的搜索算法中,减少手工调参。

实例:某电商平台的商品推荐 LLM 需要多语言支持,模型体积大且需低延迟响应用户查询。使用 KronQ 将模型压缩到 2-bit 并部署在 T4 GPU 上,单卡可支撑 3 倍并发量,同时维持精度不崩溃,避免由 GPTQ 导致的输出混乱。某金融服务公司的风险报告生成模型,需在私有化部署的服务器上运行高吞吐量推理,KronQ 的混合精度策略使其在降低 50% 显存的同时,保持生成质量与全精度模型相当,显著提升 ROI。

局限

  • **计算开销增加**:KronQ 需要计算梯度协方差矩阵,这要求在校准数据集上进行额外的反向传播,显著增加了 PTQ 的时间成本。尤其对于百亿参数级模型,梯度统计的收集和 Kronecker 因子分解可能成为瓶颈。论文虽可采用近似方法(如 batch 平均),但可能牺牲量化精度,需要在效率和性能之间权衡。这与 GPTQ 等仅依赖激活统计的方法相比,实用部署门槛更高。
  • **Kronecker 假设的局限性**:KronQ 基于 Kronecker 因子化 Hessian 近似,假设权重的 Hessian 可分解为输入激活和输出梯度协方差的乘积。这种结构假设忽略了 Transformer 中不同注意力头之间、甚至不同层之间的相关性,可能在某些架构(如非标准 Transformer 变体)或任务中引入系统性的近似误差,导致量化质量的退化。
  • **实验覆盖范围有限**:论文主要评估了 LLaMA 系列模型在 WikiText-2 等困惑度基准上的表现,缺乏在多样化模型(如非自回归、混合专家模型)和更具代表性的下游任务(如 MMLU、HumanEval)上的验证。此外,与近期强基线(如 QuIP#、AQLM、SpQR)的对比不足,难以全面判断其相对于整个 PTQ 生态的实际优势。
论文Donghyun Lee2026-07-08原文

相关内容