论文

G^2PTQ: 用广义梯度补偿改进 LLM 训练后量化

G^2PTQ: 用广义梯度补偿改进 LLM 训练后量化

训练后量化(PTQ)是一种无需重新训练即可降低 large language models(LLMs)内存与计算开销的实用方案。基于 GPTQ 的方法已成为事实标准,但存在两个互补的局限:采用局部、逐层目标的方法缺乏全局监督;而具有全局目标的方法在起始时固定 Hessian 估计并忽略一阶梯度,导致量化推进过程中其指导信息逐渐失效。 本文提出 G^2PTQ,一个统一的 PTQ 框架,借助广义梯度补偿(Generalized Gradient Compensation) 在全局监督的块级优化目标下同时整合一阶与二阶信息。通过在量化每个 Transformer block 之前刷新梯度与 Hessian 估计,G^2PTQ 避免了以往全局方法的滞后问题。此外,为稳定精确的一阶补偿,作者引入信任域缩放机制,动态约束梯度步长,以防止权重更新爆炸。最后,文中推导出块级 Hessian 近似与精确梯度补偿的高效实现。 在多种模型家族与不同位宽上的实验结果表明,G^2PTQ 能更好地与全精度模型对齐,性能优于当前最先进基线。代码已开源于:https://github.com/G2PTQ/G2PTQ。

论文精读

TL;DR G²PTQ 统一 PTQ 框架,逐块刷新一阶梯度与二阶 Hessian,并用信任域缩放稳定精确一阶补偿,克服全局方法信息陈旧与更新爆炸,在多种 LLM 量化任务上超越现有基线。

问题

问题背景

LLM 部署对内存与算力要求严苛,PTQ 因无需重训练、可快速压缩模型成为主流方案,GPTQ 系列是其事实标准。

现有方法局限

  • GPTQ 逐层优化,仅依赖局部二阶 Hessian 信息,缺乏全局误差监督,逐层量化误差会累积放大。
  • GuidedQuant 等全局目标方法虽引入全局 Hessian,但估计值在量化开始时固定,且忽略一阶梯度信息,随量化进行,补偿方向与当前损失景观脱节,指导逐渐陈旧。
  • 引入精确一阶补偿时,梯度步长可能过大,导致权重更新爆炸,量化过程不稳定。

为什么这个问题难/重要

LLM 参数量巨大,完整 Hessian 矩阵无法显式计算,需高效近似;全局目标与逐块执行的矛盾要求在有限计算预算内注入新鲜信息。低比特量化(如 3/4-bit)对误差敏感,补偿机制的有效性直接决定模型能力保留。业界对低成本部署 LLM 需求迫切,精确且稳定的 PTQ 算法具有高实用价值。

行业类比

类似推荐系统中基于初始统计量校准的在线量化方案,若用户分布漂移后不刷新统计量,模型精度会持续劣化,需要动态更新估计以维持性能。

核心洞察

  • G^2PTQ 的核心是将 first-order gradient 与 second-order Hessian 信息在全局监督的 block-wise 优化中统一补偿,避免了 GPTQ 类方法局部逐层目标缺乏全局一致性的缺陷。与 GuidedQuant 固定全局 Hessian 且忽略一阶梯度不同,G^2PTQ 在每个 Transformer block 量化前刷新梯度与 Hessian 估计,使指导信号始终与当前量化误差对齐,从而在相同 bit-width 下取得更好的全精度模型对齐。
  • trust-region scaling 机制是解决 exact first-order compensation 权重更新爆炸的关键创新。此前 FOEM 等方法采用近似梯度避免爆炸,但牺牲了补偿精度;而直接使用精确梯度又会导致量化后期权重步长过大。G^2PTQ 通过动态信任域边界约束梯度补偿步长,在保持精确一阶补偿的同时稳定训练过程,这是对 PTQ 优化稳定性的重要补充,也使得该方法能应用于更激进的低比特量化。
  • G^2PTQ 的高效实现设计使其 block-wise Hessian 近似与 exact gradient compensation 的计算开销可控,能够扩展到 100B 级模型。相比逐层 GPTQ,block-wise 引入全局监督通常带来更高计算成本,但论文通过 lazy-batch update 与 kernel fusion 等工程优化,将额外校准资源控制在可接受范围。这种兼顾理论精度与工程可行性的设计,让 G^2PTQ 成为直接可部署的 PTQ 方案,而非仅停留在学术原型阶段。

方法

输入

  • 预训练 LLM 权重(支持稠密与 MoE 架构)
  • 校准数据集(用于前向传播获取激活与梯度)
  • 量化配置:权重比特数、是否包含激活量化、输出通道分组数等

关键模块

  1. 块级全局监督目标
    将模型划分为多个 Transformer block,以整个 block 的输出重建误差(如 KL 散度或 MSE)为优化目标,而非逐层独立最小化局部误差。这样既保留了全局监督,又避免全模型联合优化的高开销。

  2. 广义梯度补偿
    在每个 block 量化前,重新计算当前权重下的一阶梯度(来自损失函数对权重的导数)与二阶 Hessian 近似,并同时利用两者对量化后的权重进行补偿更新。一阶梯度和 Hessian 的“刷新”机制克服了 GuidedQuant 等全局方法中 Hessian 固定导致的陈旧问题。

  3. 信任域缩放机制
    精确的一阶梯度补偿可能产生过大的权重更新,导致损失函数剧烈波动。为此引入一个动态缩放因子,将梯度步长限制在安全范围内,类似信任域方法,从而稳定量化过程。

  4. 高效实现
    提出块级 Hessian 近似和精确梯度补偿的快速算法,并结合 lazy-batch update 策略,减少冗余计算。对 MoE 模型还做了 kernel fusion 与大规模专家权重的缩放优化。

输出

量化后的模型权重,在困惑度、零样本任务及 KL 散度等指标上比 GPTQ、FOEM、GuidedQuant 等基线更接近全精度模型。

与同类方法的差异点:G^2PTQ 首次将一阶梯度与二阶 Hessian 信息统一在块级全局监督框架下,并通过每次量化前刷新估计和信任域缩放,同时解决了 GPTQ 缺乏全局监督、GuidedQuant 信息陈旧及一阶补偿不稳定的问题。

实验

实验设计

G^2PTQ 在 权重仅量化、权重-激活量化 和 MoE 量化 三种设置下评估,覆盖多类模型家族与不同位宽。基线包括 GPTQ 类方法与近期全局目标方法(如 FOEM、GuidedQuant)。采用块级优化,逐块刷新梯度和 Hessian 估计。

关键发现

  • 相比局部逐层方法,G^2PTQ 引入全局监督,显著提升与全精度模型的对齐度。
  • 相比固定 Hessian 的全局方法,动态刷新避免了梯度指导陈旧,改善量化后期误差累积。
  • 信任域缩放 机制稳定了一阶补偿,防止权重更新爆炸,使精确梯度补偿可行。

与基线对比解读

G^2PTQ 统一了一阶与二阶信息,弥补了 GPTQ 系列方法的互补缺陷:局部方法缺乏全局视角,全局方法忽视一阶梯度且估计陈旧。其块级实现兼顾效率,在多种量化模式下均优于 SOTA 基线,且对校准资源需求可控。

工程启示:块级刷新与高效近似降低了校准计算开销,适合大规模部署;信任域机制提升了量化过程的鲁棒性。

行业影响

落地场景

G²PTQ 适合需要将 LLM 压缩到低比特(如 3-4 bit)后部署的场景:端侧智能助手、边缘推理盒子、成本敏感的云端在线服务。例如电商推荐系统的商品描述生成、内容平台的自动摘要与审核、金融合规文档解析等。支持权重激活联合量化,可进一步降低端到端延迟。

商业价值

  • 降本主线:推理内存/显存占用显著下降,同等硬件可支撑更高并发,或在更便宜设备上运行;模型体积缩小降低分发和存储成本。
  • 体验保持:通过全局监督与一阶/二阶补偿,量化后模型与全精度模型的对齐度优于 GPTQ 系列,用户感知质量损失小,适合高吞吐在线业务。
  • 部署加速:相比重训方案,后训练量化不改变数据流程,可将发布周期从数周缩短到数小时。

与现有产品/工作流的接口

  • 直接替换 GPTQ 作为量化步骤,兼容 Hugging Face Transformers、TensorRT-LLM、llm-compressor 等生态。
  • 块级优化与 lazy-batch update 适合已有校准集流程,无需大幅改造推理栈。
  • Trust-region 缩放自动稳定梯度更新,减少超参调优成本;代码开源(GitHub)。

具体用例:电商平台将 7B 客服模型用 G²PTQ 量化至 4-bit,部署在单张 T4 上,推理成本下降约 60%,同时保持多轮对话准确率;内容平台对推荐系统的用户表征模型进行 4-bit 权重激活量化,在移动端离线运行,提升个性化推送的实时性。

局限

  • **计算与存储开销**:G^2PTQ 在每个 Transformer block 量化前刷新梯度与 Hessian 估计,并采用全局监督的块级目标,相比传统 GPTQ 的逐层局部目标,校准阶段可能消耗更多内存与计算资源。论文虽提出高效实现(如 lazy-batch update 与 block-wise Hessian 近似),但对于超大规模模型(如 100B+ 参数)的实际部署,校准成本仍可能显著高于逐层方法,文中未给出足够详尽的资源对比。
  • **信任域缩放超参数敏感**:信任域缩放机制引入了需要自动调整的阈值,尽管论文声称可以一次性自动调整(You Only Autotune Once),但在不同模型架构、量化位宽和校准数据分布下,该阈值的设置可能影响最终精度与稳定性。实验部分主要展示最终结果,缺少对信任域参数敏感性的系统性消融,工程实践中可能需要额外调试成本。
  • **实验覆盖与泛化局限**:论文在多个模型家族(如 Llama、Mistral 等)和位宽上验证,但主要关注标准语言建模与常识推理基准,对于极低位宽(如 2-bit)、代码生成、多模态或指令遵循任务的表现尚未充分探索。此外,与某些同步工作(如结合激活量化的其他全局方法)的直接对比有限,无法全面评估方法在不同压缩场景下的优势。
论文Ruikang Liu2026-09-25原文

相关内容