论文

HyQuant:面向 LLM 注意力的混合精度量化

HyQuant:面向 LLM 注意力的混合精度量化

LLM 的训练与推理中,量化已被广泛采用以降低成本、提升效率。然而,对 attention 模块做低比特量化时,在极低比特宽度下常引入较大误差,导致性能下降。现有方法主要依赖平滑技术处理离群值,本文则提出混合量化设计,以更好地平衡精度与效率。 我们提出 HyQuant,一个面向 LLM attention 的高效混合量化框架。HyQuant 将大部分 attention 状态量化为低比特格式,同时保留少量 垂直行 token 与局部窗口状态为高精度。这些精度关键区域通过轻量的垂直行感知 attention 模式信号来选取,在有限开销下降低量化误差。 - Prefill 阶段:采用混合精度量化 attention 算子,将垂直行 token 与局部滑动窗口保持全精度,其余上下文进行量化。 - Decode 阶段:将同一原则应用于 KV-cache 压缩,并把 KV 反量化与 attention 计算融合,以提升内存与硬件效率。 在多种任务、模型与数据集上,HyQuant 以极简设计保持近乎无损的精度,证明了混合量化用于 LLM attention 的高效性与实用可行性。代码见 https://github.com/jerrysfls/HyQuant 。

论文精读

TL;DR HyQuant 以混合精度量化 LLM 注意力:仅保留垂直列 token 与局部窗口为高精度,其余低比特,用极简设计实现近乎无损的低比特 attention,兼顾效率与精度。

问题

问题背景

随着 LLM 参数规模与上下文长度增长,推理阶段的注意力模块和 KV cache 成为显存与带宽的主要瓶颈,低比特量化是降低成本的直接手段。

现有方法局限

现有低比特注意力量化主要依赖 smoothing 平滑技术 来处理 outlier,例如将极端值从权重转移到激活或使用 per-channel/per-token 缩放。但这类方法有两个技术局限:

  • 平滑后的数值分布虽更均匀,在 4-bit 以下(如 2-bit)时残余量化误差仍会被 softmax 指数放大,尤其集中在少数高注意力分数的 token 上;
  • 平滑策略通常对所有 token 和所有 head 施加统一变换,忽略了注意力模式中 vertical-line tokens(少数 token 在多个 head 上持续获得高注意力)以及 局部滑动窗口 内 token 的高敏感性,导致这些关键区域的量化误差积累,下游任务性能退化明显。

为什么这个问题难且重要

注意力模块在长上下文推理中计算量占比随序列长度平方增长,KV cache 体积随序列长度线性膨胀,已成为 LLM 服务成本的核心瓶颈。极低位宽量化(如 2-bit、3-bit)能显著降低内存占用和带宽压力,但注意力分数的分布具有 长尾和稀疏特性,少数 high-score token 贡献了绝大部分注意力质量,量化误差在这些位置会被 softmax 放大数十倍。如何以极低额外开销识别并保护这些 accuracy-critical 区域,同时保持整体量化收益,是实际部署中的关键挑战。业界对低比特注意力量化有持续需求,但现有方法在极低位宽下仍难以达到近乎无损精度。

行业类比

类似在 Embedding 表 中做混合精度存储:高频热门 item 保留 FP16,长尾 item 用低比特压缩,以最小内存代价换取接近全精度的模型效果。

核心洞察

  • HyQuant 的核心洞察是利用注意力模式中的 vertical-line 结构来确定需要高精度保留的 token 集合,而非仅依赖数值统计或平滑处理。与常见的 smoothing 方法针对激活 outliers 做尺度变换不同,HyQuant 从 attention score 的纵向分布识别出一小部分持续重要的 token,这些 token 的量化误差在注意力计算中被放大,因此保留它们在高精度能以极小开销显著降低整体误差。这种基于注意力模式的结构化选择比全局处理 outliers 更精准,且可通过轻量级信号实现。
  • HyQuant 在 Prefill 和 Decode 两个阶段统一应用混合精度策略,并通过融合反量化与注意力计算进行 Decode 优化,形成端到端一致的量化框架。多数已有工作要么只针对 KV cache 压缩,要么在 Prefill 和 Decode 采用不同处理逻辑,导致实现复杂或误差累积。HyQuant 在 Prefill 保留 vertical-line tokens 和局部窗口的全精度,在 Decode 对 KV-cache 做同样选择性量化,并融合 dequantization 与 attention 算子以减少访存和延迟,使得两个阶段共享相同的精度分配原则,简化部署且性能接近无损。

方法

HyQuant 接受 attention 模块的 Q/K/V 状态(Prefill)或 KV-cache(Decode)作为输入。

关键模块

  • 垂直列 token 识别:通过轻量级的 vertical-line-aware attention-pattern 信号识别少数持续重要的 token。这些 token 覆盖大部分注意力质量,且量化误差在高分位置被显著放大,因此保留全精度。
  • 局部窗口保留:同时保留一个局部滑动窗口内的状态为全精度,用于捕捉近邻上下文。
  • 混合精度量化:其余上下文 token 采用低比特量化,以减少存储与计算开销。

阶段处理

  1. Prefill 阶段:设计混合精度量化注意力算子,对全精度 token 与低比特 token 分别计算注意力并融合,输出近似全精度的注意力结果。
  2. Decode 阶段:对 KV-cache 应用相同原则,量化时保留垂直列 token 与局部窗口的全精度,其余 token 低比特;并将 KV 反量化与注意力计算融合,降低内存访问并提升硬件效率。

输出为低比特注意力计算结果或压缩后的 KV-cache,精度几乎无损。

与同类方法差异:现有低比特注意力量化工作多依赖平滑技巧处理 outlier,HyQuant 通过保留垂直列 token 和局部窗口的全精度直接降低量化误差,设计简单且额外开销低。

实验

实验设计

HyQuant 在多种任务、模型和数据集上进行了评估,重点考察 Prefill 阶段 的量化误差和 Decode 阶段 的解码延迟。实验主要分为两部分:

  • Prefill 阶段:对比 HyQuant 的混合精度注意力算子与现有量化方法在层间 MSE 上的表现。
  • Decode 阶段:评估低比特 KV-cache 压缩与融合 dequantization-attention 的实现,测量解码延迟并与 FlashAttention-2 (FA2) 对比。

消融实验包括:

  1. 滑动窗口和 vertical-line awareness 的重要性
  2. vertical-line token 比例 k
  3. 局部全精度窗口大小

关键发现

HyQuant 通过仅保留极少数的 vertical-line tokens 和局部滑动窗口为全精度,其余注意力状态量化到低比特,在极低比特宽度下保持了几乎无损的精度。量化误差显著降低,因为误差主要集中在高注意力分数的 token 上,而 HyQuant 精准地保护了这些关键区域。在 Decode 阶段,KV-cache 压缩和融合算子减少了内存占用并提高了硬件效率,解码延迟接近甚至达到 FA2 水平,而精度损失极小。

与基线对比解读

与依赖 smoothing 处理异常值的先前方法相比,HyQuant 采用混合精度策略,直接针对误差放大源头——高注意力分数的 token。这种设计更简洁,开销更低,且不需要复杂的平滑因子调整,在保持精度的同时提供了更优的效率和可部署性。

行业影响

落地场景

HyQuant 适合需要长上下文低延迟推理的 LLM 服务,如实时对话、代码生成、长文档摘要。典型 use case:

  • 电商智能客服:需快速查询用户历史订单/浏览记录(长序列),HyQuant 压缩 KV-cache 降低内存和计算,提升并发响应。
  • 金融研报分析:处理上百页 PDF 长文档,attention 量化可显著降低推理成本,同时保持关键 token 精度避免语义损失。

商业价值

降本为主:低比特 KV-cache 使单卡可服务更长上下文或更高并发,减少 GPU 内存占用,降低单次推理成本。同时维持近乎无损精度,确保下游任务质量不下降,间接提升用户体验和客户满意度。对于按 token 计费的 API 服务,推理成本下降可直接转化为毛利提升。

与现有工作流接口

HyQuant 可作为 attention 算子的 drop-in 替换,集成进主流推理框架(vLLM / TensorRT-LLM / Hugging Face Transformers)。其 Prefill 混合精度算子和 Decode 融合去量化可写成 CUDA kernel 或 Triton 实现,对外暴露 KV-cache 压缩接口。开发者无需改动模型训练,只需在推理引擎中替换 attention 层,即可兼容现有模型权重。

局限

  • **对注意力模式变化的敏感性**:HyQuant 依赖垂直行 token 的识别,该识别基于注意力分数分布的先验。如果输入分布偏移或任务类型变化导致注意力模式改变,预设的识别策略可能失效,需要动态重新校准。论文未充分评估跨域泛化能力,仅在同分布基准上测试。另外,垂直行 token 比例 `k` 和局部窗口大小是超参数,对不同模型和任务需分别调优,增加了实际部署时的调参成本。
  • **定制 kernel 的硬件适配与开销**:虽然保留少量高精度 token 和局部窗口的存储开销有限,但混合精度计算路径可能不兼容现有高效 attention 库(如 FlashAttention)。特别是在 Decode 阶段,融合 KV 去量化与注意力计算需定制 kernel,在通用 GPU 或加速器上支持有限,可能无法充分利用现有硬件优化。实际部署中,内存对齐、缓存管理以及混合精度数据路径的切换开销可能抵消部分理论收益。
  • **实验覆盖与对比有限**:论文在多个任务和模型上验证,但主要限于 Transformer 架构的语言模型,未涉及其他注意力变体(如稀疏注意力、线性注意力)。与最新量化方法(如 SmoothQuant、GPTQ 等)的对比不够全面,尤其在极低比特(2-bit/3-bit)下的鲁棒性缺乏深入分析。此外,缺少在更大规模模型(如 70B+)上的结果,可能影响其在工业级应用中的可信度。
论文Jiatong Ding2026-08-28原文

相关内容