论文

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

随着长上下文推理和多模态智能的快速发展,Key-Value (KV) 缓存的内存占用已成为高效部署的主要瓶颈。现有的 per-channel 量化 在处理 Key 张量中的通道异常值时有效,但在极端压缩下效果减弱。本文从经验与理论角度重新审视 per-channel 量化的局限性,识别出 Token Norm Imbalance (TNI) 是量化保真度的主要瓶颈。TNI 在共享量化参数跨越具有显著范数差异的 token 组时会系统性放大误差。 针对上述问题,本文提出 OScaR(Omni-Scaled Canalized Rotation),一个准确轻量的 KV 缓存压缩框架,适用于 X-LLMs(文本、多模态、全模态大模型)。OScaR 通过 Canalized Rotation 将 Key 张量旋转至更均匀的分布,再结合 Omni-Token Scaling 对 token 维度进行独立缩放,有效缓解 TNI 引起的序列维度方差。此外,框架还包含优化的系统设计和高效 CUDA 内核 实现。 实验结果表明,OScaR 在 INT2 量化下达到接近无损的性能,显著优于现有方法,并定义了新的 Pareto 前沿。与 BF16 FlashDecoding-v2 基线相比,OScaR 解码速度提升 3.0 倍,内存占用减少 5.3 倍,吞吐量提升 4.1 倍。代码已开源:https://github.com/ZunhaiSu/OScaR-KV-Quant。

论文精读

TL;DR OScaR 以 Canalized Rotation 与 Omni-Token Scaling 消除 Token 范数不平衡,在 INT2 下实现近乎无损的 KV 缓存量化,将解码速度提升至 3 倍,内存占用降至 1/5。

问题

问题背景

随着大语言模型(LLM)朝长上下文推理、多模态与全模态(X-LLM)方向演进,推理阶段键值缓存(KV cache) 的内存占用已成为部署效能的首要瓶颈。在极端压缩场景下(如 INT2 量化),如何保持 KV 缓存的高保真度,是当前高效推理研究的关键议题。

现有方法局限

主流逐通道量化(per-channel quantization) 虽能较好处理 Key 张量中的通道离群值,但在极端位宽下性能急剧退化。其核心局限在于:

  • token norm imbalance(TNI) 被系统性忽略。当多个 token 共享量化参数时,范数差异巨大的 token 被强制归入同一缩放因子,导致量化误差被指数级放大。
  • 现有应对方案(如 TurboQuantQuaRot)或引入复杂旋转与混合精度管线,或依赖离线校准与 token-wise 重排,工程实现负重高、通用性受限,且难以无缝覆盖纯文本、多模态与全模态模型。

为什么这个问题难/重要

TNI 引发的量化误差源自序列维度的统计异质性,它不能被简单的通道级平滑或轮换消除。其挑战在于:

  1. 误差传播:Key 缓存误差会逐层累积,严重破坏注意力计算的准确性;
  2. 架构普适性:不同模态的 X-LLM 表现出异构的离群模式,需要一种不依赖模态先验、计算代价小的通用方案;
  3. 工业部署要求:实时性与吞吐量要求方法必须与 FlashDecoding 等加速算子无缝衔接,并在 GPU 上实现高效融合内核。 业界对“近无损 INT2 缓存压缩 + 端到端加速”的需求迫切,因为这直接决定了长上下文服务能否从高成本 HBM 扩展至普通 GPU。

行业类比

这一问题类似于在实时视频流处理中,若不区分关键帧与普通帧的压缩强度,整体码率控制将失效;同样,KV 缓存压缩若不能自适应 token 范数的差异,任何极端量化都将被少数高范数 token 绑定,导致全局精度崩溃。

核心洞察

  • - **Token Norm Imbalance (TNI)** 是 per-channel 量化在极端压缩下失效的根本原因,而非传统关注的 channel-wise outlier 问题。OScaR 从理论和实验证明,共享量化参数在处理 norm 差异巨大的 token 组时,会系统性放大重构误差,导致 INT2 下性能崩溃。这一发现跳出了“逐通道适配异常值”的范式,直接定位序列维度上的方差瓶颈,为低成本通用量化提供了新靶点。
  • - **Canalized Rotation + Omni-Token Scaling** 构成极简且通用的 INT2 KV cache 量化框架,无需复杂 pipeline 即可实现近乎无损的性能。Canalized Rotation 先对 Key 做正交变换以对齐 token 分布,Omni-Token Scaling 再动态均衡 token norm,且不引入逐 token 的额外存储。该设计在纯文本、多模态和全模态 LLM 上均达到与 BF16 基线相当的效果,解码速度提升 3.0 倍、内存占用降低 5.3 倍、吞吐量增加 4.1 倍,以最低复杂度确立了新的准确率‑效率帕累托前沿。

方法

输入:KV 缓存高精度张量

在自回归推理中,Key 与 Value 张量以 BF16 等高精度格式存储,造成巨大内存开销。OScaR 的目标是将它们量化到 INT2 等极低位宽,同时维持模型输出质量。

关键模块:Canalized Rotation + Omni-Token Scaling

  1. Canalized Rotation(通道化旋转):对 Key 张量的每个通道应用随机正交变换(基于 Hadamard 矩阵),打散通道内的异常值,降低通道方差。这一步骤为后续 token 维度均衡奠定基础。
  2. Omni-Token Scaling(全令牌缩放):计算每个 token 向量的范数,训练一组逐 token 缩放因子;在量化前将 Key 与 Value 乘以因子,反量化时再除以因子。这直接针对Token Norm Imbalance (TNI)——即 token 间范数差异导致共享量化参数时误差放大的问题,使序列维度的数值分布趋于平坦。
  3. 块式 Per-Channel 量化:预处理后的张量被划分为细粒度块,块内按通道独立计算零点与缩放因子,执行非对称量化。由于旋转和缩放已消除大部分离群值,即便使用 INT2 也能保持高保真度。
  4. 系统与 CUDA 内核优化:将 Hadamard 旋转与范数计算融合为单一 GPU 内核,减少访存;定制缓存布局与量化格式,使 prefill 阶段一次性完成变换,decode 阶段逐步追加新 token,无需重计算。

输出:极低位宽量化缓存与加速效果

OScaR 输出 INT2 格式的 KV 缓存,内存占用仅 BF16 的约 1/5,配合 FlashDecoding-v2 实现最高 3 倍解码加速、4.1 倍吞吐提升,且在长文本与多模态测试中达到近无损性能。

与同类方法的差异:相较于 TurboQuant 等复杂量化管线,OScaR 仅用旋转与 token 级缩放在不增加显著复杂度下,首次让 INT2 KV 缓存在广泛 LLM 上达到实用精度,形成新的帕累托前沿。

实验

实验设计

论文在 X-LLMs(纯文本、多模态、全能模态大模型)上评估 OScaR,覆盖长上下文推理与多模态理解任务。文本模型使用 LongBench-ENeedle-in-a-Haystack,多模态模型使用 OCRBenchDocVQA,全能模态模型使用 MMAU-Pro。对比基线包括 BF16 FlashDecoding-v2 以及多种 KV 缓存量化方法(QuaRotKIVITurboQuant 等),量化至 INT2 极端位宽,同时测量解码速度、内存占用和吞吐量。

关键发现

  • OScaR 通过 Canalized RotationOmni-Token Scaling 有效抑制了 Token Norm Imbalance,在 INT2 量化下实现近乎无损的质量,所有任务上均显著低于 BF16 基线的性能退化。
  • 效率方面,相较 BF16 基线,解码速度提升最高达 3.0 倍,内存占用降低 5.3 倍,吞吐量提高 4.1 倍,且这些增益在保持任务精度的前提下获得。
  • 在全模态模型(如 MMAU-Pro)上,OScaR 同样稳定,表明方法具有跨模态通用性,无需针对不同模态调整管线。

与基线对比解读

与其他量化方案相比,OScaR 在极端压缩下优势明显:它摒弃了 TurboQuant 等方法的复杂纠错流程,以更简单的设计取得更高精度和更快速度。与 BF16 FlashDecoding-v2 相比,OScaR 在几乎不损失生成质量的情况下,将解码计算和内存压力大幅转移,为实际部署长上下文模型提供了新的 帕累托前沿。这验证了“针对 Token 范数不平衡进行直接校正”的设计哲学比堆叠后处理更有效,对工程落地有直接指导意义。

行业影响

落地场景

OScaR 面向 长上下文推理多模态 LLM 部署,可应用于需要处理超长序列的产品:

  • 对话式 AI:客服系统、虚拟助理需缓存大量历史消息,OScaR 能大幅压缩 KV Cache 至 INT2 且近无损,降低延时与内存。
  • 多模态助手:在电商中,商品详情页的图片、视频分析需处理长视觉 token 流;在内容平台,长视频摘要或跨文档审查同样依赖高效长上下文支持。
  • 代码助手:面对超长代码库或整个项目仓库,OScaR 使模型能以更低成本维持长期记忆。

商业价值

  • 降低推理成本:KV Cache 压缩至 5.3 倍,单卡可承载更大批处理或更少卡数部署,直接削减云 GPU 租赁或硬件支出。
  • 提升用户体验:解码速度提升 3.0 倍,吞吐量增加 4.1 倍,在实时对话、流式响应场景中明显减少等待时间,改善交互流畅度。
  • 扩展产品边界:支持更长上下文而不引起 OOM,可推出“无限制上下文”等差异化 feature,增强竞争力。

与现有工作流的集成

OScaR 作为轻量级 KV Cache 压缩插件,可与主流推理引擎对接:

  • vLLM / TensorRT-LLM:提供的 CUDA 内核 可直接替换原有块级量化模块,仅需在模型加载时插入 Canalized RotationOmni-Token Scaling 预处理。
  • 兼容性:该方法不改变模型结构,适用于纯文本、多模态、全模态 LLM,对现有模型权重零侵入。
  • 低复杂度:无需复杂校准数据,相比 TurboQuant 等方法复杂度更低,易于在 CI/CD 中自动化集成。

具体用例

  1. 电商多模态导购:手机端部署轻量 LLM 分析用户上传的多张图片与对话历史,OScaR 使缓存保持在数百 MB,保证低延迟响应,提升转化率。
  2. 在线教育长文档批改:学生递交上万字论文,使用 OScaR 压缩模型可一次性加载全文进行评阅与反馈,无需分段处理,降低整体推理耗时与成本。

局限

  • **Canalized Rotation 的泛化开销**:该方法通过离线分析 Key 张量来构造旋转矩阵,以缓解 TNI。但这种依赖数据统计的离线校准可能导致对分布变化(如不同下游任务、微调模型)的鲁棒性不足。此外,作者融合了 Hadamard 旋转与 Norm 计算的 CUDA 核,虽提高了效率,却增加了在不同硬件后端(非 NVIDIA GPU 或旧架构)上的移植成本,限制了方法的普适性。
  • **实验覆盖的宽度**:评估集中在长文本理解任务(LongBench-E 等)和少量多模态基准(OCRBench, DocVQA),缺少在开放式生成(如对话、故事创作、代码生成)下的质量评估。对于多模态模型,仅覆盖了视觉问答和 OCR,未涉及图像生成、视频理解等更广泛的 X-LLM 场景,可能无法全面反映 OScaR 对输出多样性和语义连贯性的影响。
  • **与前沿工作的对比完整性**:尽管比较了 KIVI、QuaRot、TurboQuant 等,但文献中还存在其他近期工作(如结合稀疏化的混合压缩方案、动态非均匀量化),这些并未纳入对比。此外,声称 INT2 量化下“近乎无损”,但未详细报告极端压缩时特定长尾样本的退化程度,也未在更大规模模型(如 70B+)上验证该结论,其普适性尚需更多证据。
论文Zunhai Su2026-05-19原文

相关内容