论文

OCTOPUS: 通过八面体参数化在最优平方误差量化下的 Transformer 优化 KV 缓存

OCTOPUS: 通过八面体参数化在最优平方误差量化下的 Transformer 优化 KV 缓存

长上下文自回归推理中,KV 缓存 主导内存带宽与占用。近期的旋转预条件编码器(如 TurboQuant、PolarQuant)表明,结构化随机旋转配合匹配解析可处理边缘的逐坐标标量量化器是 KV 压缩的接近最优方案。 OCTOPUS 通过联合量化旋转后的坐标三元组推进了这一范式。每个三元组的方向通过八面体参数化映射到正方形,两个结果坐标及三元组范数使用与实现匹配边缘的 Lloyd-Max 量化。优化每三元组的平方误差,得到严格非均匀的比特分配,仅依赖键的总维度。通过扫描,我们发现有限维度质量最优值在所有测试的真实解码器上保持恒定。该编解码器是数据无关、在线且确定的(给定种子)。 在文本、视频、音频任务上,OCTOPUS 在每一个报告的比特宽度与指标上匹配或超越所有先前旋转编解码器,且随着压缩率增大(比特数下降)优势扩大。此外,融合 Triton 实现可即时重建键,无需物化解压后的键,因此编解码器在现有反量化基础上不增加解码带宽或延迟。项目页面:https://octopus-quant.github.io/

论文精读

TL;DR OCTOPUS 通过对旋转后的键缓存进行三元组联合量化,使用八面体参数化映射方向并联合优化比特分配,在极端低比特下实现最优平方误差压缩,性能超越现有旋转编解码器。

问题

问题背景

在长上下文自回归推理(如处理长篇文本、视频、音频序列)中,KV Cache 的内存带宽与占用已成为核心瓶颈。为提升吞吐、降低延迟,研究者致力于在保持模型质量的前提下对 KV 激活进行极致压缩。

现有方法的局限

旋转预条件编解码器(如 TurboQuant, PolarQuant)通过结构化随机旋转将联合分布分解为近似独立的边缘分布,再对每个坐标实施标量量化。该路线实现简单,但仍存在明显不足:

  • 逐坐标独立量化忽略了旋转后坐标间的剩余相关性,尤其当向量长度较短或比特极低时,压缩效率远非最优。
  • 均匀比特分配未能区分不同坐标对重建误差的贡献差异,导致容易出现“高方差维度欠量化、低方差维度过量分配”的浪费。
  • 方向信息编码低效:旋转将能量分散到多个坐标,但每个标量量化器并未显式利用方向结构,造成比特开销偏高。

技术挑战与重要性

量化时直接利用旋转后的坐标依赖性极为困难:

  • 必须保持在线、数据无关、确定性的要求,不能引入数据依赖的码本或在线聚类。
  • 旋转虽然使坐标边缘分布趋近高斯,但联合方向仍含冗余——如何在高维空间中对方向进行低失真编码是数学与工程双重挑战。
  • 极端低比特下(≤2 bits/元素)既要最小化平方误差,又要避免解码时的内存带宽膨胀,这对算子融合和实现效率提出苛刻要求。

该问题直接关系到大模型在实际部署中的成本与用户体验,因而备受业界关注——任何在同等质量下降低 KV Cache 带宽的技术,都能显著扩大长上下文应用的可行范围。

行业类比

可类比于视频编解码中利用色度子采样与变换域的能量集中特性:OCTOPUS 将旋转后的坐标打包为方向-范数三联体,通过八面体参数化将 3D 方向映射到 2D 平面,再对映射后的坐标与范数进行异质量化,如同在色彩空间中仅对人眼敏感通道分配更多比特,从而在极少信息损失下实现极致压缩比。

核心洞察

  • 八面体参数化将旋转后的三元组方向映射到方形坐标,使两个角度相关坐标的量化边界自然对齐,相比独立标量量化减少了冗余。这种联合量化利用了旋转后坐标的球对称性和边际分布,在极低比特下显著优于逐坐标量化方案,因为方向-范数分离量化更精准地保留了向量结构。
  • 通过扫描发现的恒定非均匀比特分配,仅取决于键的总维度,跨文本、视频、音频解码器均保持最优。这意味着部署时无需对每个模型或模态重新调参,直接沿用该常数分配即可实现接近理论最优的压缩质量,极大简化了工程落地,区别于需要逐层调参或依赖校准数据的方法。

方法

输入

自回归推理中的 KV cache,即 Transformer 各层的键张量(维度 batch × heads × seq_len × head_dim)。OCTOPUS 主要压缩键,值也可同样处理。压缩需在线、数据无关且确定性(给定随机种子)。

关键模块

1. 旋转预处理
借鉴 TurboQuant / PolarQuant,对每个键向量应用结构化随机旋转(如符号翻转的 Hadamard 变换),使坐标边际分布趋于可解析形式(近似高斯),为标量量化奠定理论基础。

2. 三元组分解与八面体参数化
将旋转后的 head_dim 维向量划分为若干三维子向量(三元组),并分离方向与范数。方向(单位球面上的点)通过 八面体参数化 映射到二维正方形坐标 (ξ, η);该映射近似保面积,量化时更高效。每个三元组被压缩为两个八面体坐标和标量范数 ρ

3. 联合 Lloyd-Max 量化
针对 ξ, η, ρ 各自的边际分布分别设计 Lloyd-Max 量化器(MSE 最优标量量化器)。码本由分布解析推导并在初始化时固定,无需在线训练。

4. MSE 最优比特分配
推导每个三元组量化引入的期望 MSE,用拉格朗日乘子法分配总比特预算,使全局重建误差最小。该分配仅依赖于总维度 d_key,经 sweep 实验证实对所有测试的解码器均保持恒定,无需在线动态调整。

5. 联合舍入与可选残差
(ξ, η, ρ) 的量化索引进行联合舍入,利用分数路径(score path)减小边界误差。极低比特时可附加 1 比特的随机投影残差(QJL)进一步提升质量。

输出

压缩后的码流包含量化索引、范数及辅助信息。解码时,融合的 Triton 内核 直接从码流重建键张量,避免物化解压缩的完整键,因此解码带宽与延迟与普通反量化相当。

与 TurboQuant / PolarQuant 的逐坐标标量量化不同,OCTOPUS 对旋转后的坐标三元组联合建模,借助八面体映射高效压缩方向分量,在极端比特率下重建质量显著领先。

实验

实验设计

OCTOPUS 在三种模态上验证 KV 缓存压缩:

  • 文本:使用 Qwen2.5-7B-Instruct-1M 的长上下文语言建模和 Needle-in-a-Haystack 检索。
  • 视频:自回归视频生成模型中的 KV 压缩,对比不同码率下的重建质量。
  • 音频:多比特率音频编解码任务,考察跨模态泛化。

所有实验均采用 在线、无数据 的设置(给定随机种子即可),通过与 TurboQuantPolarQuant 等旋转预处理器码本对比,测试不同比特宽度下的均方误差(MSE)感知质量

关键发现

  1. OCTOPUS 在所有比特率和指标上匹配或超越以往所有旋转码本,尤其当压缩率极高时,领先优势进一步扩大。
  2. 联合量化旋转后的坐标三元组,配合八面体参数化Lloyd-Max 量化,使得每三元组的非均匀比特分配仅依赖于键的总维度,在不同解码器上扫描得到的有限维质量最优解保持恒定。
  3. 采用 Triton 融合实现,可以在不物化解压缩键的情况下实时重建,不增加解码带宽,且延迟与原始反量化相当。

基线对比深度解读

对比 TurboQuantPolarQuant 仅对单个坐标标量量化,OCTOPUS 通过三元组联合量化利用了旋转后坐标间的剩余相关性,从而获得渐进增益。尤其在低于 2 比特的极度压缩场景,其他方法因标量量化粒度不足而迅速崩溃,而 OCTOPUS 的八面体方向编码和优化比特分配有效抑制了误差累积,保持了可用性。这一特性使得它在大模型长上下文推理的显存带宽瓶颈上具有显著工程价值,无需任何离线校正即可部署。

行业影响

落地场景

OCTOPUS 针对 Transformer 自回归推理的 KV 缓存压缩,为长上下文场景提供了高压缩比、低开销的解决方案。典型应用包括:

  • 长文档理解与对话:客服机器人、法律/金融文档分析、代码助手等需处理数万 token 上下文的场景,可维持低内存占用并支持更大推理批次。
  • 多模态内容生成与理解:视频平台使用长视频作为输入的模型(如视频问答、摘要),音频处理(如超长会议转录),可高效管理跨模态 KV 缓存。
  • 边缘与移动端部署:资源受限设备上运行大语言模型时,通过压缩缓存降低内存峰值,使原本无法加载的长上下文模型变为可行。

商业价值

  • 降低成本:KV 缓存可占推理总内存的 80% 以上,OCTOPUS 的极致压缩(尤其在低位宽下优势显著)直接减少 GPU 内存需求,降低云服务或私有化部署的硬件成本,相同硬件可服务更多并发请求。
  • 提升体验与能力:支持更长的有效上下文,模型能记忆更完整的对话历史或文档全文,改善回复质量,延长用户留存;同时,更小的缓存加速自回归解码,降低首 token 延迟。
  • 解锁新业务:例如,完整的财报会议记录实时问答、整部电影的内容检索,这些原本因内存墙难以落地的应用成为可能。

与现有产品/工作流的接口

OCTOPUS 是数据无感知、在线、确定性的压缩器,可即插即用地集成到主流推理框架(如 vLLM、TensorRT-LLM、Hugging Face TGI)。集成方式简单:

  • 在 KV 缓存写入前插入一个轻量级压缩算子,读取前进行解压;融合的 Triton kernel 直接重建 key,无需物化解压后的中间张量。
  • 通过预设的全局比特分配表(仅依赖 key 维度,与数据无关)和固定种子即可启用,无额外训练或校准需求。
  • 与现有量化方案(如模型权重量化)兼容,共同构成多级压缩栈。

具体用例

  1. 智能客服平台:电商或企业服务中的大模型客服需处理含大量历史消息的长对话,OCTOPUS 可让单个 GPU 同时处理数倍于前的并发会话,显著降低运营成本。
  2. 视频理解 API:云服务商提供长视频问答接口,通过 KV 缓存压缩支持小时级视频的在线分析,同时降低每次 API 调用的内存开销,提升性价比。

局限

  • **数据无关性**带来通用性,但也导致对特定分布不敏感。OCTOPUS 在码本和量化器设计上完全基于旋转后的解析边际假设,未利用任务或层的统计先验。当实际键向量分布与假定边际有显著偏差时(例如出现极端异常值或强多模态),均方误差最优性可能退化,而数据驱动的量化方法(如乘积量化或基于聚类的 VQ)能自适应地降低失真。论文未提供在此类分布漂移下的鲁棒性分析。
  • **比特分配的最优性**依赖于针对特定模型维度(即键的 heads × dim)的离线扫描,并声称‘在每个我们测试的真实解码器上恒定’。但验证仅限于少数架构(Qwen2.5-7B 及其可能变体、未指明的扩散模型),且维度变化后需重新扫描;对于 GQA、MQA 等分组注意力配置,不同头可能共享旋转或不共享,其泛化性尚未充分证实。此外,比特分配结果依赖于训练好的 Lloyd-Max 量化器,这些量化器又是基于旋转后边际设计的,其联合最优性缺乏理论保证。
  • **在线编码开销**:论文强调解码阶段通过 Triton 融合核避免显式重建未压缩键,从而消除额外带宽和延迟,但编码过程包含**结构化随机旋转**(如经过符号翻转的 WHT)、八面体参数化和三重量化,在处理极长序列(如 1M 上下文)时可能引入不可忽略的计算量。实验未报告编码延迟或 FLOPs,仅测量了压缩率和解码效率。若编码无法在内存受限设备上高效完成,将限制其实时场景应用。
论文Mark Boss2026-05-20原文

相关内容