论文

ReFreeKV: 迈向无阈值KV缓存压缩

ReFreeKV: 迈向无阈值KV缓存压缩

在大型语言模型推理过程中,为减少内存消耗,已有多种方法提出用于 KV缓存剪枝。这些技术虽能在许多数据集上实现无损内存缩减,但往往依赖一个被忽视的条件:需要预先确定输入或领域特定的阈值来分配 KV缓存预算,以达到最优性能。然而,这种输入敏感的设计在实际场景中受限严重,因为开放域输入涵盖不同领域、长度和难度,阈值选择缺乏明确边界。因此,这种输入敏感阈值依赖成为根本性局限,导致在任意输入上性能大幅下降。 本文提出一种新目标,解除阈值约束以实现鲁棒的 KV压缩,倡导 无阈值方法,即自适应调整预算分配同时保持全缓存性能。我们进一步提出新方法 ReFreeKV,作为该目标的首个实例化。在涵盖不同上下文长度、任务类型和模型规模的 13个数据集 上进行的大量实验,证明了其有效性和效率。代码已公开。

论文精读

TL;DR ReFreeKV 摒弃了 KV 缓存压缩对人工阈值的依赖,通过自适应预算分配实现无阈值压缩,在任意输入上保持与全缓存接近的性能。

问题

问题背景

LLM 推理中的 KV cache 内存占用随输入长度和 batch 规模线性增长,成为部署瓶颈。近年来,KV cache 剪枝 方法通过移除不重要 token 的键值对来压缩缓存,力求保持性能的同时降低内存开销。

现有方法局限

当前主流方法(如 H2OStreamingLLM)普遍依赖一个被低估的前提:需要针对具体输入或领域预先设定压缩预算阈值(如保留的 token 比例或数量)。这种 input-sensitive 设计在开放域场景中暴露三大缺陷:

  • 阈值选择高度敏感,微小调整可能导致性能剧烈波动;
  • 输入跨度涵盖不同长度、领域和难度,缺乏清晰的选择边界;
  • 依赖人工调参,无法自动适配任意输入。 结果,固定阈值的剪枝方法在多样化输入上性能退化显著,阻碍了其在生产环境中的可靠应用。

为什么这个问题难/重要

技术挑战在于:剪枝算法需要自适应地分配缓存预算,既不能过度保留浪费内存,也不能过度剪枝损害生成质量。这要求模型能够根据上下文重要性动态决策,而非依赖静态启发式分数。业界关注度持续升温,因为 LLM 服务正面临多租户、流式处理和超长文本等复杂场景,手动设定阈值不切实际。实现 threshold-free 的鲁棒压缩,是推进低成本、高性能 LLM 推理的关键一步。

行业类比

就像自适应码率视频流根据网络状况动态调整清晰度,无需用户预设固定分辨率,ReFreeKV 让 KV cache 压缩能依据输入内容自动平衡内存与保真度,这对弹性 LLM 服务至关重要。

核心洞察

  • **KV 缓存剪枝的性能瓶颈在于输入敏感的阈值设定** 现有方法大多需要针对每个输入或领域预先确定 KV 缓存预算阈值,这在开放域推理中缺乏可行性,因为输入长度、难度动态变化,固定阈值要么过度压缩导致精度下降,要么保留过多无用 token 浪费内存。ReFreeKV 首次将问题重新定义为“阈值无关”(threshold-free)目标,摆脱了对人工阈值的依赖,通过自适应机制调整压缩强度,直面此前方法在真实多领域场景下的泛化缺陷。
  • **基于统一度量的自适应驱逐策略实现了无阈值压缩** ReFreeKV 采用两阶段流程:先通过注意力矩阵归约得到初始重要性排序,再引入 Uni-Metric(统一度量)为所有层动态计算通用驱逐阈值。与以往每层独立设定阈值或需要校准集的方法不同,该度量融合了 token 重要性分布的全局统计特性,使得预算分配能与输入难度自动匹配,无需任何先验。这种设计确保在简单输入时保留更多缓存,复杂长文本时激进压缩,且全缓存性能得以保持。
  • **广泛的跨任务、跨模型验证证明了去阈值压缩的工程可行性** 在 13 个涵盖数学、常识推理、多文档 QA、代码生成等任务的数据集上,ReFreeKV 在 7B–13B 参数模型上均能接近全缓存基线,同时大幅降低内存占用和延迟。消融实验揭示了保留底层完整 KV 缓存对长序列的重要性,以及初始排序方法的鲁棒性。这一系列结果不仅验证了方法的有效性,更为工业级 LLM 服务部署提供了无需人工调参的即插即用方案。

方法

输入与总体目标

ReFreeKV 针对大语言模型推理时的 KV 缓存压缩 问题,输入为自回归生成过程中累积的 key-value 向量序列。与传统方法依赖预设的输入/领域敏感阈值不同,本方法提出 Threshold-Free 新目标:无需预先指定缓存预算,而是自适应地调整分配,使压缩后的缓存性能与完整缓存(full-cache)持平。

关键模块:两阶段逻辑与通用驱逐

ReFreeKV 的核心由以下模块构成:

  1. 初始排名 (Initial Ranking):对每层的 KV 对进行重要性评估,可能基于注意力权重或累积分数,生成全局或分层的重要性排序,为后续驱逐提供依据。
  2. 统一指标驱逐 (Eviction by Uni-Metric):引入一个通用阈值 (Universal Threshold),通过该指标统一衡量不同头、不同层的 KV 重要性,从而一步完成跨层、跨头的自适应驱逐,避免了逐层或逐头独立调参的繁琐。
  3. 降低开销 (Reducing Overhead):通过保留底层层的完整 KV 缓存(Retaining Bottom Layers)等工程优化,在批量处理和大规模推理场景下减少额外计算代价,保持端到端延迟优势。

整体流程为:输入序列 → 分层计算注意力 → 初始排名 → 通过通用阈值统一筛选保留/驱逐 → 输出压缩后的 KV 缓存,供后续生成步骤复用。

与同类方法的差异

区别于 FastGen、StreamingLLM 等需要根据不同数据集或输入长度手动调整缓存预算、且阈值选择高度敏感的方法,ReFreeKV 首次将“无阈值”作为一个显式优化目标,通过统一驱逐指标实现真正自适应的预算分配,在开放域、多任务场景下无需任何人工干预即可鲁棒压缩。

实验

实验设计

实验覆盖 13 个数据集,横跨数学与科学、常识推理、单/多文档问答、摘要等任务,上下文长度与难度多样,验证 ReFreeKV 在开放域场景下的泛化性。评估采用不同规模的 LLM 骨干(如 Llama 系列),与现有 KV 缓存剪枝方法对比,重点关注 内存占用首 token 延迟吞吐量

关键发现

ReFreeKV 在所有数据集上无需预设阈值即可保持与全缓存相当的性能,自适应分配有效避免了传统方法因阈值不当导致的显著退化。效率方面,端到端延迟大幅降低,且支持批量处理,内存开销可控。消融实验验证了注意力矩阵缩减、初始排序策略和通用阈值设计的关键作用。

基线对比

相较于依赖输入特定阈值的主流剪枝方法(如 StreamingLLM),ReFreeKV 的 threshold-free 范式从根本上消除了对领域/长度敏感的调参需求。在长文本或多域混合输入下,基线常需反复搜寻最优预算,而 ReFreeKV 可直接应用,性能波动极小,甚至优于精心调阈的基线,证明动态预算分配的优越性。

行业影响

落地场景

ReFreeKV 适用于所有需在固定显存预算下提供稳定高质量推理的 LLM 服务,尤其适合开放域、上下文长度波动大的场景,如长文档问答、多轮对话系统、代码助手和内容生成 API。传统 KV 缓存压缩依赖人工设定阈值,不同输入需反复调参,而 ReFreeKV 的自适应预算分配免除了这一步,可直接嵌入线上实时推理链路,降低运维复杂度。

商业价值

核心收益来自推理成本下降服务稳定性提升

  • 降本:KV 缓存占用减少 2–4 倍,相同 GPU 可支撑更大批次或更长上下文,直接降低每 token 成本。
  • 增收:对 SaaS 型 LLM 产品,更低的延迟和更一致的输出质量可提高付费转化与留存。
  • 体验:消除因阈值不当导致的性能抖动,避免长尾请求失败,提升用户感知的可靠性。

与现有工作流的接口

ReFreeKV 可作为即插即用的 KV 缓存管理插件集成到主流的推理引擎(如 vLLM、TensorRT-LLM)中:

  • 无需修改模型权重或训练流程,仅替换缓存淘汰策略。
  • 阈值无关设计可与已有有阈值方法互补,形成分级压缩策略:对简单输入保守压缩,对长难文本自动激进压缩。
  • 支持批量推理下的动态内存分配,便于与当前流行的连续批处理调度器对接。

具体案例

  • 电商客服机器人:处理用户提问长度从短句到数段不等,ReFreeKV 自适应压缩确保任何输入下输出准确,避免因缓存阈值设置不当而高代价重新生成。
  • 内容平台 AI 摘要服务:每日百万级文章摘要请求,文章长度跨度极大;ReFreeKV 让系统在固定 GPU 规模下承载更高并发,同时长文档摘要质量不降。

局限

  • **额外计算开销**:ReFreeKV 采用两阶段评分与逐指标排序,虽避免了阈值预设,但在 prefill 阶段需计算额外注意力矩阵并进行 Top-K 选择。对于 batch size 较大或序列超长(如 >128K)的场景,这些操作可能显著增加延迟。论文虽展示了端到端效率,但与 StreamingLLM 等极简方法相比,在低延迟在线服务中可能劣势明显,限制了其在高吞吐场景的适用性。
  • **对注意力模式的依赖**:方法的核心是使用 Uni-Metric 对注意力分配进行排序,这隐含假设注意力分布具有可利用的压缩结构。对于长距离离散依赖突出的任务(如代码生成或特定推理),该指标可能误判关键 token,导致压缩后性能骤降。论文在 Few-Shot 等任务上的消融实验已显现性能波动,但未对失败模式进行深入分析,使方法在异质性高的大规模部署中鲁棒性存疑。
  • **分层保留策略的架构假设**:ReFreeKV 选择保留底层全缓存,这基于底层 token 更重要的经验观察,但该假设可能不适用于所有模型架构(如混合专家模型或非均匀层宽设计)。实验仅在 LLaMA 系列模型上进行,对 GPT-NeoX、Falcon 等不同注意力实现的架构缺乏验证,泛化性证据不足。
论文Xuanfan Ni2026-06-26原文

相关内容