面向长推理的信息感知KV缓存压缩
大型语言模型(LLMs)的推理能力快速提升,导致在预填充和解码阶段键值缓存(KV cache)规模日益增长。现有KV缓存压缩方法主要依赖注意力权重估计令牌重要性,虽能捕捉上下文相关性,却忽视了与预测不确定性和令牌信息量相关的互补信息论信号。 本文从前瞻性视角重新审视令牌重要性,引入Forward Influence——一种衡量压缩令牌对未来上下文影响的指标。分析表明:注意力评分选中的令牌主要影响邻近上下文,而具有高预测不确定性的令牌对远期上下文的影响显著更强。基于此观察,我们提出InfoKV,一种熵感知的KV缓存压缩框架。它将令牌级预测不确定性与逐层表示演化结合,在推理过程中将得到的熵评分与注意力评分整合,实现信息与注意力的协同压缩。 在Llama-3.1、Llama-3.2和DeepSeek-R1上的长上下文推理基准实验表明:InfoKV在长预填充和解码场景中均持续优于现有基于注意力的KV压缩方法。
论文精读
TL;DR InfoKV 通过融合预测熵与注意力权重评估 token 重要性,捕捉对远距离推理影响更大的高不确定性 token,实现更优的长上下文 KV 缓存压缩。
核心洞察
- **Forward Influence 揭示了预测不确定性与长程影响的强关联,突破了传统注意力权重仅捕捉局部重要性的局限。** 现有方法(如 H2O、StreamingLLM)主要依赖注意力分数评估 token 重要性,但注意力分数天然偏向邻近上下文,导致对远距离推理关键 token 的保留不足。InfoKV 通过量化 token 被压缩后对未来生成的影响,发现高预测不确定性(熵)的 token 对遥远未来有更强的塑造力,这种前瞻性指标填补了注意力机制在长程依赖建模上的盲区。
- **将信息论信号与注意力权重融合,构建了一种互补型的 KV 缓存压缩策略。** 纯注意力方法遗漏了 token 的“惊异”价值——即模型自身对其预测的不确定性,这往往对应着推理过程中的关键分支点。InfoKV 联合使用 token 级预测熵和跨层表示演化幅度的熵分数,与注意力分数加权融合,在长 prefilling 和 decoding 场景下均优于单一注意力方案。这种双通道重要性评估无需修改模型结构,可在现有推理流程中即插即用,为 LLM 长上下文推理效率提升提供了新路径。
方法
核心思路
InfoKV 将 KV 缓存压缩建模为一个 token 重要性评估问题,提出用信息论信号补充传统的注意力权重。作者通过引入前向影响 (Forward Influence) 度量发现:注意力分数高的 token 主要对邻近上下文有较大影响,而预测熵 (predictive entropy) 高的 token 对远距离的未来上下文具有更强的影响力。基于此观察,InfoKV 为每个 token 生成一个融合熵与注意力的综合得分,用于选择保留哪些 KV 对。
输入 → 关键模块 → 输出
- 输入:预填充阶段或自回归解码过程中产生的完整 KV 缓存序列。
- 关键模块:
- Token 级预测熵:使用语言模型在每一步的 logits 计算下一个 token 的概率分布的熵,衡量模型对该位置的预测不确定性。
- 层级表示演化 (Layer-wise Representation Evolution):对每一层,计算该 token 的隐状态与下一层隐状态之间的变化量(如 L2 距离),捕捉信息在各层传播时的演变程度。
- 熵分数 (Entropy Score):将预测熵与表示演化结合(文中通过可调参数 τ 平衡二者),得到信息论视角下的 token 重要性分数。
- 注意力融合:将熵分数与多头注意力权重(取平均或最大值)进行加权融合,形成最终的重要性分数。权衡因子可通过消融实验确定,使得模型能自适应地在邻近依赖与远距离推理之间平衡。
- 压缩策略:根据最终分数保留 top-k 个 token 的 KV 缓存,丢弃低分 token;可配合自适应策略动态调整保留比例。
- 输出:压缩后的 KV 缓存,直接用于后续的注意力计算,内存占用显著降低。
与同类方法的差异
与仅依赖注意力权重的压缩方法(如 H2O、StreamingLLM)相比,InfoKV 额外引入预测不确定性和层级演变作为先验信号,显式地建模 token 对远距离上下文的长程影响,在长时推理场景下能更准确地保留高信息量 token,从而减少性能损失。
实验
实验设计
论文在 长上下文推理基准 上验证 InfoKV,模型使用 Llama-3.1、Llama-3.2 和 DeepSeek-R1,覆盖不同规模与架构。评测场景包括 长预填充(long prefilling) 与 长解码(long decoding),前者模拟输入大量上下文后的一次性编码压缩,后者模拟逐步生成过程中 KV cache 的动态管理。对比基线为现有基于注意力权重估算 token 重要性的压缩方法,如 H2O、SnapKV 等典型 attention-based 策略。
关键发现
- 一致优于基线:在多个模型和任务上,InfoKV 的性能显著超过纯 attention 驱动的压缩方法。
- 熵信号的优势:加入来自预测不确定性的信息论得分后,远距离未来 token 的恢复能力明显增强,弥补了注意力仅捕捉邻近相关性的局限。
- 场景泛化:无论是预填充阶段的大批量压缩还是解码阶段的在线淘汰,InfoKV 均能保持稳定的推理质量,显示出良好的场景适应性。
与基线的深度对比
现有 attention-based 方法本质上是 向后看(backward-looking),即根据已计算的注意力分数决定哪些历史 token 值得保留。这种策略容易保留大量与局部上下文紧密相关的 token,却丢弃了虽然当前注意力不高但对全局推理至关重要的 token。InfoKV 引入 Forward Influence 视角,结合 token 级预测熵 与 层间表征演化,将压缩决策从“过去哪些重要”转为“未来哪些不可少”。实验显示,由高熵信号选出的 token 对远距离未来上下文的贡献显著高于注意力选出的 token,这解释了 InfoKV 在长程推理任务上全面超越 baseline 的原因。
行业影响
落地场景
InfoKV 瞄准长上下文推理的KV 缓存压缩,可直接嵌入依赖长文本处理的 AI 产品线:
- 多轮对话系统 (客服/心理咨询/虚拟陪伴): 对话历史不断增长,解码阶段 KV 缓存线性膨胀,InfoKV 可在有限内存下保留对远距离上下文具有高预测不确定性的关键 token,维持对话连贯性。
- 代码助手与仓库级生成 (如 GitHub Copilot 等): 处理多文件、长文件上下文时,InfoKV 能更精准地保留与当前编辑点相关的远距离依赖(例如文件头的函数签名),避免截断重要信息。
- 文档理解与知识库问答: 处理数百页 PDF/合同/技术手册,压缩 prefill 阶段的大量 token 以支持更长的有效输入窗口。
- 视频/会议摘要与长文本生成: 解码阶段压缩 KV 缓存,使模型在生成长摘要或报告时跟踪全篇结构。
商业价值
- 降本: 以更低的 KV 缓存内存占用达到同等质量,可减少 GPU 需求或在相同硬件上支持更高并发与更长序列,直接降低推理服务成本(对按 token 计费的 API 尤其显著)。
- 体验提升: 保持长上下文关键信息,减少遗忘导致的重问与错误,提升产品在准确率、连贯性上的表现,进而提高用户留存与付费转化。
- 差异化竞争优势: 在长文档处理上限(如 200 页 PDF 问答)或多轮记忆深度上形成壁垒,可作为高级服务卖点。
与现有产品/工作流的接口
InfoKV 本质上是一种** token 重要性评分函数**,可无缝替换现有点积注意力权重评分,集成到主流推理框架:
- 在 vLLM / TensorRT-LLM 的 KV 缓存管理模块中,直接替换
greedy或H2O等策略的评分逻辑。 - 与 FastGen、StreamingLLM 等兼容,InfoKV 的熵感知分数可搭配其分层压缩或滑动窗口机制。
- 集成方式:在推理钩子中,每层输出 KV 后调用 InfoKV 计算熵与注意力组合分数,再执行 top-k 保留或自适应剪枝。无需改动模型权重,易于部署为推理引擎的插件。
具体落地实例
- 在线教育 AI 导师: 学生进行数百轮数学证明对话,模型需记忆早期定义和推导思路。解码时,InfoKV 根据 token 的预测不确定性优先保留关键步骤的表达,确保导师不会在解释后期遗忘前提,减少学生因重复说明而中断学习,提升完课率。
- 法律合同分析平台: 用户上传 100+ 页合同并连续追问条款,prefill 阶段 InfoKV 对长文档压缩时保留高信息量的分句,使得问答引擎能精准引用原文,避免因关键条款被丢弃而产生的法律风险。同时,内存节省允许服务商以更低定价提供长文档服务,扩大客户群。
局限
- **计算开销问题**: InfoKV 需额外计算 token 级预测不确定性(如熵)与层间表示演化,这引入了不可忽略的计算成本。论文未讨论该开销在预填充和解码阶段的具体增量或延迟影响,可能在实际低延迟服务中成为瓶颈,尤其与纯注意力基线相比,其轻量性存疑。
- **泛化性与鲁棒性**: 实验仅覆盖长文本推理场景和少数模型 (Llama-3.1, Llama-3.2, DeepSeek-R1),未展示在短序列、多轮对话、指令跟随或非推理密集型任务上的表现。熵信号在分布外数据或低熵确定性生成时可能不可靠,压缩率与任务性能的权衡未做系统性消融。
- **对比方法的覆盖面**: 比较对象局限于基于注意力的压缩方法,忽略了近期基于聚类、核方法或关键 token 保留(如 Keyformer)等不依赖注意力的方案,也未与 streaming 类压缩或动态预算分配等更全面的策略对比,削弱了 SOTA 声明的说服力。