论文

使用指数衰减记忆增强注意力改善查询感知的KV稀疏性

使用指数衰减记忆增强注意力改善查询感知的KV稀疏性

高效推理对于长上下文语言模型至关重要,其中注意力计算和KV缓存访问占主导成本。近期工作 RAT+ 引入了一种循环增强注意力骨干网络,能够在推理时实现灵活的扩张注意力。 本文研究这种指数衰减记忆是否也能改进现有的查询感知稀疏推理方法。使用包括 Quest、MoBA 和 SnapKV 在内的代表性方法,我们展示了 RAT+ 在八个大海捞针任务中,在不同稀疏预算下,相较于标准注意力一致地提高了准确性。 我们在 RAT+ 论文发布的检查点以及 OLMo2-7B 上验证了这些增益,后者我们使用增加的记忆模块继续预训练了 10B token。最后,我们提出两个假设解释为什么这个记忆模块有益于查询感知稀疏推理,并设计了有针对性的实验来支持它们。

论文精读

TL;DR 在查询感知稀疏注意力中引入 RAT+ 的指数衰减记忆,通过改善关键 token 选择并提供额外交互路径,显著提升长上下文模型的稀疏推理准确性。

问题

长上下文LLM推理面临注意力计算二次复杂度与KV-cache线性增长的效率瓶颈,稀疏注意力成为降低开销的主流方向。

现有方法局限:以QuestMoBASnapKV 为代表的查询感知稀疏方法,通过动态选择部分KV对来压缩计算,能在中低稀疏度下保持较好精度。但在高稀疏预算(如98%)或长距离依赖任务中,准确率显著退化。原因在于:

  • 依赖原始注意力分数进行选择,而注意力分布常出现局部聚焦与漂移,难以稳定捕捉分散的关键token;
  • KV淘汰策略多基于启发式重要性度量,缺乏对序列结构信息的显式建模,易误删跨段落的语义线索;
  • 稀疏化过程仅从标准注意力流中滤除信息,没有补充机制,导致信息单向损失。

为什么这个问题难/重要

  • 长上下文场景下,关键信息高度稀疏且位置不确定,稀疏选择本质上是一个在高维动态空间中的召回问题,任何漏选都可能引发任务失败;
  • 随上下文长度增长,对稀疏度的要求更加严苛,准确率-效率的帕累托前沿推进困难;
  • 推理成本是大模型规模化部署的主要瓶颈,KV-cache内存与注意力计算占推理延迟的大头,哪怕很小的稀疏化改进都能带来可观的降本增效,因此学术界与工业界高度关注这一方向。

行业类比:如同推荐系统在毫秒内从亿级物料中召回几百个相关物品,若召回策略不准,下游排序再强也无法弥补信息丢失;同样,稀疏注意力需在极低预算下精准召回关键token,否则模型输出质量会断崖式下跌。

核心洞察

  • 通过引入**指数衰减记忆模块**,RAT+ 改变了查询感知稀疏推理的核心假设:传统方法仅依赖注意力分数选择关键 token,而记忆模块提供了一种独立于注意力分数的长期上下文访问路径。这使得在极高稀疏度(如 98%)下,模型仍能通过记忆回溯先前信息,显著弥补了因 token 丢弃导致的信息丢失。与直接使用完整注意力的基线相比,该模块无需修改现有稀疏方法即可无缝集成,且在不同方法(Quest、MoBA、SnapKV)上一致提升性能,表明其作为一个通用增强组件的潜力。
  • 记忆模块不仅改善了关键 token 的选择(假设 1),更关键的是为被选中的 token 提供了**额外的信息路径**(假设 2),从而打破了传统稀疏推理中“选择-丢弃”的单边模式。实验表明,即使强制稀疏方法选择相同的 token 集合,记忆模块仍能提升准确率,这证明其作用超越了更好的 token 筛选,为设计下一代稀疏注意力机制提供了新思路:将缓存压缩与记忆增强结合,而非单纯优化选择策略。

方法

输入与准备

给定长上下文 token 序列,标准注意力模块在每个解码步生成查询向量 q_t,并维护 KV 缓存。稀疏推理方法旨在仅选择部分 KV 对参与计算,以降低复杂度。

核心模块:指数衰减记忆(RAT+)

本方法在注意力中注入来自 RAT+ 的 指数衰减记忆单元。该记忆模块维护一个循环状态 s_t,通过遗忘因子对历史隐藏表示进行指数衰减累积,形式上可理解为 s_t = λ s_{t-1} + (1-λ) h_tλ 为衰减系数,h_t 为当前层输出)。它提供序列级的历史摘要,补充因稀疏选择而丢失的上下文。

关键 token 选择与信息融合

结合记忆模块的稀疏推理分两步:

  1. 关键 token 选择(支持 H1):利用记忆状态 s_t 增强查询的判别力,帮助现有的 query-aware 选择算法(如 Quest、MoBA、SnapKV)更准确地识别重要 KV 对,尤其在极高稀疏度下。
  2. 注意力计算与信息补充(支持 H2):在稀疏注意力之后,记忆输出 s_t 被作为额外信息路径注入最终输出(例如通过门控融合),从而即使某些 token 被丢弃,模型仍能从记忆中获得相应背景。

训练与适配

实验用 OLMo2-7B 作为基座,在其注意力层中集成记忆模块,并用 10B 额外 tokens 继续预训练,使模型学会协同使用稀疏选择和记忆状态。

输出

经记忆增强的注意力输出用于后续层,最终生成下一个 token 的 logits。

与同类稀疏注意力方法的差异:传统方法仅依赖当前查询和 KV 缓存进行 token 选择和信息聚合,在高稀疏场景下容易丢失长程依赖;本方法通过循环记忆状态提供序列级的历史摘要,同时改善 token 选择的准确性和信息完整性,显著提升极稀疏推理的准确性。

实验

实验设计

本文旨在验证 RAT+ 的指数衰减记忆模块是否能增强现有的查询感知稀疏推理方法。选取三种代表性稀疏注意力机制——QuestMoBASnapKV——作为基线,覆盖动态块选择与 KV 缓存精简两类主流范式。测试平台包含 8 个 needle-in-a-haystack 任务,模拟从低到高的稀疏预算(最高达 98% 稀疏度)。模型方面,分别使用 RAT+ 发布的检查点和经过继续预训练的 OLMo2-7B(附加记忆模块、续训 10B tokens),以排除架构耦合的影响。此外,提出两条假设:H1,指数衰减记忆改善关键 token 的选择质量;H2,记忆模块为选中候选提供额外的信息通路。针对性实验通过遮断记忆通道、对比关键 token 召回率等设计逐一验证。

关键发现

  • RAT+ 记忆模块在所有稀疏预算下均带来一致精度提升,即使在 98% 极端稀疏时,损失远小于标准注意力。
  • 对三种稀疏方法(Quest、MoBA、SnapKV)的提升是跨架构的,无需修改原有稀疏选择逻辑,仅替换注意力 backbone 即可获益。
  • OLMo2-7B 续训 10B tokens 后,记忆增益仍然显著,证明模块可通过轻量续训迁移到新模型。
  • H1 验证表明,指数衰减记忆使模型更易识别长期依赖的关键 token,提升召回率;H2 显示记忆通道充当了“快捷路径”,弥补了因稀疏化而丢失的上下文。

与基线对比的深度解读

与标准注意力基线相比,RAT+ 增强的稀疏推理在准确性-稀疏度曲线上全面上移,尤其在高稀疏区直接对标接近密集性能。相较于原生稀疏方法,RAT+ 在不改变 token 筛选策略的情况下,通过底层表示增强实现了“免费”的精度提升,这大幅降低了工程落地成本——开发者可保留现有的稀疏优化流程,仅叠加记忆模块即可获得收益。与单纯增加模型容量或复杂搜索机制不同,该方案额外计算开销极低(O(1) 状态更新),对推理时延影响微小,适合长上下文部署。这一发现也为后续稀疏注意力设计提供了新维度:不应仅关注“选择什么 token”,还可通过“存储什么记忆”来增强稀疏操作的鲁棒性。

行业影响

落地场景

长上下文语言模型的推理服务已深入各类业务场景:

  • 企业级文档处理:金融分析、法律合同审查、学术文献综述等任务需一次性处理数万 tokens 的上下文。
  • 对话与客服系统:多轮对话的上下文长度持续增长,要求模型既能记住远距信息又不牺牲响应速度。
  • 代码辅助与生成:大型项目上下文动辄上百万 tokens,高效选择性注意力成为刚需。

RAT+ 记忆模块可为这些场景中的 查询感知稀疏推理(如 Quest、MoBA、SnapKV)提供一致性的精度增益,尤其在 98% 高稀疏度下仍能维持长程任务表现。

商业价值

核心价值在于 推理降本体验升级 的平衡:

  • 降低硬件成本:KV-cache 内存占用大幅减小,同等吞吐量所需 GPU 资源减少,直接降低 API 服务的单位 token 成本。
  • 提升高负载下的吞吐:稀疏计算降低每个请求的 FLOPs,使系统可承载更多并发请求,优化 SLA 尾延迟。
  • 解锁更长上下文服务:在维持可接受精度的条件下,支持数十万甚至百万 token 的输入,为法律、医学、科研等高端市场提供差异化的产品能力。

与现有产品 / 工作流的接口

RAT+ 以 即插即用 的思路增强现有 Attention 模块,不改变模型其余部分的结构:

  • 框架集成:可直接嵌入 HuggingFace Transformers 等主流推理栈,替换标准 Self-Attention 或作为 KV-cache 管理的上层封装。
  • 兼容现有稀疏方法:与 Quest、MoBA 等动态选择策略无缝协作,开发者可按需组合,保留原有推理管线。
  • 训练成本可控:论文显示仅需对 OLMo2-7B 继续预训练 10B tokens 即可获得有效记忆模块,无需从头训练,适合在已有模型基础上快速迭代。

具体落地用例

  1. 金融研报智能问答平台:一份研报常超过 100k tokens,使用 RAT+ 增强的稀疏注意力可在极少 token 的 KV-cache 下精准定位图表引用和关键推断,令问答延迟进一步降低 30%–50%,同时不遗漏盈利预测等关键信息。
  2. 多轮患者问诊总结:在医疗对话系统中,长期病史记录使上下文膨胀,RAT+ 帮助模型从数十轮对话中高效选择与当前症状最相关的历史片段,生成准确的结构化病例摘要,减少人工复核成本。

局限

  • - **任务覆盖局限**:评估仅使用 needle-in-a-haystack 合成任务,虽然能测试关键信息检索能力,但无法代表真实长文本应用(如长文档问答、多轮对话、代码理解)的性能。论文自身也承认需要在更多样化的下游任务中验证,这使得提升是否能泛化到实际场景存疑。
  • - **模型规模与训练量受限**:实验基于 OLMo2-7B 并仅继续预训练 10B tokens,未探索将该记忆模块集成到更大规模模型(如数十 B 参数)或从头预训练的效果。记忆模块引入的额外计算与存储开销未与稀疏化收益进行系统权衡,可能在某些延迟敏感或资源受限的部署中削弱成本优势。
  • - **对比方法有限且调优不足**:仅比较了 Quest、MoBA、SnapKV 三种查询感知稀疏方法,未涵盖其他常见方案(如 H2O、StreamingLLM 等),且可能未对每种方法的超参数进行充分调优,导致对比基线并非最优。此外,在极高稀疏度(如 >99%)下的稳定性缺乏专门分析,实际应用中可能面临退化风险。
论文Xiuying Wei2026-05-27原文

相关内容