论文

CoinRAG:面向长上下文 RAG 的上下文信息片段 KV 缓存复用

CoinRAG:面向长上下文 RAG 的上下文信息片段 KV 缓存复用

现有面向检索增强生成(RAG)的优化研究通过利用块级 KV 缓存复用来避免处理冗长检索上下文,从而提升效率。然而,粗粒度块中仍存在显著的信息冗余与噪声。为此,本文提出 CoinRAG(Contextualized Information Nugget KV Cache Reuse),在低预填充延迟约束下同时优化帕累托前沿与答案准确率。 其核心机制在于:组合式复用离线计算的细粒度信息片段缓存(nugget caches),而非整块编码。具体而言,CoinRAG 通过两阶段检索定位检索块内的查询相关语义单元,并以块级上下文无缝拼接其切片 KV 表示,以更紧凑且语义相关的方式构建上下文表示。 在 LongBench 多跳问答任务上的广泛评估表明:CoinRAG 显著降低运行成本,并在标准快速预填充延迟预算下,相较其他基线实现了平均 5.3% 的相对答案质量(F1)提升,构建了新的帕累托前沿。

论文精读

TL;DR CoinRAG 通过两阶段检索定位查询相关的细粒度语义 nugget,复用离线 KV cache 组合成紧凑上下文,在低 prefill 延迟下将 LongBench 多跳问答 F1 相对提升 5.3%,获得新 Pareto 前沿。

问题

问题背景

长上下文 RAG 系统在推理时需要对大量检索 chunk 进行 prefill 编码,带来显著延迟,业界正探索 KV cache 复用等优化手段。

现有方法局限

目前主流优化利用 chunk 级 KV cache 复用,避免重复编码完整 chunk。但 chunk 是粗粒度单元,通常包含大量与 query 无关的 tokens,直接复用会引入冗余和噪声,影响模型对关键信息的聚焦。此外,固定 chunk 粒度无法根据 query 动态裁剪,缓存中无效信息的比例高,限制了低延迟预算下的准确率。

为什么这个问题难/重要

细粒度复用(如 nugget 级)虽然能减少噪声,但面临多个技术挑战:需要高效定位 query 相关的语义单元、处理跨 chunk 的 KV 缓存切片与位置对齐、保证组装后的表示保持上下文连贯性。同时,低 prefill 延迟约束对缓存 I/O、检索开销和计算量提出严格限制,要求系统在准确性和效率之间找到新的 Pareto 最优。该问题直接影响大规模 RAG 服务的成本与响应质量,是业界关注的关键瓶颈。

行业类比

类似长视频理解中按关键帧缓存特征,避免每帧重新编码,只组装与 query 相关的片段以加速推理。

核心洞察

  • 细粒度语义单元(nugget)缓存重用突破 chunk 级冗余瓶颈,通过离线预计算和两阶段检索,在低 prefill 延迟下实现更紧凑的上下文表示。与以往 chunk 级 KV 缓存重用不同,CoinRAG 将缓存单元从块细化为 query 相关的语义片段,仅保留必要 token,从而同时降低噪声和计算量,为长上下文 RAG 提供了更精细的缓存粒度控制。
  • 上下文化组装与位置对齐机制确保 nugget 切片与 chunk 上下文的语义连贯性,避免孤立编码导致的上下文断裂。现有 nugget-based RAG 通常独立编码片段,忽略 chunk 内相对位置和周围语境;CoinRAG 通过 chunk-level context 和位置对齐,使模型能感知 nugget 在原文档中的位置关系,提升多跳推理能力。
  • 工程上针对低 prefill 延迟约束的 Pareto 优化,将离线缓存构建与在线动态组装解耦,实现在固定延迟预算下的精度最大化。传统方法要么全量编码 chunk(高延迟),要么直接拼接 nugget(丢失上下文),而 CoinRAG 通过预计算 nugget 缓存并在推理时灵活组装,为实际部署提供了新的成本-精度权衡点,在 LongBench 上平均相对 F1 提升 5.3%。

方法

输入:查询 query 与检索到的文档块 chunks。

关键模块:

  1. 离线 Nugget 提取:预先从语料库每个 chunk 中识别语义单元(nugget,如实体、事实片段),并为每个 nugget 离线计算 KV cache,替代整块编码。
  2. 两阶段在线检索:第一阶段用 query 检索相关 chunk;第二阶段在 chunk 内部检索与 query 最相关的若干 nugget,只选取细粒度语义单元,避免处理整块噪声。
  3. 上下文化 KV Cache 组合与位置对齐:将选中 nugget 的 KV cache 切片按检索顺序拼接,同时注入 chunk 级上下文表示(保持块级语义背景);通过位置对齐修正拼接带来的位置编码偏差,使组合后的表示在位置敏感模型中仍能正确建模序列关系。
  4. Nugget-Aware Fine-tuning:微调阶段让模型学习如何利用上下文化的 nugget KV 表示,提升生成答案的精准度。

输出:模型基于组合后的紧凑 KV 表示生成最终答案,显著降低预填充延迟。

与同类方法的差异点:相比 chunk-level KV cache reuse(如 Cache-Augmented Generation)直接复用整块缓存,CoinRAG 复用更细粒度的 nugget 缓存,并通过上下文化组合与位置对齐保持语义连续性,在低预填充延迟约束下实现精度与成本的更优 Pareto 前沿。

实验

实验设计

摘要仅给出核心设定:在 LongBench 多跳问答任务上评估,目标是在 低 prefill 延迟约束 下最大化答案质量。CoinRAG 与一系列利用 chunk 级 KV cache 复用 的 baseline 对比,重点观察 Pareto 前沿 的移动;两阶段检索 + 细粒度 nugget 缓存复用是主要变量。

关键发现

  • CoinRAG 在标准快速 prefill 延迟预算下,相对基线平均实现 +5.3% F1 提升。
  • 同时显著降低了运营成本,形成新的 Pareto 前沿,说明在相近或更低延迟下能获得更优答案质量。
  • 效果来源被归因于用 查询相关的语义单元(nugget) 替代整块 chunk,减少了信息冗余和噪声。

与基线对比的深度解读

与之前 chunk 级 KV cache reuse 方法相比,CoinRAG 的核心差异不是“是否复用”,而是复用的粒度与上下文绑定方式:将细粒度 nugget 的切片 KV 表示与 chunk 级上下文组合,实现语义更相关且更紧凑的编码。这意味着工程上可以从离线缓存构建阶段就控制 cache 单元;在推理时按查询动态组装,避免对整段 chunk 重做 prefill。该思路对多跳问答尤其重要,因为相关性粒度更细,噪音更大。

行业影响

落地场景

CoinRAG 适合需要从多个文档中拼接证据链的长上下文 RAG 场景,典型产品包括企业知识库问答、多跳研究助手、合同/法律分析、金融研报检索等。其两阶段细粒度检索机制使得在处理复杂跨文档问题时,系统能仅加载相关语义单元,而非整个 chunk,显著降低 prefill 延迟。

商业价值

主要收益在降本和体验提升。通过复用离线计算的 nugget KV cache,在线推理时避免重复编码整个 chunk,减少 GPU 计算时间和内存带宽占用。对于高吞吐量的 RAG 服务,可直接降低云资源成本。同时,在 LongBench 多跳 QA 上平均 F1 相对提升 5.3%,在低延迟预算下达到新的 Pareto 前沿,意味着用户获得更准确答案的同时,响应时间更短,有助于提高留存和转化。

与现有产品/工作流的接口

CoinRAG 可作为现有 RAG pipeline 的替换层:上游保留向量数据库做粗检索,下游接入两阶段 nugget 检索和 KV cache 组装。工程上需增加离线 nugget 提取步骤(预先切分语义单元并缓存 KV),在线时通过轻量检索器选择 nugget,并与 LLM serving 框架(如 vLLM)集成,实现 KV 缓存的动态拼接和位置对齐。接口兼容标准 RAG 输入输出,可封装为可插拔模块,对现有系统改动较小。

具体落地 use case:

  • 企业知识管理平台(类似 Glean 或 Notion AI):用户提出多跳问题,例如“对比两个项目的风险点和应对措施”,传统 RAG 需编码大量 chunk,延迟高且噪声多。CoinRAG 仅加载关键信息单元,降低 P95 延迟,同时提升答案准确度。
  • 医疗证据检索系统:临床研究者需要从多篇论文中提取关联证据,长上下文导致 prefill 慢,CoinRAG 通过细粒度缓存复用支持快速交互式检索,降低每次查询成本。

局限

  • CoinRAG 依赖两阶段检索与离线 nugget 缓存构建,工程实现复杂度较高,且检索阶段引入的额外延迟可能在短上下文或低查询率场景下抵消 KV cache 复用带来的收益。实验仅在 LongBench 多跳问答任务上验证,缺乏对单跳 QA、开放域生成或代码等任务的泛化评估。
  • 与现有 chunk 级 KV cache 复用方法相比,CoinRAG 的细粒度 nugget 索引和切片拼接增加了缓存管理开销与存储成本,尤其当语料库动态更新时,离线缓存的增量维护策略尚不明确。位置对齐虽经专门设计,但在长距离依赖或跨 nugget 推理场景中仍可能存在误差累积。
  • nugget-aware fine-tuning 需要额外训练数据与计算资源,降低了方法的即插即用性;离线 nugget 提取的质量高度依赖于初始 chunk 检索和 LLM 提取效果,可能引入噪声或遗漏关键信息,而论文未对该依赖进行敏感性分析。
论文Gyuwan Kim2026-08-07原文

相关内容