论文

既更聪明又更便宜:Byte-Exact KV-Cache Grafting 将冻结的小模型转化为 Verified-Knowledge Flywheel

既更聪明又更便宜:Byte-Exact KV-Cache Grafting 将冻结的小模型转化为 Verified-Knowledge Flywheel

我们报告了一种方法,使冻结的小语言模型在不变更任何权重的情况下,同时变得更强大且更便宜。验证知识被一次性以字节精确的键值(KV)状态工件形式存储,然后通过嫁接恢复到新的推理上下文中。恢复是比特精确的:在固定确定性配置下,嫁接的 logits 与全新计算逐字节相同(SHA-256 相等),KL 散度为零,50 个样本上 100% argmax 一致。 我们展示了在具有浮点旋转编码的模型上,自身位置嫁接是唯一的数值精确操作点,并在两个模型规模(12B、31B)和两个 GPU 目标上验证了字节精确性,其中一个通过预注册重放。在 AIME 2025 上,一旦嫁接已验证的解决方案库,冻结的 Gemma-4-12B 从 80.0% 提升到 93.3%,超过其自身的 77.5% 和其 31B 兄弟的 89.2% 已发表锚点。在重复案例中,基础模型在 401,026 个 token 预算内从未解决的八个问题,从缓存的已验证解决方案中以总共 61 个解码 token 得到回答,token 数量减少 6,574 倍,能量减少约 8,700 倍;能力主张本身依赖于保留的迁移(31B 上 7/7)。 相同的字节精确存储将可用上下文从 32,768 扩展到 2,854,766 个 token,零额外加速器内存,并在相同架构的机器之间逐字节移动。我们在行为层面描述系统;引擎是专有的,每个报告的数字都有提交的输入和输出哈希支持,因此可以在没有引擎的情况下重新检查评分。

论文精读

TL;DR 冻结小模型通过字节精确KV缓存嫁接,将验证知识直接注入推理上下文,AIME准确率从80%跃升至93.3%,解码token数降低6574倍,实现能力与成本双重突破。

问题

问题背景

大语言模型(LLM)的推理部署长期面临能力上限与成本效率的矛盾,业界惯常做法是堆叠更大的模型或更多加速器,但这并非可持续路径。

现有方法局限

当前主流的知识增强与复用手段各有短板:

  • 微调 (Fine-tuning) :依赖大量标注数据,更新权重易引发灾难性遗忘,无法保持模型冻结状态。
  • 检索增强生成 (RAG) :引入外部知识但检索过程非确定性,上下文拼接无法保证输出分布与完整计算严格一致,且长文本推理成本高昂。
  • 常规 KV 缓存复用:虽能减少重复计算,但因浮点运算非结合性与旋转位置编码 (RoPE) 对绝对位置的天然敏感性,跨上下文偏移恢复时引入数值误差,导致 logits 偏差,无法实现字节级别精确重建。

为什么这个问题难 / 重要

实现跨上下文的比特精确 KV 状态移植极具挑战:Transformer 深层浮点运算的微小扰动会被逐层放大,而 RoPE 的位置绑定特性使得只有 own-position(保持绝对位置不变)才能数值精确 (SHA-256 相等)。论文将此操作点发展成一套 知识飞轮 (verified-knowledge flywheel) 系统:

  • 能力跃升:在 AIME 2025 上,冻结的 12B 模型准确率从 80.0% 提升至 93.3%,超过自身基准 (77.5%) 和 31B 模型 (89.2%)。
  • 成本剧降:在历史上 8 道从未解出的难题上,通过移植已验证解,仅用 61 个解码 token 即完成回答,相较原模型需 401,026 token 预算,token 减少 6,574 倍,能耗降低约 8,700 倍
  • 工程价值:提供可验证的确定性推理,对代码生成、数学解题等高可靠性场景至关重要,同时以零额外显存将可用上下文窗口从 32K 扩展至 2.85M token。

行业类比

如同 CI/CD 管道中的确定性构建缓存确保每次编译输出比特一致,这种精确的 KV 状态移植让 LLM 的昂贵推理结果成为可复用的 二进制知识资产,推动推理即服务进入可验证复用时代。

核心洞察

  • 字节精确的 KV-cache 嫁接让冻结小模型获得了类似“知识飞轮”的能力提升:在不修改任何权重的情况下,通过复用已验证推理的 KV 状态,将 Gemma-4-12B 在 AIME 2025 上的准确率从 80.0% 拉升至 93.3%,甚至超越了 31B 版本。这一方法从根本上区别于主流的能力扩展路径——无论是模型 scaling、微调还是推理时搜索——因为它将“已验证知识”沉淀为可移植的、位数对位精确的计算资产,并通过嫁接直接注入后续推理,从而在性能不衰退(KL 散度为零、SHA-256 严格相等)的前提下突破原有模型的能力上限。
  • 该工作将已验证推理的 KV 状态视为一次性投资、多次复用的字节精确资产,在出现重复问题时能将解码 token 数从 401,026 降至 61(约 6,574 倍减少),能耗降低约 8,700 倍,同时将可用上下文窗口从 32K 扩展至 285 万 token,且不增加任何加速器内存。这与常见的 KV-cache 压缩或共享方案截然不同:它追求的不是缓存后的近似恢复,而是严格的位等价性,从而保证嫁接后的 logits 与全量重计算完全一致。这种“一次验证、处处精确复用”的经济性,为大模型服务提供了一条全新的成本-能力折衷路径,尤其适合高价值、可沉淀为知识库的推理场景。

方法

输入

新的推理上下文 token 序列(如数学竞赛题),以及预先通过一次性计算沉积的字节精确 KV 状态工件verified-solution.kv)。该工件来自冻结的基座模型对已验证解答的前向计算,储存了所有层的键–值对,并附带确定性执行参数(随机种子、精度配置等)。

关键模块

  1. 确定性执行环境 (pinned deterministic config)

    • 固定模型推理的全链路随机性:禁用非确定性 GPU 算子、锁定浮点运算顺序、固定 dropout 等,确保跨运行、跨同架构机器的位精确 (SHA-256) 可重复性。
  2. 恰好位置嫁接 (own-position graft)

    • 将预存的 KV 状态块精确放置在原 token 序列的相同绝对位置上进行恢复。因为浮点 rotary 位置编码对偏移敏感,任何位置移动都会引入微小误差,只有同位置注入才能保持数值全同。
  3. 嫁接协议 (Galahad)

    • 存款阶段:对已验证知识进行一次昂贵的前向计算,将完整 KV 状态写入持久化存储,同时输出 logits 哈希以供校验。
    • 恢复阶段:在新推理上下文中,直接将对应层的 KV 张量替换为加载的工件,跳过 Transformer 的自注意力键值计算。其余 token 的推理照常进行。
    • 引擎内部保证替换的位精确性,实验通过 KL 散度 = 0argmax 一致率 100%SHA-256 全等三重验证。

输出

从头完整计算完全相同的 logits 和 token 分布,但推理成本骤降。在重复出现问题上,从缓存嫁接只需 61 个解码 token,节约 6574 倍 token 开销和约 8700 倍能耗;同时可将有效上下文从 32768 扩展至 2.85M token,不增加加速器内存。

与同类方法的差异

本方法追求严格字节精确性,而非近似 KV 缓存压缩或概率性复用,因此能力无损、可保证,且将高成本推理结果转化为可移植、可审计的数字资产。

实验

实验设计

本文在两个冻结规模(Gemma-4-12B31B)上验证了 KV 状态嫁接(KV-state grafting) 的字节级精确性。实验覆盖三个层面:

  • 精确性验证:在固定确定性配置下,比较嫁接与全新计算的 logits 向量,要求 SHA-256 完全一致、KL 散度为零、argmax 一致。
  • 能力与成本:在 AIME 2025 数据集上评估嫁接验证解库后的准确率,并测量重复问题时节省的令牌和能量。
  • 系统鲁棒性:跨 GPU(H100B200)测试字节精确性与可移植性,以及路由器误导向和磁盘分页的影响。

关键发现

  • 在 AIME 2025 上,冻结的 12B 模型通过嫁接,准确率从 80.0% 提升至 93.3%,超越其自身基线(77.5%)和更大 31B 模型的公开成绩(89.2%)。
  • 对于 8 个基模型从未在 401,026 令牌预算内解决的问题,使用缓存验证解只需 61 个解码令牌,令牌量减少 6,574 倍,能量节省约 8,700 倍
  • 嫁接提供的字节级存储将可用上下文从 32,768 扩展到 2,854,766 令牌(87 倍),且无需额外加速器内存。
  • 代价方面,预填充获得 85.6 倍 补贴。精确性仅在 自有位置(own-position) 嫁接时成立,位置偏移会因浮点旋转编码引入微小残差。

基线对比解读

与常见升级(训练更大模型或增购加速器)不同,此方法不改变模型权重不增加硬件,同时获得能力提升与成本骤降。其 字节级精确性 是现有 KV 缓存复用方案(如 vLLM 的 prefix caching)无法保证的——后者仅追求语义等价,而本文实现了数学上可验证的 logits 一致,为知识资产的版本化、审计和跨系统复制奠定了工程基础。在能力上,93.3% 的 AIME 成绩证明已验证的知识库能显著提升小模型表现,甚至超过更大模型。但该提升严格依赖解库的存在,且位置精确性约束意味着在长上下文拼接时需仔细设计,这为实际部署划定了明确的边界。

行业影响

落地场景

字节精确 KV-Cache 移植(Byte-Exact Grafting) 将已验证的推理状态固化为可复用的数字资产,特别适合需要高质量、可重复、低时延响应的业务:

  • 智能客服与知识库问答:将法律条文解释、医疗指南、产品手册等高价值知识的正确推理路径预先封装成 KV 状态,用户提问时直接加载,免去重复计算。
  • 教育类自适应辅导:对典型错题或常见疑问,保存经过专家验证的解题步骤,学生咨询时一键还原完整推理,既保证学术严谨性又降低服务成本。
  • 合规与监管审查:金融、医疗等强监管行业,将合规审核逻辑的已验证推理链状态化存储,每次审计时准确重现,减少人工复核。

商业价值

核心收益来自推理成本的指数级下降服务质量的双重提升

  • 降本:重复出现的已知问题可从数千 token 的完整预填充压缩至个位数 token 的解码,能耗降低约 8,700 倍。对高频服务场景(如客服、搜索)可大幅削减 GPU 租赁或自建集群开支。
  • 提效:12B 小模型在 AIME 2025 评测中通过移植验证知识库,准确率从 80.0% 跃升至 93.3%,超越 31B 兄弟模型。同时上下文窗口可从 32K 扩展至 285 万 token 而无需额外显存,直接支持长文档分析、历史对话维护等需求。
  • 体验:毫秒级响应还原完整推理链,避免用户等待,尤其利于实时交互场景。

与现有产品/工作流的接口

Galahad 协议的设计兼容主流 LLM 推理栈,无需修改模型权重:

  1. 与推理引擎集成:可将 KV 状态存为二进制资产,插入 vLLM、TGI、NVIDIA Triton 等推理服务的预填充管道。引擎在接收请求时查询状态库,命中则跳过 prefill 阶段直接解码。
  2. 与知识库或向量数据库协同:知识条目的元数据可指向对应的 KV-Graft 哈希,检索增强生成(RAG)流程中,当检索到某条已知知识时,直接恢复其推理状态,替代重复生成。
  3. 跨节点/跨集群迁移:论文验证了在相同架构 GPU(如 A100→B200)间 KV 状态可按字节原样迁移,这为弹性扩缩容、多地部署提供了一致的缓存层。

典型场景示例

  • 电商平台商品导购:高频问题如“某品类退换货规则”的应答状态化存储,用户提问时瞬间给出标准合规回复,大促期间可节省 80% 以上 Token 预算
  • 医疗影像报告生成:对典型病例的影像描述与诊断建议,经专家逐一审核后固化为状态文件,医生查询时直接还原,避免每次从头推理,同时确保医学一致性。

局限

  • 方法强制要求**确定性配置**(pinned deterministic configuration),包括固定随机种子、禁用任何非确定性采样与 dropout 等。这种严格的位精确性约束在实际生产环境中极难保证,因为部署硬件、数学库版本、并行策略等微小的浮点操作差异都会破坏 byte-exact 属性,导致嫁接后的 logits 不再一致。当无法保证确定性时,论文中的零 KL 散度与完全自洽的论断将无法成立,限制了该方法在真实异构服务集群中的适用性。
  • 知识的飞轮效应依赖预先构造并验证的**高质量解题库**(verified solution library),这要求每个知识片段能被独立求解并验证正确性。在数学竞赛等可自动验证的场景中可行,但对于开放式对话、创意写作、代码生成等缺乏统一自动验证标准的任务,构建这样的库成本极高甚至不可行。此外,随着知识库增长,存储和检索开销会显著增加,论文未讨论大规模场景下的检索效率与缓存淘汰策略。
  • 嫁接操作与**位置严格绑定**(own-position graft 是唯一精确点),无法将一段 KV 状态无损地插入不同的上下文位置。这极大限制了复合推理时的灵活性:多个已验证片段无法按任意顺序组合以解决新问题,论文也明确记录**孤立拼接失败**(isolated stitching does not compose)。这本质是模型位置编码的浮点敏感性的体现,使得该方法难以泛化到需要动态上下文重排的任务。
论文Sietse Schelpe2026-07-15原文

相关内容