Salesforce 研究:KV Cache 随机淘汰可媲美现有选择算法
随机删掉推理链条的历史 KV 缓存就能打平精心设计的淘汰算法,还省下打分开销、吞吐再涨三到四成。
推理模型输出数千 token 长链时,KV Cache(缓存历史 token 的键值表示,直接占显存)很快成为瓶颈。Salesforce 与 UIUC 提出 Random Attention:完整保留 prompt 的 KV,对模型自己生成的推理部分在每个 KV head 内独立随机保留,效果可媲美最强基线,vLLM 32k 场景下吞吐再提升 32%–43%。
正文摘录
.jpg)  大模型越来越会 "想",也越来越能把 GPU 显存 "想满"。 在数学、科学问答和代码生成等任务中,reasoning model 往往会生成数千乃至数万 token 的长推理链。随着生成持续进行,每个历史 token 对应的 Key-Value 表示都会进入 KV Cache,显存占用随序列长度不断增长。对于长推理部署来说,KV Cache 很快会变成真正的系统瓶颈。 一种直接的解决思路是 KV Cache eviction:给缓存设定固定预算,推理过程中不断判断哪些历史 KV 值得留下,其余永久删除。 过去几年的很多方法,核心都围绕同一个问题展开: 怎样更准确地判断一个 KV 将来还有没有用 ? 有的方法累计历史 attention,有的观察最近 query 的 attention,有的显式考虑 redundancy,还有工作进一步利用 value magnitude 或 key statistics。虽然打分方式不同,它们共享一个直觉:只要 importance signal 更准,就应该能留下更有价值的 KV。