WhiteMatter:通过 KV 源混合实现的全对全跨层连接
Transformer 生成文本时,每一层都会产生过去 token 的表示,但每层通常只能使用同一深度的表示。这一限制使模型无法充分复用已经计算出的信息。 我们提出 WhiteMatter,允许每一层从任意深度获取过去 token 的表示。一个可学习的 mixer 会为当前上下文挑选最有用的深度,并把它们的表示合并进共享的 key-value(KV)cache 通道;跨层共享这些通道还可缩小 cache 体积。 在相同训练 token 数下,使用全尺寸 cache 的 WhiteMatter 与层数多 50% 的标准 Transformer 表现相当;当 KV cache 减半时,WhiteMatter 在两个模型规模(最大 1.3B 参数)上均优于匹配的标准 Transformer。 不过,跨层连接引入的依赖会拖慢训练与 prompt 处理。为此我们采用 cyclic iteration:轮流更新交错的 token 分组,同时并行处理各组内的 token。在以精确自回归执行训练的参考模型上,该方法的收敛速度比标准 Jacobi 迭代快 12.5 倍。
论文精读
TL;DR WhiteMatter 让每层注意力可从任意深度的历史 token 表示中混合出共享 KV cache,同等训练量下性能接近多 50% 层的标准 Transformer;半缓存时在 1.3B 规模胜出,并用 cyclic iteration 解决跨层依赖导致的训练变慢问题。
问题
当前大语言模型推理的核心矛盾之一,是 KV cache 随层数线性增长带来的显存压力,以及模型深度利用率不足导致的容量浪费。业界在追求更高 token 生成效率时,需要在不牺牲性能的前提下压缩缓存或提升每层表示的信息密度。
现有方法局限
标准 Transformer 中,每一层注意力只能访问同深度产生的 key/value,跨层表示彼此隔离。这带来两个直接问题:
- 信息重复编码:不同层往往需要重新计算相似的模式,无法直接复用已生成的中间表示,导致同等训练成本下模型容量利用率偏低。
- 缓存线性膨胀:若要提升容量,通常需要堆叠更多层,但每增加一层都会增加对应数量的 KV 缓存通道,使长上下文解码的内存开销急剧上升。
GQA / MQA 等压缩技术仅减少头数,不解决层间隔离;某些跨层共享 KV 的尝试要么以明显性能下降为代价削减层数,要么引入难以训练的串行依赖,削弱并行性。
为什么这个问题难且重要
允许任意层访问所有深度的 KV,本质上是把原本逐层前馈的计算图变成全连接时序依赖。这破坏了自回归训练和 prompt 预填充的并行性:标准 Jacobi iteration 收敛极慢,导致训练吞吐和 prefill 延迟不可接受。同时,解码阶段 KV cache 是显存瓶颈的主要来源,尤其在长上下文对话、代码生成等场景中,模型规模一旦超过数十亿参数,缓存容量直接决定部署可行性。
因此,需要一种既能跨层共享表示以减少缓存、又能在训练和推理中保持高效并行的方法。
行业类比:这与长上下文代码补全中,随层数增加导致显存耗尽而被迫截断上下文的情形类似;WhiteMatter 相当于为每一层建立可学习的“跨层缓存源混合”机制,用更少存储保留等效信息。
核心洞察
- WhiteMatter 通过让任意层的注意力可以混合来自所有深度的历史 token 的 KV 表示,将层间信息传递从逐层残差流扩展为可学习的全连接 KV source mixing。不同于标准 Transformer 每层只能使用同层 KV,也不同于单纯增加层数或 MoE 的横向扩展,WhiteMatter 用轻量 mixer 聚合不同深度的 KV 到共享通道,实现跨层信息复用;在 full-size cache 下性能可比拟 50% 更多层的标准 Transformer,同时共享通道还带来 KV cache 压缩空间,提供了一种同时提升模型表达能力和降低推理内存的新维度。
- 针对全连接跨层依赖导致的训练与 prefill 串行化问题,WhiteMatter 采用 cyclic iteration 将 token 分成 interleaved groups 轮流更新,组内并行处理,在逼近精确自回归执行的同时大幅加速收敛。与 Jacobi iteration 这类同步并行推演不同,cyclic iteration 利用分组交替更新的异步性,减少信息传播轮次;实验中相对标准 Jacobi 收敛快 12.5 倍,说明这种调度策略是让跨层全连接结构在工程上可落地的关键,而不只是理论建模。
方法
输入:在生成文本时,Transformer 每一层都会为历史 token 产生表示(past-token representations at every layer)。标准架构中,每层注意力只能访问同层产生的 key-value(KV)cache,限制了跨层信息复用。
关键模块:
- Cross-layer KV pool:构建一个跨层 KV 池,收集所有层产生的 KV 表示。
- Learned mixer:可学习的混合器(router)根据当前上下文动态选择最有用的层(depths),并将这些层的表示组合成共享的 KV cache 通道。
- Shared KV cache channels:组合后的 KV 通道在多层间共享,从而减少缓存大小;全尺寸缓存下,同等训练 tokens 时性能可比标准 Transformer 增加 50% 层数;半缓存下在两个模型规模(最大 1.3B 参数)上优于匹配的标准 Transformer。
- Cyclic iteration:跨层连接引入顺序依赖,导致训练和 prompt 处理变慢。该方法采用循环迭代策略,更新交错分组(interleaved groups)的 tokens,组内并行处理。在精确自回归执行训练的参考模型上,cyclic iteration 收敛速度比标准 Jacobi iteration 快 12.5 倍。
输出:每层注意力使用混合后的共享 KV cache 通道进行解码,实现任意深度表示复用。
与同类方法的差异点:不同于固定或手动指定的跨层连接方式,WhiteMatter 通过可学习混合器动态选择并混合不同层的 KV 表示,同时共享通道降低缓存占用,在效率与性能间取得平衡。
实验
实验设计
WhiteMatter 引入跨层 KV 池,允许每层从任意深度获取过去 token 表示,通过 learned mixer 动态选择并混合成共享 KV 通道。共享通道可降低缓存体积。实验在两种配置下评估:完整大小 KV cache 与半 KV cache,模型规模最高达 1.3B 参数。由于跨层依赖导致训练/prefill 难以并行,作者提出 cyclic iteration 方法,交替更新 token 组,组内并行。
关键发现
- 在完整 KV cache 下,WhiteMatter 以相同训练 token 数,性能与层数多 50% 的标准 Transformer 相当。
- 在半 KV cache 下,WhiteMatter 在两种模型规模上均优于匹配参数量/层数的标准 Transformer。
- 在参考模型上,cyclic iteration 收敛速度比标准 Jacobi iteration 快 12.5x。
与基线对比解读
WhiteMatter 的核心优势在于打破了层间 KV 隔离,允许高层直接复用低层已计算的表示,减少了重复计算,从而在相同缓存预算下提升容量利用率。与单纯增加层数相比,它通过横向连接而非纵向堆叠获得等效性能,更显参数效率。然而跨层依赖带来同步开销,cyclic iteration 虽然大幅缓解,但相比标准 Transformer 仍可能存在额外通信成本。该工作为后续高效架构设计提供了新的权衡思路。
行业影响
落地场景
WhiteMatter 直接适用于 LLM 推理服务,尤其是长上下文生成(代码补全、文档摘要、多轮对话)。KV cache 减半意味着相同显存可支撑更长上下文或更大 batch,适合对延迟与吞吐敏感的在线场景,例如电商平台智能客服、内容平台批量生成推荐理由、企业知识库问答。
商业价值
- 降本:KV cache 内存减半,直接降低 GPU 显存占用与单位 token 成本;推理吞吐提升可减少服务器数量或提高资源利用率。
- 质量保持:在 1.3B 参数下 half cache 仍超越匹配的标准 Transformer,说明性能损失可控,跨层复用甚至可能改善长程依赖建模。
- 对端侧/边缘部署的小模型,更小的缓存占用也提升了可行性。
与现有产品/工作流的接口
WhiteMatter 可作为 attention 子层的替换组件,无需改动整体训练框架。实现时需要将每层 KV 投影到共享通道,并加入轻量 router/mixer;推理引擎需支持跨层 KV 读取,但可通过共享缓存通道来兼容现有 KV cache 管理。cyclic iteration 适用于 prefill 阶段加速收敛,训练时可能需调整并行策略。
具体 use case:
- 电商平台智能客服:多轮对话强依赖历史 token,WhiteMatter 的跨层连接更有效利用过去表示,同时 half KV cache 降低显存,提高单卡并发会话数。
- 内容平台批量生成摘要/推荐理由:为海量商品或文章生成简介,推理成本敏感,缓存减半可显著降低单位生成成本并提高吞吐。
局限
- **验证规模有限**:论文最大模型为 1.3B 参数,尚未在更大模型(如 7B、13B、70B)上验证。跨层连接可能改变模型缩放行为,更大规模下优势是否保持未知。同时,实验主要关注语言建模和部分下游任务,缺少代码、数学等更复杂领域的评估。若需部署到生产环境,还需更多实证。
- **训练和推理效率的权衡**:虽然提出 cyclic iteration 加速收敛,但相比标准 Transformer 的并行训练/prefill,仍存在额外迭代开销。该方法在训练时可能增加 FLOPs 或内存占用,论文虽测量了 FLOPs 但未充分披露 wall-clock 时间对比。对实时推理场景,cyclic iteration 的收敛速度是否足够快?需要更多效率分析。
- **与同类跨层方法对比不足**:论文未与近期其他引入跨层连接或共享 KV 缓存的工作(例如 Feedback Transformer 等)进行系统对比,难以判断是否真正优于现有方案。此外,learned mixer 引入额外参数和计算,与简单共享固定深度相比优势需更明确论证。