稀疏 Delta 记忆:通过稀疏性扩展线性 RNN 的状态
线性注意力模型为每个 token 分配固定大小的状态和固定计算量。然而,由于其有限的状态大小,线性注意力模型在长上下文召回方面落后于基于 softmax 注意力的 Transformer 架构。增大线性注意力的状态大小可改善召回性能,但代价是更高的 FLOPs。 本文提出 Sparse Delta Memory (SDM),一种通过稀疏寻址方案将门控线性 RNN 的隐藏状态容量提升数个数量级的架构。SDM 扩展了 Gated DeltaNet,用稀疏读写操作替换了密集的键值外积,并引入一个大型显式记忆。 实验表明,在等 FLOP 约束和相同参数数量下,更高的状态记忆容量显著提升了上下文学习和长上下文检索任务的表现。此外,通过学习 SDM 记忆的初始状态并将其用作参数化记忆,模型在广泛常识与推理任务上进一步改进。
论文精读
TL;DR Sparse Delta Memory 用稀疏寻址将门控线性 RNN 的状态扩展到超大显式内存,在等算力下大幅提升长上下文学习与检索,并可作为参数记忆增强推理。
问题
线性注意力模型通过固定状态大小和恒定单 token 计算量提供了一种高效的长上下文处理方案,但在需要精确回忆长期信息的任务上,其性能仍落后于基于 softmax 注意力的 Transformer 架构。
现有方法如 Gated DeltaNet (GDN) 采用门控线性 RNN,将状态更新视为密集的 key-value 外积,把状态当作关联记忆。主要局限在于:状态维度直接决定记忆容量,但增加维度会导致 FLOPs 随状态大小平方增长,与线性注意力的效率目标冲突。单纯扩大状态不仅破坏计算预算,还难以与参数量解耦,导致在相同参数和 FLOPs 约束下无法有效提升长上下文回忆能力。
该问题的难度在于,必须在保持 O(T·d) 线性复杂度(T 为序列长度,d 为特征维度)的前提下,将有效记忆容量提升数个数量级,同时避免稀疏操作引入的负载不均与训练不稳定。工业界亟需一种能够在 isoFLOP 和同参数限制下显著增强 in-context learning 与长上下文检索性能的架构,这对构建高效代码助手、长文档分析等应用至关重要。
可将 SDM 类比为模型内部的 近似最近邻检索系统:就像向量数据库用稀疏索引处理海量嵌入,SDM 用稀疏寻址避免密集计算,以低廉成本大幅扩展状态记忆。
核心洞察
- 稀疏寻址让线性RNN的状态容量与计算量解耦。SDM 不再将隐藏状态限制在固定大小的矩阵中,而是通过稀疏读写操作将状态映射到一个远大于标准门控线性RNN的显式记忆体上。在isoFLOP和等参数量约束下,这打破了传统线性注意力模型“增大状态必增FLOPs”的瓶颈,使得长上下文召回和上下文学习能力显著提升,而计算效率得以保持。
- SDM 的可学习初始状态将记忆参数化,融合了参数记忆与序列处理。与传统线性RNN将初始状态置为零不同,SDM 在训练期间学习记忆的初始内容,相当于将部分世界知识直接编码进记忆体。这使得模型在常识推理等任务上额外获益,提供了纯序列模型无法得到的先验知识,表明稀疏状态扩展不仅可以增强上下文记忆,还能作为吸收静态知识的有效途径。
方法
从密集状态到稀疏记忆:SDM 计算流程
输入与投影:SDM 接收 token 序列,对每个 token 用线性层生成 查询 (Q)、键 (K) 和值 (V)。键的维度被划分为两个低维子空间,这是实现稀疏寻址的关键设计。
稀疏寻址与记忆读写:SDM 的核心是一个大型显式记忆体,其长度远大于隐藏状态维度。写操作时,利用产品键记忆 (Product Key Memory) 技巧,在划分后的键子空间内各自检索 top-k 活跃位置,再通过组合得到全局 top-k 的键槽。仅对这 k 个位置执行稀疏外积,将新值注入记忆体;读操作同样只从这些活跃槽读取值,形成稀疏加权和。该过程完全避免了全量键值外积,使记忆容量可独立于计算量扩展。
门控 DeltaNet 主干:SDM 建立在 Gated DeltaNet (GDN) 之上。GDN 的 Delta 更新规则只保留状态变化的关键部分,配合门控线性单元选择性地写入。在 SDM 中,GDN 的短程门控负责动态决定“写入多少”和“读取多少”,而显式记忆体提供长程存储;二者协同,实现高效的记忆更新与检索。
输出与初始化:记忆读取的输出与输入相关表征融合后送入 MLP,生成最终 token 表征。值得关注的是,记忆初始状态可被学习,使模型将常识与任务知识直接编码为参数化记忆,减少了上下文学习的压力,在常识推理任务中带来额外增益。
等 FLOP 设计原则:为保证公平,SDM 在匹配 GDN 总参数和每 token 计算量的前提下,通过调整层数、键/值头数与记忆体大小,将有效状态容量扩大数个数量级,同时不增加 FLOPs。
与同类方法的根本差异:常规密集线性注意力将状态大小与隐藏维度强绑定,扩大状态必然增加计算量;而 SDM 通过稀疏寻址打破了这一耦合,以固定每 token 计算成本获得超线性记忆容量,在长上下文学习与检索任务上显著优于等 FLOP 的密集线性 RNN,同时保留了比 Transformer 更低长序列复杂度的优势。
实验
实验设计
SDM 与基线 Gated DeltaNet (GDN) 在 isoFLOP 与 等参数量 条件下进行对比。评估任务覆盖:(1) 上下文学习 (in-context learning)、(2) 长上下文检索 (long-context retrieval,以 RULER 为主要基准)、(3) 常识与推理 (借助将记忆初始状态作为可学习参数)。消融实验剥离了记忆容量、状态尺寸、学习初始化、训练效率与自适应访问模式等因素的影响。
关键发现
- 计算可扩展性:SDM 在所有计算水平下均优于 GDN,性能随计算量呈幂律缩放。
- 记忆容量驱动性能:增大显式记忆的状态尺寸可稳定提升长上下文检索准确率,且短上下文性能不受损。
- 参数化初始状态:学习记忆的初始状态为模型注入先验知识,显著改善常识问答与推理任务。
- 稀疏访问效率:top-k 稀疏读写仅激活部分记忆槽,训练后向代价可控(见附录 A.3)。
与基线的深度对比
Gated DeltaNet 依靠稠密外积更新,其隐藏状态容量与嵌入维度刚性耦合,扩展状态只能增加维度,导致 FLOPs 迅速膨胀。SDM 打破这一限制:通过 Product Key Memory 式分组稀疏寻址,以相同参数和计算成本将状态内存提升数个数量级。这使得线性注意力模型首次在长上下文召回性能上接近 softmax 注意力 Transformer,且保有恒定的单 token 推理计算量。工程启示:对强上下文记忆需求的应用,可通过扩展显式记忆而非堆叠模型深度/宽度来提升性能,稀疏方案保证了训练与推理的实际可行性。
行业影响
核心影响定位
Sparse Delta Memory (SDM) 以稀疏寻址扩展线性 RNN 的状态容量,在不增加推理 FLOPs 的前提下显著提升长上下文回忆能力,使线性注意力架构有望在资源受限的场景中替代部分 softmax 注意力。
落地场景
- 长文档处理与对话系统:客服、法律、医疗报告等场景需长期记忆对话历史或整篇文档,SDM 能以固定计算量维持高精度检索,降低延迟与成本。
- 边缘与端侧推理:智能手机、IoT 设备的 AI 助手要求低功耗、低延迟,线性 RNN 天然适合,SDM 进一步缓解状态瓶颈,提升实用价值。
- 知识密集型应用:通过将初始状态学习为参数化记忆,SDM 可直接存储常识或领域知识,适用于教育、金融等需快速事实检索的场景。
商业价值
- 降本:等 FLOPs 下性能提升,意味着可用更小模型达到同等长上下文效果,节省训练与推理算力支出。
- 增收与体验提升:更好的长文本理解可驱动付费产品升级,如合同分析、个性化推荐,同时减少幻觉与信息丢失,提升用户信任。
- 部署灵活:与 softmax 注意力模型相比,线性 RNN 推理内存恒定且可流式处理,SDM 增强了长上下文竞争力,适合云端及混合架构。
与现有工作流集成
SDM 构建于 Gated DeltaNet 之上,可视为一种替代循环层的 drop-in 模块。集成路径:
- 替换现有 Mamba、RWKV 等线性 RNN 的底层状态更新逻辑。
- 训练时使用其块并行 + 块间递归的高效实现(已开源),推理时可直接用 C++ / CUDA 定制算子。
- 可部分替换 Transformer 层,形成混合 FullAttn + SDM 架构(论文已探讨),适配 HuggingFace、vLLM 等框架。
具体用例
- 电商智能客服:用户与客服的长时间对话常涉及多轮退换货、产品对比,SDM 可让线性 RNN 以极低计算成本保持全量历史,避免关键细节丢失,提升问题解决率。
- 金融研报与尽调分析:处理数百页的 PDF 报告时,SDM 能在单卡上高效执行关键信息抽取与交叉引用,助力分析师快速定位风险因子,缩短尽调周期。
局限
- 稀疏寻址在通用硬件上的 wall-clock 效率可能不如密集计算,文中提到了高效训练内核(two-pointer merge、chunkwise 分块),但仍需特定优化,这会限制在标准 GPU 集群上的直接部署与迭代速度,且实际吞吐量可能低于理论 FLOPs 收益。
- 稀疏 top-k 选择是一个关键超参数,不同任务、不同上下文长度可能需要不同的 k,目前固定 k 的设计缺乏自适应能力,文中 ablation 显示动态调整反而降低性能,这使得模型在面对未知分布时不够鲁棒,需要额外调参。
- 对比对象局限于 Gated DeltaNet,未系统性比较其他强线性 RNN(如 Mamba-2、H3)或带有记忆的混合注意力模型,因此无法判断 SDM 在这一大类方法中的相对站位;另外参数化初始记忆可能只在静态知识注入时有效,对需要连续更新的在线学习场景未必合适。