论文

HLA: 通过分块动态混合实现的可表达混合线性注意力

HLA: 通过分块动态混合实现的可表达混合线性注意力

线性注意力 通过将历史压缩为递归状态实现高效的长上下文自回归解码,但这种压缩使得对稀疏、远距离信息的选择性访问变得困难。现有的基于分块的扩展虽提升了记忆容量,但学到的分块混合系数可能与输入内容无关,因而无法针对每个 query 自适应地访问历史。 为此,作者提出 混合线性注意力(HLA),一种面向 Gated DeltaNet(GDN) 的、query 相关的分块级注意力机制: - HLA 将每个已完成的分块表示为精确的仿射状态转移,并从紧凑的、经自注意力池化的代表向量中计算内容相关的路由门控。 - 每个门控将对应历史转移与恒等映射进行插值,同时控制该分块的加性记忆以及它对更早状态的变换。 - 有效支撑正则化 进一步促使路由集中,以支持稀疏推理。 实验在预训练适配和从零训练两种设定下评估 HLA。在 0.8B 到 9B 的 Qwen3.5 模型上,HLA 一致优于原生 GDN 与固定分块混合,在 LongBench-V2 上提升最多 5.57 个百分点,在 RULER 上提升 3.97 个百分点。在受控的从零训练 1.3B 设定(100B tokens、4K 上下文)中,HLA 也能将 RULER 的表现从 4K 拓展到 32K,增益由 4K 时的 0.83 个百分点升至 32K 时的 4.22 个百分点。 结果表明,query 相关的递归记忆组合能够改善长上下文建模,在使用紧凑的逐分块仿射摘要的同时,其有效性可延伸到训练上下文之外。项目主页:https://caesarhhh.github.io/hla/

论文精读

TL;DR HLA 为 Gated DeltaNet 引入查询依赖的 chunk 级注意力,用紧凑仿射状态转换与内容路由门控,在 LongBench-V2/RULER 上最高提升 5.57/3.97 个百分点,并支持稀疏长上下文推理。

问题

问题背景:线性注意力通过将历史压缩为固定大小的循环状态,实现了 O(1) 解码开销,是长上下文高效推理的重要路线。但其压缩本质导致模型难以有选择地访问稀疏且远距离的信息。

现有方法局限:基于 chunk 的扩展(如 Gated DeltaNet)虽增加了记忆容量,但 chunk 混合系数通常是固定的或仅依赖位置,与输入内容无关。这意味着每个查询对所有历史 chunk 的访问权重无法动态调整;当需要定位特定远距离事实时,固定路由可能无法聚焦到相关 chunk,同时早期状态在逐 chunk 变换中被逐渐稀释,形成信息瓶颈。

为什么这个问题难/重要:核心挑战在于同时保持线性注意力的高效解码和引入查询依赖的选择性。动态路由会带来额外计算和稀疏性约束,若设计不当会破坏 O(1) 推理优势。业界对 RULER、LongBench-V2 等长上下文基准的提升有明确需求,而动态记忆组合正是提升长程建模能力又不牺牲效率的关键方向。

行业类比:类似向量数据库中的查询式索引选择——每个 chunk 维护紧凑摘要,查询到来时动态选择最相关的若干摘要参与计算,避免全表扫描的同时提供比静态索引更精准的召回。

核心洞察

  • **查询依赖的动态块混合** 是 HLA 的核心设计,它让线性注意力在压缩历史时仍能根据当前 query 选择性访问远距离信息。与已有 chunk-wise 方法(如 Gated DeltaNet 原生状态或固定块混合系数)不同,HLA 将每个完成的 chunk 表示为精确仿射状态转移,并用自注意力池化的紧凑代表计算内容相关路由门控。该门控在历史转移与恒等映射之间插值,既控制块的加法记忆,也控制其对早期状态的线性变换,实现查询条件下对记忆成分的动态组合。这突破了固定混合无法适应不同查询的局限,同时保持线性复杂度。
  • **有效支持正则化** 把路由稀疏性直接纳入训练目标,使模型在推理时仅激活少数相关 chunk,而不是依赖事后剪枝或硬件级稀疏。HLA 的门控被鼓励集中分布,从而减少每个 query 需要访问的块数量,在长上下文部署中同时降低内存带宽和计算开销。实验显示,该方法在 Qwen3.5 0.8B 到 9B 的预训练适配中取得 LongBench-V2 最高 5.57 个百分点提升,并在 4K 训练、32K 评估的 from-scratch 实验中带来 4.22 点增益,证明稀疏路由不仅能提升精度,还具备外推能力。紧凑的每块仿射摘要使存储开销远低于保留完整 KV 缓存。

方法

HLA 在 Gated DeltaNet(GDN)基础上引入 query-dependent chunk-level attention,输入为已完成 chunk 的紧凑代表向量与当前 query。

核心流程:

  1. Chunk 表征:将每个历史 chunk 编码为一个精确的 仿射状态转移(affine state transition),同时从 chunk 内 token 通过 self-attentive pooling 得到紧凑代表向量。
  2. 动态路由门控:对每个 query,用其与各 chunk 代表向量计算注意力分数,生成 content-dependent routing gates(每个 gate 与对应 chunk 的仿射转移绑定)。
  3. 记忆合成:每个 gate 将该 chunk 的仿射转移与 identity map 做插值,既控制该 chunk 对当前状态注入的 additive memory,也控制它对更早状态的变换程度——等价于 query 相关的历史记忆选择。
  4. 正则化:Effective-support regularization 促使 routing gates 集中,在推理时可跳过贡献小的 chunk,实现稀疏解码。

输出为 query-adapted 的隐状态,用于后续预测。

跟同类方法的差异点:相对于固定 chunk mixing 或内容无关的 learned 系数,HLA 的 chunk 选择是 query-dependent 且使用精确仿射总结,历史访问随每个 query 动态变化。

实验

实验设计

实验覆盖两条主线:预训练模型适配 与 从零训练。

  • 预训练适配:在 Qwen3.5 系列(0.8B 至 9B)上,将原生 Gated DeltaNet (GDN) 替换为 HLA,并与固定的 chunk mixing 方法对比。
  • 从零训练:训练 1.3B 参数模型,数据量 100B tokens,训练上下文 4K,重点评测 RULER 在 4K 至 32K 的外推表现。

关键发现

  • 在 LongBench-V2 上,HLA 相对原生 GDN 和固定 chunk mixing 的提升最高达 +5.57 个百分点。
  • 在 RULER 上,提升最高达 +3.97 个百分点。
  • 从零训练的 1.3B 模型中,RULER 得分从 4K 时的 +0.83 增长到 32K 时的 +4.22,说明查询依赖的 chunk 组合在训练上下文之外依然有效。
  • 使用紧凑的 per-chunk affine summary 即可实现上述收益,未带来昂贵的额外存储。

基线对比解读

固定 chunk mixing 无法根据 query 动态调整历史访问,而 HLA 的 query-dependent routing gate 能让每个 chunk 选择性地提供 additive memory 或变换早期状态。该差异在长上下文稀疏检索场景下被放大:HLA 通过 effective-support regularization 鼓励稀疏路由,推理时更聚焦;固定混合则可能平均无关历史信息。外推实验表明,这种动态组合比固定系数更稳健,适合部署在需要长上下文流式解码的生产系统。

行业影响

落地场景

HLA 适用于需要长上下文理解与高效推理的场景,如 企业级文档问答、多轮对话系统、长视频理解与代码库分析。具体 use case:某电商平台使用基于 HLA 的客服助手处理包含数百条历史订单、商品描述与用户偏好的超长会话,提升复杂咨询的首次解决率;某内容平台部署 HLA 模型进行长视频自动摘要与章节划分,减少人工审核成本。

商业价值

核心价值在于 推理成本大幅降低 与 长上下文任务效果提升。线性注意力复发状态压缩使长序列解码的显存和计算从二次降为线性,配合 稀疏路由 可进一步减少有效计算;在 LongBench-V2 / RULER 上最高 5.57 和 3.97 个百分点的提升,直接转化为更稳定的长文档处理与检索增强生成质量,支撑更高价值的专业服务定价。

与现有工作流接口

HLA 以 Gated DeltaNet (GDN) 为基础,可作为现有线性注意力模型的 drop-in 替换模块,尤其适合已使用 GDN 或固定 chunk mixing 的生产系统。其 per-chunk 仿射状态 可预计算并缓存,且 query 侧门控可与 chunk 注意力并行,适合接入 vLLM / TensorRT-LLM 等推理引擎,或作为混合架构中的长程记忆组件,与 Transformer 局部注意力结合。

局限

  • **HLA** 的设计紧密绑定 **Gated DeltaNet (GDN)** 的 chunk-wise affine transition 表述,迁移到其他线性注意力模型(如 **Mamba** 或 **RWKV**)时需要重新推导状态表示与路由机制,通用性受限。论文未展示在非 GDN 骨干上的实验结果,无法验证该方法是否具备跨架构的有效性。 - 对实际工程的启示:若团队已有基于其他线性注意力的长上下文模型,引入 HLA 需额外适配成本,且收益不确定。 - 与同类工作对比:**GLA**、**HGRN** 等模型采用不同的状态更新规则,HLA 无法直接复用其 chunk-level 动态混合策略。
  • **HLA** 引入的 **self-attentive pooling** 和 **chunk-level attention** 增加了每层的前向计算量与内存占用,虽然作者强调使用 compact per-chunk affine summaries,但未在实验中详细对比不同 chunk 大小下的推理延迟与吞吐。 - 可推断的局限:动态路由 gate 的计算依赖于 query 与所有历史 chunk representative 的交互,即使稀疏化后仍需维护 chunk 索引与检索结构,实际部署时可能抵消部分线性注意力的效率优势。 - 论文未报告在标准 GPU 上、批处理场景下的推理速度对比,仅提供算法复杂度分析,缺乏真实硬件验证。
  • **Effective-support regularization** 的关键超参数(如稀疏惩罚系数)在不同模型规模和训练阶段可能需重新调优,论文未给出敏感性分析或自适应策略。此外,模型在 **4K** 上下文训练后外推至 **32K** 的实验中,虽然提升幅度随长度增加而增大,但绝对分数仍可能低于原生长上下文模型,且未与直接训练更长上下文的 GDN 基线对比。 - 可推断的局限:稀疏正则化可能过度限制有效历史长度,导致某些需要广泛上下文的推理任务(如多跳问答)性能下降。 - 与同类工作对比:**RetNet**、**TransNormer** 等模型通过固定衰减或归一化实现外推,HLA 的动态路由机制可能在外推时产生不稳定 chunk 贡献。
论文Zhuokun Chen2026-10-05原文

相关内容