腾讯开源HiLS-Attention,数学上解决稀疏注意力两大难题
腾讯开源HiLS-Attention,从数学根源解决分块稀疏注意力选chunk不准的难题,实现512倍长上下文外推且效果不减。
让大模型读得更长是刚需,但全注意力计算量平方增长。现有分块稀疏注意力选chunk不准,因为均值或最大值池化无法准确估计chunk内token分布。腾讯混元开源的HiLS-Attention提出分层地标表示,首次数学上解决估计精度和端到端可导问题。8K训练即可实现4M上下文外推(512倍),512K下prefill加速13.5倍,长检索任务甚至反超全注意力。
正文摘录
.jpg)  让大模型 “读得更长” 一直是 Agent、深度推理和海量资料整合等场景的刚需,但标准全注意力机制的计算量随序列长度呈平方级增长,始终是横亘在长上下文建模面前的三座大山。 本周,腾讯混元团队正式开源 HiLS-Attention(分层地标稀疏注意力),提出了一种全新的分块稀疏注意力范式,首次在数学层面上同时解决了 chunk 重要性估计的 “表达力不足” 和选择过程的 “端到端不可导” 两大根本难题,真正将稀疏注意力做到了 “Done Right”。 在 345M 至 7B 参数规模上的系统验证显示:HiLS-Attention 在短文本场景下语言建模困惑度(PPL)与全注意力几乎重合,在 8K 训练条件下可实现 4M 上下文(512 倍)免训外推,512K 上下文下的 prefill 与单步 decode 分别加速 13.5 倍和 15.7 倍。 更重要的是,该方法在部分长上下文检索任务上反超了全注意力本身 —— 效率与效果的 “二选一” 困境被首次同时打破。相关论文与代码已在 GitHub 上公开。