行业新闻

研究揭示混合线性注意力大模型激活尖峰与平台规律

研究揭示混合线性注意力模型中激活尖峰与平台的形成规律,为理解其内部计算和架构优化提供新线索。

研究者用大值激活(Massive Activations)作为探针,发现混合线性注意力模型中,全注意力(Full Attention)层的前一层会出现激活尖峰(PAS),且全注意力层越密集,尖峰之间越容易形成持续平台(ISP)。这一规律在多种模型和规模上一致,并在训练早期就已出现。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/0f64dc02-86b7-4320-a357-acd09832104e/05(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。 兼顾线性注意力(Linear Attention)的效率与全注意力(Full Attention)的建模能力,混合线性注意力大模型(HLA LLM)已成为 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等模型采用的一条重要架构路线。然而,当两类序列混合机制被交错放进同一个深层网络,它们会如何相互影响?少数 Full Attention 层又会怎样改变前后 Linear Attention 层的激活动态? 本研究由以 StartLux 为核心的联合团队完成。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-01原文

相关内容