研究揭示混合线性注意力大模型激活尖峰与平台规律
研究揭示混合线性注意力模型中激活尖峰与平台的形成规律,为理解其内部计算和架构优化提供新线索。
研究者用大值激活(Massive Activations)作为探针,发现混合线性注意力模型中,全注意力(Full Attention)层的前一层会出现激活尖峰(PAS),且全注意力层越密集,尖峰之间越容易形成持续平台(ISP)。这一规律在多种模型和规模上一致,并在训练早期就已出现。
正文摘录
.jpg)  Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。 兼顾线性注意力(Linear Attention)的效率与全注意力(Full Attention)的建模能力,混合线性注意力大模型(HLA LLM)已成为 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等模型采用的一条重要架构路线。然而,当两类序列混合机制被交错放进同一个深层网络,它们会如何相互影响?少数 Full Attention 层又会怎样改变前后 Linear Attention 层的激活动态? 本研究由以 StartLux 为核心的联合团队完成。