NeurIPS 2025最佳论文:门控注意力提升LLM稳定性与长上下文性能
NeurIPS 2025 最佳论文奖:
注意力机制让语言模型决定每个位置哪些词重要,但它有局限性——例如,无论早期令牌的相关性如何,模型都会过度关注它们。
门控机制可以选择性抑制或放大神经网络中的信息流,已改进了其他架构,因此研究人员也尝试将其添加到注意力中。然而,之前的尝试通常将门控与其他架构变化打包在一起,使其具体贡献难以分离。
本文通过在密集模型和高达150亿参数的混合专家模型上系统测试30多种门控变体,分离了这些效应。
在标准Transformer层中,每个注意力头计算值的加权组合;头输出被拼接并通过最后的线性投影。论文确定的优胜方法是在拼接前插入一个额外操作:每个头的输出与从当前令牌表示计算出的学习门控相乘(逐元素或逐头,逐元素效果最好)。这使得每个头可以根据上下文抑制或保留其贡献。
这些架构变化带来了超出小基准增益的实际好处:
1. 训练更稳定,支持导致基线模型发散的学习率。
2. 门控还大大减少了"注意力沉没"——早期令牌吸收过多注意力的现象——这在使用标准技术扩展上下文窗口时,与长上下文基准的强劲改进相关。
在ChapterPal上阅读论文:
https://
chapterpal.com/s/c8685321/gat
ed-attention-for-large-language-models-non-linearity-sparsity-and-attention-sink-free
…
阅读PDF:
https://
openreview.net/pdf?id=1b7wh4O
SfY
…
注意力机制让语言模型决定每个位置哪些词重要,但它有局限性——例如,无论早期令牌的相关性如何,模型都会过度关注它们。
门控机制可以选择性抑制或放大神经网络中的信息流,已改进了其他架构,因此研究人员也尝试将其添加到注意力中。然而,之前的尝试通常将门控与其他架构变化打包在一起,使其具体贡献难以分离。
本文通过在密集模型和高达150亿参数的混合专家模型上系统测试30多种门控变体,分离了这些效应。
在标准Transformer层中,每个注意力头计算值的加权组合;头输出被拼接并通过最后的线性投影。论文确定的优胜方法是在拼接前插入一个额外操作:每个头的输出与从当前令牌表示计算出的学习门控相乘(逐元素或逐头,逐元素效果最好)。这使得每个头可以根据上下文抑制或保留其贡献。
这些架构变化带来了超出小基准增益的实际好处:
1. 训练更稳定,支持导致基线模型发散的学习率。
2. 门控还大大减少了"注意力沉没"——早期令牌吸收过多注意力的现象——这在使用标准技术扩展上下文窗口时,与长上下文基准的强劲改进相关。
在ChapterPal上阅读论文:
https://
chapterpal.com/s/c8685321/gat
ed-attention-for-large-language-models-non-linearity-sparsity-and-attention-sink-free
…
阅读PDF:
https://
openreview.net/pdf?id=1b7wh4O
SfY
…