LLM层宽锥形递减在不增参数时提升性能
不增参数,仅将LLM前层加宽、后层收窄即可提升性能,挑战了均匀分配参数的惯例。
传统LLM各层参数相同,但研究发现层重要性不均。Mila等提出锥形语言模型,保持总参数量不变,让前馈网络宽度沿深度方向单调递减(从前到后变窄)。实验表明,这种"楔形"参数分布使困惑度从16.28降至15.96,证明参数位置比数量更关键。
正文摘录
.jpg) 编辑|Panda 2026 年 6 月,大模型行业迎来了一场开源浪潮:英伟达放出了 550B 参数的混合架构模型,谷歌送出多模态 Gemma 新版本,智谱用最宽松协议全量开源了自家旗舰模型。 几乎所有厂商都在讲同一个故事:用混合专家(Mixture-of-Experts, MoE)结构装下更多参数,用更稀疏的激活方式压低成本,用弹性网络宽度匹配不同部署场景。 换句话说,行业正在拼命研究「怎么把更多的参数,塞进同样的算力预算里」。 但一篇来自 Mila、康奈尔大学和蒙特利尔大学研究者的新论文,提出了一个几乎相反方向的问题:如果一个参数都不多加,只是把模型里已经存在的参数「挪个位置」,会发生什么?  - 论文标题:[Tapered Language Models](https://arxiv.org/abs/2606.23670) - 论文地址: 背景:被忽视的「一视同仁」 从 2017 年那篇开创 Transformer 的论文《Attention Is All You Need》开始,几乎所有的语言模型都共享同一种骨架——不管是经典 Transformer,还是后来的门控注意力、循环记忆网络,甚至是带「测试时记忆」能力的新架构——即把若干结构完全相同的「层」叠在一起,每一层分到的参数量都一模一样。