行业新闻

LLM层宽锥形递减在不增参数时提升性能

不增参数,仅将LLM前层加宽、后层收窄即可提升性能,挑战了均匀分配参数的惯例。

传统LLM各层参数相同,但研究发现层重要性不均。Mila等提出锥形语言模型,保持总参数量不变,让前馈网络宽度沿深度方向单调递减(从前到后变窄)。实验表明,这种"楔形"参数分布使困惑度从16.28降至15.96,证明参数位置比数量更关键。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/c25ab2a4-bdfa-4239-ad2d-df86923e17c5/085(2).jpg) 编辑|Panda 2026 年 6 月,大模型行业迎来了一场开源浪潮:英伟达放出了 550B 参数的混合架构模型,谷歌送出多模态 Gemma 新版本,智谱用最宽松协议全量开源了自家旗舰模型。 几乎所有厂商都在讲同一个故事:用混合专家(Mixture-of-Experts, MoE)结构装下更多参数,用更稀疏的激活方式压低成本,用弹性网络宽度匹配不同部署场景。 换句话说,行业正在拼命研究「怎么把更多的参数,塞进同样的算力预算里」。 但一篇来自 Mila、康奈尔大学和蒙特利尔大学研究者的新论文,提出了一个几乎相反方向的问题:如果一个参数都不多加,只是把模型里已经存在的参数「挪个位置」,会发生什么? ![图片](https://image.jiqizhixin.com/uploads/editor/0fdd4e1a-af84-4931-82e6-589ae0d82ebf/640.png) - 论文标题:[Tapered Language Models](https://arxiv.org/abs/2606.23670) - 论文地址: 背景:被忽视的「一视同仁」 从 2017 年那篇开创 Transformer 的论文《Attention Is All You Need》开始,几乎所有的语言模型都共享同一种骨架——不管是经典 Transformer,还是后来的门控注意力、循环记忆网络,甚至是带「测试时记忆」能力的新架构——即把若干结构完全相同的「层」叠在一起,每一层分到的参数量都一模一样。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-29原文

相关内容