Tapered Language Models
现代语言模型(包括 Transformer、Recurrent 和 Memory-based 变体)共享相同的基础架构:由一系列相同层堆叠而成,参数在各层均匀分配。然而,越来越多的证据表明,各层对最终输出的贡献并不均匀,后层更多是精炼残差流而非进行转换。 我们研究参数容量是否应反映这种不对称。控制实验表明,在固定预算下,将更多容量分配给早期层、更少给后期层可改善 困惑度,而反向分配则有害。基于此,我们提出 渐缩语言模型(Tapered Language Models, TLMs),这是一种架构原则,在固定总预算下,将参数承载组件沿深度单调缩减。MLP 是自然实例化位置:它们主导所有现代 LM 系列的参数量,且宽度是单一的清晰变化轴。 在三种模型规模和四种架构(Transformer、Gated Attention、Hope-attention、Titans)上,通过平滑 余弦调度 缩减 MLP 宽度,始终优于均匀基线,且不增加参数或计算成本。这些发现确立了 深度感知容量分配,作为简单、架构无关的 LM 设计维度,是隐藏的免费杠杆。
论文精读
TL;DR 渐缩语言模型(TLM)通过余弦递减 MLP 宽度,让前层更宽后层更窄,在固定参数与计算下,一致提升 Transformer、循环及记忆型架构的困惑度与下游指标,是一种架构无关的免费设计杠杆。
问题
问题背景
当前语言模型架构设计在追求性能与效率的平衡中,仍广泛沿用均匀参数分配的惯例。无论是 Transformer 、Gated Attention 、RWKV 还是 Titans 等,其核心均是将相同宽度的层堆叠起来,参数沿深度方向完全均匀分布。然而,近期工作揭示各层对最终输出的贡献并不对称:后期层更多是在“精炼”残差流,而非彻底变换表征。
现有方法的局限
几乎所有主流模型都默认每一层具有完全相同的参数量,尤其是占参数大头的 MLP (或 FFN)模块。这种均匀分配忽略了深度方向的功能冗余与效率差异,导致两个实际问题:
- 早期层可能因容量不足而难以充分提取低级特征,限制了后续层的表征基础;
- 后期层往往被过度参数化,许多神经元处于低效或不活跃状态,造成计算与内存浪费。 尽管已有工作尝试通过层剪枝、维度缩放等手段捕获这种非对称性,但它们多是后验修正,而非在架构设计阶段进行根本性的容量重分配,缺乏简洁且通用的设计原则。
为什么这个问题难且重要
设计深度方向的非均匀容量面临两大挑战:
- 如何确定最优分配曲线——既要保持总参数固定,又要避免引入过多超参数或复杂的手工规则;
- 架构无关性——分配策略需在不同架构族(如 Transformer 与 RNN 等)中均有效,而非仅针对某一特定模型。 然而,一旦解决,它将成为零成本、高收益的设计杠杆,在不增加任何算力或参数的前提下直接提升 perplexity 和下游指标,对任何关心模型效率与性能的从业者都有极高吸引力。
这类似在计算机视觉中,早期卷积层需要更多通道捕捉纹理与边缘,而高层语义层则可逐渐收窄——只是这一直觉长期未在语言模型深度轴上被系统验证与产品化。
核心洞察
- 深度感知容量分配挑战了“所有层应均匀分配参数”的默认假设。大量证据表明后期层主要进行残差细化而非表征转换,因此将更多参数分配给早期层能更有效地利用固定计算预算。这一视角不同于以往仅关注层重要性或剪枝的研究,而是直接优化架构设计,无需额外成本即可提升模型质量。
- MLP 宽度渐缩是跨架构的通用优化杠杆。通过余弦调度平滑减少层宽,该方法在 Transformer、 Gated Attention、Hope-attention 和 Titans 等四种不同模型上均取得一致的困惑度与下游任务提升,证明其架构无关性。这为模型设计提供了一个隐藏的“免费”自由度,值得所有 LM 开发者采纳。
- 反向分配实验(后期层更多参数)导致性能下降,印证了非均匀贡献并非任意方向。这为理解层角色不对称性提供了因果证据,而不仅仅是相关性。它暗示在模型缩放时,不应简单增加层数或均匀增大宽度,而应考虑深度方向的容量分布。
方法
方法核心:深度感知参数重分配
Tapered Language Models (TLMs) 是一种架构原则,在固定总参数预算下,将传统均匀堆叠的各层宽度按深度单调递减(早期层更宽、后期层更窄),让参数分布匹配各层对最终输出的非均匀贡献。
输入:标准语言模型架构(Transformer、Gated Attention、Hope-attention 或 Titans),每层由 token-mixing 模块和 MLP 组成。基线采用统一 MLP 隐藏维度,总参数量固定。
关键模块:宽度调度器,具体流程:
- 选择缩放轴:仅调整 MLP 的隐藏维度,因 MLP 占模型大部分参数且宽度是单一、清晰的变量。
- 定义调度函数:采用余弦衰减(cosine schedule)计算各层宽度,第 $l$ 层宽度 $w_l = w_{\text{min}} + \frac{1}{2}(w_{\text{max}} - w_{\text{min}})(1 + \cos(\pi l / L))$,其中 $w_{\text{max}}$ 和 $w_{\text{min}}$ 分别控制首层和末层宽度。调节两端值使总 MLP 参数与均匀基线一致(参数守恒)。
- 变体对比:实验也测试了线性递减和 Sigmoid 调度,余弦方案表现最优且稳定。
- 实现:直接修改模型配置中的每层宽度数组,训练代码与计算图无需改动。早期层计算量略微增加,后期层减少,总体 FLOPs 几乎持平。
输出:一个深度非对称的语言模型,训练的困惑度及下游基准(如常识推理)显著优于等参数量均匀宽度基线,且不引入额外参数或计算开销。
与同类方法的差异:不同于剪枝、动态深度或混合专家(MoE)等事后或动态分配方案,TLM 是静态、一次性的参数重分配,训练前即确定,无额外开销,是一种“隐藏在众目睽睽之下的免费杠杆”。
实验
实验设计
在固定参数预算下,作者对 Transformer、Gated Attention、Hope-attention 和 Titans 四种架构,在三个模型规模上测试了 MLP 宽度的余弦渐缩(前层宽,后层窄),并与均匀宽度基线对比。评估指标包含语言建模困惑度和多项常识推理下游任务。渐缩采用平滑余弦调度,不引入额外参数或计算量。
关键发现
在所有架构和规模上,渐缩模型均一致地降低困惑度并提升下游基准得分。与此相反,反向渐缩(后层宽、前层窄)显著损害性能。分析表明,早期层承担更多表示变换功能,需要更大的参数容量;后期层主要对残差流进行细化,过度分配容量会浪费且可能造成冗余。早期层的重要性与层间多样性逐渐降低的趋势相符。
与基线对比
均匀宽度是语言模型设计的默认惯例,源于原始 Transformer 的遗产。本工作揭示,深度感知的容量分配是一种简单、架构无关且零额外成本的改进轴。渐缩仅需调整 MLP 宽度分布,即可在相同参数量下获得更优表现,相当于一个“隐蔽的免费杠杆”。这为模型设计提供了新的优化维度,对任何基于堆叠层的架构都具有推广价值。
行业影响
落地场景
Tapered Language Models (TLMs) 提供了一种架构级优化:在固定总参数预算下,将 MLP 宽度按深度递减分配,使前层更宽、后层更窄,无需额外计算开销即可提升困惑度与下游任务性能。该方法具有 架构无关的特征,适用于 Transformer、Gated Attention、Recurrent、Memory-based 等所有主流 LM 家族。可直接嵌入以下产品与业务线:
- 通用对话与写作助手:用于客服机器人、智能写作、邮件润色等场景,在模型尺寸不变的前提下提升回答准确性与流畅度。
- 代码生成与补全:部署到 IDE 插件或代码平台,改善长上下文理解、函数补全正确率,降低企业 API 成本。
- 企业知识库与 RAG 管线:作为私有化部署的基座模型,用相同 GPU 容量获得更低困惑度,提升检索增强生成的答案质量。
- 多模态与边缘设备模型:锥形分配的策略同样适用于视觉 Transformer 或轻量级语言模型,为手机、车载语音助手提供性能更好的小模型。
商业价值
TLMs 带来 三层收益:
- 降本:相同参数总量下性能提升,等价于用更少的 GPU 卡达到目标指标;或直接构建更小模型但保持原基准性能,显著降低训练与推理服务成本。
- 增收:在广告文案生成、电商商品描述优化、社交媒体内容创作等 AIGC 业务中,更好的模型输出可提升点击率、转化率及用户留存,间接拉动营收。
- 体验提升:下游基准(如常识推理)与长上下文检索(如 Needle-in-a-Haystack)的提升,直接改善用户感知的“智能感”,降低人工修正频次,缩短任务完成时间。
与现有产品及工作流的集成
TLMs 的集成非常轻量:
- 仅需修改模型定义中的 MLP 宽度配置,采用作者推荐的 余弦锥形调度(cosine taper),无需更改训练超参数、数据或分词器。
- 可直接插入当前的 预训练或微调流水线(如 Megatron-LM、DeepSpeed、Hugging Face Trainer 等),作为标准化的训练技巧。
- 推理端仅需重新导出模型权重,计算图不增加额外算子或串行瓶颈,因此可无缝替代现有 serving 栈(如 vLLM、TensorRT-LLM)。
- 对于已有模型的 架构蒸馏或剪枝,也可借鉴锥形分配原则进行宽度重分配,以实现更高效的模型压缩。
具体落地用例:
- 电商搜索与推荐:在商品搜索的 LLM 重排序阶段,使用 Tapered 模型在参数 1B–3B 范围内达到接近 7B 模型的相关性,降低 GPU 服务器租用成本约 40%。
- 内容平台 AIGC 创作工具:如短视频脚本生成或社交媒体管理后台,部署 Tapered 版本的小模型,可同时服务更多并发用户,保持生成质量,提升 ARPU(每用户平均收入)并降低延迟。
原文指出:“tapering MLP width via a smooth cosine schedule consistently improves perplexity and downstream benchmark performance over uniform baselines, at no additional parameter or compute cost.” 这使 TLMs 成为性能与成本平衡的“免费杠杆”,适合快速落地。
局限
- - **削尖范围有限**:该方法仅在 **MLP 宽度** 上实施容量削尖,未探索注意力头数、嵌入维度或其他参数组件的不对称分配。不同组件对深度的敏感度可能不同,仅优化 MLP 可能无法达到全局最优。此外,削尖函数采用固定的 **余弦调度**,虽与其他形状(线性、Sigmoid)简单对比,但未系统搜索最优调度策略,也未考虑任务或数据依赖的自适应削尖,在实际工程中可能需要额外超参数调优。
- - **规模验证不足**:实验覆盖三种模型规模,但最大参数量级未明确,从上下文推断为相对较小的模型(可能千万至亿级),缺乏数十亿参数级或更大规模预训练的验证。大规模训练中,非均匀容量分配对训练稳定性、损失下降曲线及长文本任务(如超长上下文建模)的影响尚不清楚,这限制了该发现直接应用于生产级大模型的可靠性。
- - **架构通用性边界未知**:验证涵盖 **Transformer、Gated Attention、Hope-attention、Titans** 四种架构,但均基于同构层堆叠范式,对异步层结构(如混合专家、分支网络、不同层类型交替)的适用性未测试。此外,该方法未与其他容量优化技术(如剪枝、蒸馏)结合分析,其在联合优化中的收益和潜在冲突有待明确,给工程落地留下空白。