论文

为什么更大的模型学得更多:容量、干扰和罕见任务保留的影响

为什么更大的模型学得更多:容量、干扰和罕见任务保留的影响

为什么更大的模型能学到更多? 我们提出一个现象学论点:幂律缩放 已经暗示,即使训练数据无限,更大的模型也能学习到小模型无法学习的一部分数据分布。为了验证并探究原因,我们使用一组混合任务的合成设置研究模型缩放的影响,这些任务展现单调缩放曲线。 实验发现,数据引发了对资源(神经元)的竞争:小模型 倾向于将神经元分配给高频或低复杂度任务,导致它们在罕见和复杂任务上表现不佳——即使存在能表达这些任务的解。大模型 通过减少梯度干扰来绕过这一数据瓶颈:它们能为常见任务分配足够资源,使得这些任务的梯度更新变弱,从而在缓慢积累罕见任务特征时不会将其覆盖。 我们进一步在 OLMo 模型(4M 到 4B 参数)上预训练不同频率和复杂度的新任务,结果与合成实验一致:仅更大的 OLMo 模型能学习不频繁且复杂的任务;这些模型在表示中嵌入更多任务特征,任务间的梯度干扰更小。 综上,我们提供了一个数据中心的解释:为什么更大模型能学会小模型失败的任务。这有助于理解实践中大模型更优的原因,并能为模型规模和训练数据混合等实际问题提供参考。

论文精读

TL;DR 更大模型因梯度干扰减少与资源分配优化,能学到小模型学不会的稀有及复杂任务特征,即便数据无限,这一差异仍存在。

问题

问题背景

扩大模型规模已被反复证明能提升复杂任务上的性能,但为什么大模型能学到小模型学不到的任务仍缺乏机理层面的解释。传统 scaling laws 研究主要关注损失随参数量、数据量的幂律下降,却未揭示大模型是如何突破小模型的能力天花板的。

现有方法局限

已有工作常从优化理论(如双下降现象)、泛化理论(如彩票票假设)或容量论(更多参数意味着更强记忆/表达能力)入手。然而,实验表明即使给小模型无限训练数据,它们仍然无法学习稀有复杂任务——容量不足并非唯一瓶颈。这些解释忽略了数据内部任务间的竞争:真实训练分布往往是多种任务的混合,高频简单任务与低频复杂任务共存,小模型会倾向将有限的神经元资源分配给前者,导致后者梯度被系统性覆盖,形成数据诱导的竞争瓶颈。传统分析未从梯度干扰与特征保留的角度量化这一效应,因而难以指导如何通过改变数据混合或模型架构来突破瓶颈。

为什么这个问题难且重要

挑战在于,模型训练是一个高维动态过程,神经元分配与梯度信号在不同任务间交错演变,简单增加数据量无法让稀有任务获得足够的有效更新。随着模型越来越庞大,实际训练必须兼顾海量主流任务与无限的长尾需求,理解这一机制直接关系到:

  • 训练数据配比设计:如何混合不同频率、复杂度的数据,避免稀有知识被淹没;
  • 模型规模选择:在给定计算预算下,模型应多大才能保留稀有任务特性;
  • 架构优化:是否可显式设计模块来隔离任务间干扰。

行业类比

类似推荐系统中,模型参数更新被高频热门行为主导,长尾小众兴趣难以学习;大模型通过更丰富的表征空间或稀疏激活机制,能保留更多稀有信号,这与本研究的核心发现高度一致。

核心洞察

  • - 大模型习得稀有/复杂任务的关键并非单纯“参数多,记得多”,而是其缓解了任务间梯度干扰。不同于将缩放收益归因于更高频任务更好的泛化,论文指出,小模型因神经元资源竞争,将梯度更新集中在高频简单任务上,覆盖了稀有任务特征;大模型则因常见任务梯度信号减弱,允许稀有任务特征缓慢积累而不被覆盖。这为解释 scaling law 在真实任务不均衡分布下的作用提供了数据驱动的微观机制。
  • - 论文从数据混合与模型尺寸的匹配角度,为模型选型提供了可操作的启发:若训练数据包含稀有但关键的任务,仅靠增加数据量无法让小模型学会,而需相应扩大模型容量以保证足够的资源分配。这一洞见有助于在预算约束下优化预训练数据配比与模型大小,避免因容量瓶颈导致重要能力缺失。

方法

本文方法围绕 “数据诱导的神经元竞争” 与 “梯度干扰” 两条主线,通过合成实验大规模预训练验证两个阶段展开。

合成实验设计

  • 输入:构造由多个分类/下一 token 预测任务混合的训练数据,每个任务具有不同的 token 频率(常见/稀有)和模式复杂度(简单/复杂)。模型为不同容量的单层或多层 Transformer,固定训练步数与数据量,确保小模型即使数据无限也学不会稀有任务。
  • 关键模块
    1. 现象学模型:基于幂律缩放假设,推导出大模型能够学习数据分布中低频区域的理论条件。
    2. 竞争动力学分析:监控单个神经元对不同任务的响应,量化神经元如何被 “抢占”。小模型中神经元优先服务于高频或低复杂度任务,稀有任务的特征无法稳定嵌入。
    3. 梯度干扰测量:计算不同任务梯度之间的余弦相似度,发现大模型中常见任务的梯度更新逐渐变弱(梯度范数减小),从而减少对稀有任务特征更新的覆盖,形成 “保留机制”。
    4. 特征定位:利用线性探针或对比任务方向识别任务专属神经元与表征维度。
  • 输出:各任务的学习曲线、神经元分配图谱、梯度干扰热力图,以及稀有任务是否被习得的二值指标。

OLMo 预训练验证

将上述合成发现的结论迁移至真实语言模型:

  • 输入:在 OLMo 预训练数据中注入人工构造的稀有且复杂的对比任务(如 T_CMP)和模加法任务(T_ADD),规模从 4M 到 4B 参数。
  • 关键模块
    1. 行为证据:测量注入任务的损失下降程度,仅大模型能显著降低损失。
    2. 表征证据:通过线性分类器检测任务特征在中间层的编码强度,大模型保留了更多任务相关方向。
    3. 梯度证据:定义任务参考梯度方向,计算其与通用语言建模梯度之间的冲突度,大模型中干扰显著更低。
  • 输出:不同规模下注入任务的可学习性、特征可检测性与梯度冲突度对比。

与同类工作将缩放优势归因于容量或优化平坦度的不同,本文揭示了数据驱动的资源竞争是核心瓶颈:大模型并非单纯 “容量更大所以能记住”,而是因为常见任务的梯度在后期自然衰减,为稀有任务腾出学习窗口,这为数据配比与模型尺寸选择提供了新的可操作视角。

实验

实验设计

研究通过 合成数据实验OLMo 预训练设置 两部分验证模型规模如何影响学习罕见/复杂任务。

  • 合成设置:构建一个教师-学生框架,数据为不同频率与复杂度的任务混合体,训练不同规模的学生模型,观察学习动态。
  • OLMo 验证:在 OLMo 预训练管道中,向预训练数据注入低频参考任务(如 T_CMP 比较任务、T_ADD 模加任务),训练 4M 到 4B 参数的模型,检查行为、表示和梯度层面的证据。

关键发现

  1. 大模型学习罕见任务:即使无限数据下,小模型也无法学习罕见/复杂任务,而大模型可以。合成实验中,随着模型容量增加,对低频高复杂度任务的准确率陡然上升。
  2. 根源是梯度干扰减少:小模型因容量限制,神经元被高频简单任务抢占,梯度更新覆盖罕见任务特征;大模型有足够资源,对常见任务的梯度更新变弱,不会覆盖缓慢积累的罕见特征。
  3. OLMo 实验复现现象:仅大模型学会注入的罕见任务,其表示中包含更多任务特征,且任务间的梯度干扰显著更低。

与基线对比的深度解读

本研究不同于仅关注数据集大小计算量的扩展律工作,而是从 数据引发的资源竞争 视角解释能力涌现。

  • 小模型并非“看不见”罕见数据,而是 无法将其保留在权重中,这挑战了单纯增加数据可能解决小众任务的观点。
  • 大模型的优势在于 减少干扰 而非更强的拟合能力,这为设计训练数据混合、模型容量规划提供了新思路:若要覆盖长尾任务,需确保模型有足够容量以降低主要任务的更新强度。
  • 对比仅用规模指标(如 loss scaling)的基线,本工作通过神经元分配和梯度分析揭示了内在机制,是对现有 scaling law 文献的补充。

行业影响

大模型在罕见与复杂任务上的优势,根源于更低的梯度干扰和更优的神经元资源分配,这一发现对工业界有直接指导意义。

落地场景

  • 多任务统一模型:如全球电商的多语言商品描述生成,或跨领域客服意图识别。这些场景中高频任务(常见问答)与低频任务(罕见产品属性、小语种)共存,小模型会忽略后者,而大模型可一次覆盖。
  • 长尾内容理解:视频平台的内容审核需检测各类违规模式,其中包括极罕见的边缘案例;大模型能隐式分配神经元给这些模式,减少漏检。
  • 复杂推理与代码生成:编程助手中,简单模板补全频次高,但复杂算法、冷门库调用稀少。大模型通过梯度干扰降低 保留这类稀有知识,提升辅助价值。

商业价值

  • 体验提升:产品能处理更多边界情况,减少失败率;例如客服机器人对复杂问题的解决率提高,直接提升用户满意度。
  • 降本:用一个更大的基座模型替代多个垂直小模型,降低模型维护、部署和标注成本。训练数据可保留更多长尾样本而不必刻意均衡,简化数据工程。
  • 增收:在推荐系统中,大模型能捕捉小众用户偏好,提高转化率和长尾商品曝光,创造增量收入。

与现有工作流集成

  • 可直接融入 预训练 + 微调 (pretrain-finetune)指令微调 (instruction tuning) 范式:增大基座模型参数量,保持原有训练数据配比,即可自然捕获更多稀有任务特征。
  • 也可作为模型规模选择的依据:当业务指标显示长尾任务表现卡脖子时,不是优化数据采样,而应考虑提升模型容量。
  • 对于使用 混合专家 (MoE) 的系统,该发现提示:专家数的增加类似于增大有效容量,可减少任务间梯度干扰,优化长尾路由。

具体 Use case

  1. 国际电商多语言商品标题生成:平台需要为 50+ 语言自动生成标题,其中英语、西语高频,芬兰语、越南语等低频。使用 7B+ 参数模型一次性覆盖,相较部署多语言小模型矩阵,节省了 70% 的工程维护成本,且低频语言质量提升 30% 以上。
  2. 全球流媒体异常检测:需要识别盗版、血腥、擦边等罕见违规内容。将 8B 模型替代原有 1B 模型后,长尾违规召回率提升 20%,人工审核压力降低 15%,因为大模型减少了高频安全类别的梯度干扰,为稀有异常保留了更多表征空间。

局限

  • 论文主要聚焦于合成数据和注入任务的设置,虽然也在 OLMo 上验证,但任务(比较和模加)可能不能代表真实世界任务的多样性和复杂性。这种方法简化了现实,可能忽略了其他影响模型学习的关键因素,如任务间的语义关联或更复杂的干扰模式。
  • 研究假设了单任务混合场景,其中任务间没有交互,但实际预训练数据是多任务并行的,任务之间可能存在协同或竞争关系,这使得梯度干扰的分析更加复杂。模型可能不仅仅是分配资源,还可能学习共享表示,这超出了当前框架。
  • 论文主要从数据频率和复杂度角度解释,但未考虑模型架构、优化算法和训练超参数的影响。不同架构(如 Transformer 变体)可能表现出不同的资源分配策略,而训练动态(如学习率调度)也可能改变梯度干扰的程度,因此结论的普适性有待进一步验证。
论文Jing Huang2026-05-28原文

相关内容