LLMs 作为噪声信道:香农视角下的模型容量与缩放定律
现有大型语言模型(LLM)的缩放定律主要是单调幂律,无法解释出现的非单调现象,如灾难性过训练和量化引起的退化,即尽管计算量增加但性能下降。 我们提出香农缩放定律,这是一个统一的理论框架,将 LLM 训练建模为通过噪声信道的信息传输,基于香农-哈特利定理。通过将模型参数映射到信道带宽,训练令牌映射到信号功率,我们的公式明确捕捉了学习信号与内在噪声之间的交互。这一视角揭示了 LLM 的基本香农容量:在不保持足够信噪比(SNR)的情况下扩展模型规模或数据量,必然会放大噪声,导致从单调改进到 U 形性能退化的转变。 我们通过在 Pythia 和 OLMo2 上添加扰动(包括高斯噪声、量化和在数学、问答、代码任务上的监督微调)验证了理论。香农缩放定律始终优于经典缩放定律和最近的扰动感知定律,实现了强 R² 分数,并准确捕捉了先前方法遗漏的损失盆地。它还具有外推能力:在 ≤6.9B 的 Pythia 模型上使用 ≤180B 令牌拟合,可以预测未见过的 12B 模型在高达 307B 令牌时的表现,池化 R²=0.847,而单调基线崩溃。
论文精读
TL;DR 将 LLM 训练视为噪声信道信息传输,基于香农-哈特利定理的香农缩放定律揭示了信噪比如何导致 U 型性能退化,预测准确率超越经典单调幂律。
问题
问题背景
LLM 的放缩定律(scaling laws)是决定模型规模与数据预算的核心依据,当前业界正从单调幂律假设转向对非单调性能退化(如过训练、量化降质)的建模,因为实践中发现盲目扩展未必带来提升。
现有方法局限
经典的 Kaplan 等幂律 $\mathcal{L}(N,D) \propto N^{-\alpha} + D^{-\beta}$ 假定损失随参数量 $N$、数据量 $D$ 单调递减,无法解释灾难性过训练或量化精度损失中出现的 U 形曲线。后续的扰动感知放缩定律通过引入噪声项进行修正,但大多停留在加性扰动的层面,未从信息论视角建模信号与噪声的交互。这导致:
- 对 损失盆地(loss basin)位置的预测失准
- 在噪声主导区域拟合精度低,且外推能力差
- 无法揭示模型容量存在的香农极限
为什么这个问题难/重要
LLM 训练本质是从有噪数据中提取信号,参数规模 $N$ 与数据量 $D$ 之间隐含信噪比(SNR)权衡。噪声随规模动态变化,单调假设彻底失效,这使得预测性能拐点极为困难。在千亿参数级训练中,一次错误分配可能浪费数百万 GPU 小时。因此,亟需一个基于香农-哈特利定理的统一框架,将训练建模为带噪信道信息传输,从容量而非单纯损失角度解释并预测非单调现象,并具备高精度外推能力。
行业类比
可将 LLM 训练类比为在嘈杂信道中传输高清视频——盲目提升分辨率(参数)或传输帧数(数据)而不改善信噪比,只会满屏雪花;同样的,通信系统设计中的带宽-功率-噪声三角权衡恰好映射到模型容量、数据量与隐式噪声的交互。
核心洞察
- 将 LLM 训练建模为噪声信道的信息传输,用香农-哈特利定理统一解释非单调性能变化。传统幂律缩放定律只描述单调改善,无法捕捉过训练、量化等导致的性能下降。该理论通过参数(带宽)与数据(信号功率)的信噪比交互,首次揭示出缩放存在基本容量限制:信号不足时扩大模型反而放大噪声,自然衍生出 U 形损失曲线。这种统一的容量视角超越了针对特定扰动单独拟合的既有方法,为理解缩放失效提供了更本质的信息论基础。
- 香农缩放定律在噪声环境下的预测准确性和外推能力远超经典单调定律。实验显示它不仅拟合 R² 更高,还能捕获损失盆地等传统方法遗漏的结构。更重要的是,仅用 ≤6.9B 模型、≤180B tokens 的数据拟合,即可准确预测 12B 模型在 307B tokens 时的表现(pooled R²=0.847),而单调基线完全失效。这证明了引入信噪比交互项的必要性,直接启示工程实践:单纯缩放模型规模是危险策略,必须在提升容量的同时确保足够的信号质量,否则计算投入反而有害。
方法
方法核心:将 LLM 训练建模为噪声信道传输
输入:模型参数量 N、训练 token 数 D,以及可选的外部扰动因子 X(如高斯噪声强度、量化精度、微调学习率等)。
关键模块与信噪比映射:
- 带宽映射:将模型参数量
N类比为信道带宽W。带宽越大理论上可传输的信息越多,但若信号功率不匹配,则噪声被同步放大。 - 信号映射:将训练 token 数
D类比为信号功率S。更多的数据提供更强的学习信号,但信号增益受带宽限制。 - 噪声建模:总噪声
Δ由两部分组成——固有噪声(权重初始化、优化随机性)和外部扰动(添加的噪声、量化误差、SFT 导致的灾难性遗忘等)。噪声与带宽交互,形成N与D的交叉项,而非传统幂律中独立的两项。 - 容量公式:基于 Shannon-Hartley 定理,信道容量
C = W · log(1 + S/Δ)。对应到 LLM,容量C代表模型在给定(N,D)和噪声水平下可达到的信息传输上界。
输出:将容量 C 通过单调变换连接到验证损失 L(N,D),得到非单调的损失预测曲线。该公式显式包含 N 与 D 交互项,能够在信噪比(SNR)下降时自动产生 U 形损失山谷——即模型放大或数据增加反而导致性能退化。
与同类方法的差异:
传统缩放定律(如 Chinchilla、Kaplan 等)均基于单调幂函数,无法解释过训练或量化退化现象。Shannon 定律通过引入“带宽-信号-噪声”交互项,从物理信道模型层面推导出非单调行为,且仅用少量参数即可准确捕捉损失盆地和跨模型外推,在 Pythia 和 OLMo2 上拟合 R² 显著优于幂律及扰动感知型基线。
实验
实验设计
作者选用 Pythia 和 OLMo2 系列模型,通过三种扰动类型——高斯噪声注入、量化 (不同精度)、监督微调 (SFT,涵盖数学、QA、代码任务)——人为制造非单调的训练行为。在 ≤6.9B、≤180B tokens 的模型上拟合 Shannon Scaling Law,并与经典单调幂律和近期扰动感知律对比。部分实验将拟合外推至未见过的 12B 模型及 307B tokens,验证泛化能力。
关键发现
- 损失景观的 U 形曲线:在高噪声 (低 SNR) 下,增大模型或数据反而损害性能,出现损失谷底 (loss basin),经典缩放律完全无法解释。
- 统一容量解释:Shannon 框架将模型参数映射为信道带宽,训练 token 为信号功率,揭示了 SNR 决定有效容量——当噪声主导时,额外资源只会放大噪声。
- 强健的外推能力:在仅使用 ≤6.9B 模型拟合后,成功预测 12B 模型在 307B tokens 上的表现,pooled R²=0.847,而单调基线在未见模型上彻底崩溃。
与基线对比
经典单调幂律 (如 Chinchilla) 在干净预训练场景尚可工作,但在噪声加入后完全无法捕捉 U 形退化。近期扰动感知律 (如考虑量化或过训练) 虽然引入了部分非线性,但仍缺乏噪声-容量交互项,无法精确刻画出“缩放何时有害”的临界点。Shannon Scaling Law 通过显式建模信号-噪声交互项 D·N 项,准确捕捉了从单调提升到性能滑坡的相变,且参数更高效 (仅需少量额外系数)。指数分析进一步表明:在噪声环境下,模型缩放反噬 (γ>α) 而数据噪声始终胜出 (δ>β),为工程调参提供了方向性指导。
行业影响
落地场景
Shannon Scaling Law 为 LLM 训练与部署中的资源分配决策提供了理论指导,核心应用场景包括:
- 预训练终止判断: 当信噪比 (SNR) 低于临界值时,模型继续扩大规模或增加训练 tokens 反而会放大噪声,引发灾难性过度训练,该定律可提前预警并建议停止训练。
- 量化精度选择: 对于不同位宽的量化方案,能预测量化退化的 U 型曲线,帮助在延迟–精度 trade-off 中找到最佳点。
- SFT 超参配置: 在不同学习率、数据分布下,可识别哪些指令微调组合会破坏预训练知识,避免对齐税。
商业价值
- 降本: 通过在 $D$–$N$ 空间中精准定位损失盆地,避免无效计算投入。实验显示外推可节省对 12B 模型多余 307B tokens 的训练试错成本。
- 提效: 在量化部署场景,该定律确保模型在压缩到 INT4/INT8 时仍维持可接受的 SNR,减少重训开销,使模型上边缘设备的速度提升 2-4 倍而精度损失可控。
- 体验提升: 对内容推荐、代码补全等实时应用,通过噪声感知缩放可让服务在更低延迟下保持同等生成质量。
与现有产品 / 工作流的接口
可封装为MLOps 工具链插件,与主流实验管理系统(如 Weights & Biases、MLflow)集成:
- 训练阶段: 实时采集
loss、model size、token count,计算 SNR 和预测曲线,在监控仪表盘中高亮即将进入非单调区域。 - 评估阶段: 对已训练模型的不同精度副本,自动拟合 Shannon 缩放面 并建议最优量化配置。
- 部署后监测: 结合数据漂移检测,动态更新 SNR 曲线,触发主动重训或回滚策略。
具体落地 Use Case
- 云大模型平台 (如 Vertex AI): 为客户的自监督预训练作业提供“信噪比预算”看板。当客户提交
base model + dataset后,根据少量 scaling 曲线采样,平台即可估算出该任务在给定 GPU-hours 下可达到的最优 loss,并自动中止将进入噪声放大阶段的作业,为客户节省 20-30% 的算力费用。 - 智能终端助手 (如 AI 手机): 在部署端侧 LLM 时,厂商常面对 2-bit 还是 4-bit 量化的抉择。集成该定律的工具可直接对候选模型输出“精度-噪声”曲面,辅助选定符合 10ms 首 token 延迟且困惑度劣化 < 3% 的位宽,大幅缩短发布前调优周期。
局限
- 理论框架将训练噪声主要建模为高斯噪声,并假定信噪比与模型大小、数据量呈特定函数关系,但实际大规模预训练中的噪声来源复杂(如数据爬取错误、标注偏差、多源分布偏移),其统计特性可能显著偏离高斯假设,影响模型在真实场景下的适用性。论文目前仅在单一扰动类型(高斯噪声、量化、SFT)下验证,尚未探讨多种噪声叠加的交互效应,限制了框架的通用性。
- 实验验证集中在 Pythia (≤12B) 和 OLMo2 系列模型,最大训练 token 数为 307B,缺乏在更大规模(如 70B+)或万亿 token 级训练上的测试。由于高阶缩放效应(如涌现能力)可能在更大规模才明显,该定律的外推能力在此范围内尚未经受检验。此外,SFT 实验仅覆盖数学、QA 和代码三类任务,任务多样性有限,对通用语言能力的刻画可能不足。
- 香农缩放定律涉及 6 个自由参数,尽管论文提出了 4 参数的简化版,但在数据点稀疏或噪声环境不稳定时,多参数拟合容易过拟合,且参数之间的耦合可能降低拟合的鲁棒性。与经典单调幂律相比,其模型复杂度增加,对实验设计和数据质量的要求更高,可能不适用于早期阶段的快速 scaling 探索。