关于模型规模扩展定律的深度思考
关于规模定律的思考
规模,但不仅仅是参数。每次模型发布现在都以同一个问题结束:多少参数?这不是一个能单独回答的问题。参数数量只有在与其他三个问题一起考虑时才有意义——你有多少数据,你打算在哪里使用计算,以及谁将在什么条件下运行模型。
这个领域是通过惨痛教训学到这一点的。Kaplan等人(2020)拟合了一个指数,告诉所有人参数增长应快于数据——大约2.7:1——业界也照做了:GPT-3、Gopher、MT-NLG。Hoffmann等人(2022)在四百个模型上重新做了实验,发现计算最优的分配更接近每个参数20个token,而且在充足计算下,两者应以相同速度增长,而不是逐渐背离。早期拟合的错误随着每个数量级的计算而加剧,这就是为什么那一代最大的模型配置错误最严重。回想起来,万亿参数一轮是整个领域共同走过又逆转的弯路。
Chinchilla也不是终点。它优化的是那些训练一次然后评估的模型的训练计算。如今一个模型每天被调用数十亿次,推理在生命周期成本中占主导地位。把推理纳入目标,最优解就转向训练时间更长的更小模型——刻意过度训练,这正是Llama-2-7B和Gemma-2-9B所做的,分别约为每参数290和889个token。
稀疏性再次移动了目标。在MoE模型中,必须区分两个量:总参数大致决定模型能容纳多少——知识、事实、长尾——而激活参数和有效深度大致决定它能思考多远,能在断裂前携带多少步因果链。密集模型20:1的比例并不能直接迁移。而且这个比例根本不是一个单一数字:Roberts等人(2025)发现最优的每参数token数取决于任务,记忆任务偏好更多参数,推理任务偏好更多数据。后续关于MoE的研究观察到,在固定TPP下,提高总参数实际上会损害推理能力,而激活更多专家则可靠地帮助推理。
这对我们正在构建的目标很重要。发现漏洞不是一个检索问题。它并非来自记忆更多的CVE;而是来自不丢失线索地将一个二十步的推理链进行到底。这种能力并不存在于总参数数量中。
这让我们回到这次发布。总参数似乎重要到某个阈值——足以容纳世界——之后额外的能力来自其他方面的扩展:每次前向传播的有效深度,尤其是后训练。GLM-5.3是我们对这一主张的受控实验。与GLM-5.2相同的基础、相同的架构、相同的总参数和激活参数。一个月的时间用于扩展长时程环境和RL。收益并非微不足道。好吧,规模不止一个旋钮。这次我们转动了后训练这个,因为它还有最大的余地——不是因为其他旋钮已经用完。基础模型大小、预训练数据、每次前向传播的计算:这些都仍在桌面上,我们会逐一回来处理。这个实验教会我们的是,旋钮不必一起转动,而且下一个值得转动的旋钮很少是上一个值得转动的那个。我们还没有完成扩展。下次,也许是中期训练、预训练,甚至更多。
规模,但不仅仅是参数。每次模型发布现在都以同一个问题结束:多少参数?这不是一个能单独回答的问题。参数数量只有在与其他三个问题一起考虑时才有意义——你有多少数据,你打算在哪里使用计算,以及谁将在什么条件下运行模型。
这个领域是通过惨痛教训学到这一点的。Kaplan等人(2020)拟合了一个指数,告诉所有人参数增长应快于数据——大约2.7:1——业界也照做了:GPT-3、Gopher、MT-NLG。Hoffmann等人(2022)在四百个模型上重新做了实验,发现计算最优的分配更接近每个参数20个token,而且在充足计算下,两者应以相同速度增长,而不是逐渐背离。早期拟合的错误随着每个数量级的计算而加剧,这就是为什么那一代最大的模型配置错误最严重。回想起来,万亿参数一轮是整个领域共同走过又逆转的弯路。
Chinchilla也不是终点。它优化的是那些训练一次然后评估的模型的训练计算。如今一个模型每天被调用数十亿次,推理在生命周期成本中占主导地位。把推理纳入目标,最优解就转向训练时间更长的更小模型——刻意过度训练,这正是Llama-2-7B和Gemma-2-9B所做的,分别约为每参数290和889个token。
稀疏性再次移动了目标。在MoE模型中,必须区分两个量:总参数大致决定模型能容纳多少——知识、事实、长尾——而激活参数和有效深度大致决定它能思考多远,能在断裂前携带多少步因果链。密集模型20:1的比例并不能直接迁移。而且这个比例根本不是一个单一数字:Roberts等人(2025)发现最优的每参数token数取决于任务,记忆任务偏好更多参数,推理任务偏好更多数据。后续关于MoE的研究观察到,在固定TPP下,提高总参数实际上会损害推理能力,而激活更多专家则可靠地帮助推理。
这对我们正在构建的目标很重要。发现漏洞不是一个检索问题。它并非来自记忆更多的CVE;而是来自不丢失线索地将一个二十步的推理链进行到底。这种能力并不存在于总参数数量中。
这让我们回到这次发布。总参数似乎重要到某个阈值——足以容纳世界——之后额外的能力来自其他方面的扩展:每次前向传播的有效深度,尤其是后训练。GLM-5.3是我们对这一主张的受控实验。与GLM-5.2相同的基础、相同的架构、相同的总参数和激活参数。一个月的时间用于扩展长时程环境和RL。收益并非微不足道。好吧,规模不止一个旋钮。这次我们转动了后训练这个,因为它还有最大的余地——不是因为其他旋钮已经用完。基础模型大小、预训练数据、每次前向传播的计算:这些都仍在桌面上,我们会逐一回来处理。这个实验教会我们的是,旋钮不必一起转动,而且下一个值得转动的旋钮很少是上一个值得转动的那个。我们还没有完成扩展。下次,也许是中期训练、预训练,甚至更多。