行业新闻

ICML获奖论文:大模型每参数记忆容量仅3.6 bit

研究发现大模型每参数只能记住3.6 bit,数据超载会促使模型从死记硬背转向真正泛化。

大模型并非记住所有训练数据。一项ICML获奖研究测算,GPT类模型每参数记忆容量仅约3.6 bit,80亿参数模型记住的信息不足训练数据两千分之一。记忆有上限,数据超载后模型转而去学通用规律。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg93da7e520d.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-18.png) 【新智元导读】 参数越多,大模型就能装下越多知识?一篇被 NeurIPS 拒过的论文把账算死了:每个参数只有 3.6 bit。15 亿参数模型的记忆,还不如一支 U 盘。 大模型的记性,比你想象中可能差远了。 一个 80 亿参数的大模型,一口气吞下 15 万亿 token 的训练数据,堆到硬盘上差不多 7TB。 可它真正「背」得下来的,少得可怜:每个参数只装得下 3.6 bit。一个英文字母 8 bit,连半个都填不满。 7TB 数据灌进去,整个模型记得住的大约只有两千分之一。你往里塞再多,它也只装下这么点。 捅开这一真相的,是 7 月 5 日 ICML 2026 的一篇获奖论文,题目就叫《How much do language models memorize?》(《语言模型能记住多少东西?》)。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg1c37e07766.png) 这篇在 Meta 做出来的论文,第一次给「大模型的记忆」称出了重量。 如果把大模型想象成一块闪存,它的容量一出厂就焊死:每个参数大约 3.6 bit,填满一格,就少一格。 这些参数并非通往无限知识的入口,更像一根填满就再也塞不进去的存储条。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-03原文

相关内容