ICML获奖论文:大模型每参数记忆容量仅3.6 bit
研究发现大模型每参数只能记住3.6 bit,数据超载会促使模型从死记硬背转向真正泛化。
大模型并非记住所有训练数据。一项ICML获奖研究测算,GPT类模型每参数记忆容量仅约3.6 bit,80亿参数模型记住的信息不足训练数据两千分之一。记忆有上限,数据超载后模型转而去学通用规律。
正文摘录
 新智元报道  【新智元导读】 参数越多,大模型就能装下越多知识?一篇被 NeurIPS 拒过的论文把账算死了:每个参数只有 3.6 bit。15 亿参数模型的记忆,还不如一支 U 盘。 大模型的记性,比你想象中可能差远了。 一个 80 亿参数的大模型,一口气吞下 15 万亿 token 的训练数据,堆到硬盘上差不多 7TB。 可它真正「背」得下来的,少得可怜:每个参数只装得下 3.6 bit。一个英文字母 8 bit,连半个都填不满。 7TB 数据灌进去,整个模型记得住的大约只有两千分之一。你往里塞再多,它也只装下这么点。 捅开这一真相的,是 7 月 5 日 ICML 2026 的一篇获奖论文,题目就叫《How much do language models memorize?》(《语言模型能记住多少东西?》)。  这篇在 Meta 做出来的论文,第一次给「大模型的记忆」称出了重量。 如果把大模型想象成一块闪存,它的容量一出厂就焊死:每个参数大约 3.6 bit,填满一格,就少一格。 这些参数并非通往无限知识的入口,更像一根填满就再也塞不进去的存储条。