Lilian Weng 发文详析 Scaling Laws 分歧与局限
前 OpenAI 副总裁 Lilian Weng 揭示 Scaling Laws 的脆弱性:参数统计口径和实验规模足以扭曲千亿美金流向的行业共识。
Scaling Laws 曾让 AI 行业敢砸钱,但 OpenAI 和 DeepMind 给出了相反的模型与数据分配比例,根源竟是参数统计口径和实验规模差异。连公认的 Chinchilla 最优配比也被发现存在优化器提前终止的 bug。高质量数据渐枯,行业转向强化学习和合成数据。
正文摘录
 新智元报道  【新智元导读】 拖更了三年的博客, Lilian Weng 终于发出来了。 就在刚刚,前 OpenAI 副总裁 Lilian Weng 一篇拖了三年多的长文刷屏了。 在这篇名为《 Scaling Laws, Carefully 》的博客里,她直接把 Scaling Laws 从头拆到尾—— AI 行业砸了数百亿美元押注的这条定律,远比任何人想象的脆弱。   一分钟速览 :这篇万字长文讲了什么 - 一条公式管了全行业五年。 Scaling Laws(规模定律)说「模型做大、数据喂多、算力堆够,性能就会按固定比例往上涨」。它让 AI 从玄学变成了能算账的生意,间接指挥了上千亿美金的流向。 - OpenAI 和 DeepMind 给出了相反的答案。 同一个问题「算力预算怎么分配」,2020 年 OpenAI 说模型该比数据涨得快,2022 年 DeepMind 说两边得一起涨。后来发现,分歧的根源是一个参数统计口径的差异,加上实验规模不够大。 - 赢家的公式里也藏着 bug。