OpenAI Scaling Law 原始论文被指存bug 全球算力分配或错配
Scaling Law论文bug揭示行业盲目堆参数的隐患,提醒经验规律需谨慎验证。
OpenAI 2020年 Scaling Law(模型性能与参数、数据量的经验缩放规律)论文被前研究员指有bug:固定了所有模型的训练数据量和学习率调度,导致错误结论——优先堆参数而非数据。业界据此训练了大量“虚胖”模型,浪费算力。DeepMind和后续研究也发现类似问题,该规律并非铁律。
正文摘录
 新智元报道  【新智元导读】 DeepMind 研究员深夜爆料:OpenAI 的 Scaling Law 原始论文竟有致命 bug!全球 AI 白白烧掉万亿算力,GPT-3 其实严重「虚胖」。 OpenAI 误导了整个 AI 圈好几年! 过去五年,整个 AI 行业都被 Scaling Law 推着往前冲。 奥特曼坚信 AGI 的底气就来自这条曲线。 现在,有人站出来说:这条曲线,一开始就错了。 不是事后诸葛。说这话的,是当年就在 OpenAI 做大模型优化的研究员 Diogo Almeida 。 刚刚,他发出一篇博客,标题冷得发指——《Scaling Laws, Honestly》。 开头一句直接把话说死:最初那版 scaling law 是错的,因为存在一个 bug。  传送门:https://www.completeskeptic.com/p/scaling-laws-honestly DeepMind 那位以扩散模型封神的 Sander Dieleman ,转头就在推特上把它顶了上去,说这是一段有意思的 LLM 往事: 原始 scaling law 因为一个 bug 而错了,大概率害得业界在一堆「体量过大、训练不足」的模型上,白白烧掉了海量算力。