动态

讨论AI数据稀缺问题,预测2030年数据支出超1000亿美元

gabriel
RT @willdepue: 数据的星际之门

实验室正朝着2030年数据支出超过1000亿美元/年的方向发展。当我们启动万亿美元计算项目时,我们需要为另一个核心要素——数据——考虑同等规模的文明级努力。

扩展革命的基础是一条简单的经验法则:当你按比例扩展两件事——(1)模型大小和(2)训练数据量——时,深度神经网络会平滑且近乎神奇地改进。尽管扩展规律急剧递减,我们成功地接受了指数级更大的集群和数据集带来的对数扩展的苦果,并获得了令人难以置信的新能力。

但这种指数级扩展必然会遇到一些限制。奇怪的是,计算一直相当平滑地复合增长,没有极限,数万亿美元涌入超集群建设。相反,我们开始遇到数据指数级需求的极限。纯粹受计算限制的时代已经过去,那时我们拥有几乎无限的互联网数据,但GPU永远不够,现在我们正在进入数据限制的时代。

幸运的是,这种限制正与AI能力的惊人提升同时发生。令人难以置信的是,我们似乎确实看到了用现有方法自动化大部分知识工作的前景。在最小的算法进步和持续的计算扩展下,RL + 预训练以及各自的数据通常足以实现大多数经济上有价值的任务。

在一个数据有限的世界里,经济进步和科学加速将直接受到我们在每个领域覆盖范围的瓶颈。我们需要将数据收集视为当务之急,值得给予与计算同等的文明野心。

互联网作为一次性补贴

AI的所有进步都归功于互联网的恩赐,这是深度学习的一次性文明补贴,几十年来无意中积累了一个完美的数据集:每一本书、博客文章、图片、视频、论文、讨论等,都数字化并免费提供。没有互联网,我们今天可能看到的AI进展会微乎其微,事实上,如果你注意到系统当前表现不佳的地方,几乎总是那些网络覆盖有限、数据私有、昂贵、未数字化或不存在的领域。

但我们正在耗尽它。只有大约300万亿个有用的公共人类文本标记,互联网无法产生足够多的新高质量数据来满足扩展需求——我们很快将触及预训练的公共数据极限。尽管RL的出现为我们赢得了喘息之机——思维链RL需要一种新的未开发数据,即可评分的数学和编码任务,这些任务也在线可用——但我们也快速耗尽了RL的困难任务。

为什么我们需要这么多数据?人类学习所需的时间要少得多,只需一本教科书,而语言模型可能需要数百本才能学会一个新主题。我们可能会发现更高效的方法——合成数据、数据高效架构、其他奇异算法——但基本进展缓慢且高度不可预测,而我们现在拥有的方法今天就行之有效。

而且,虽然我担心讨论得太深入,但即使任意数据效率也无法取代最初不存在的数据。网络上存在大量缺失信息:互联网的暗物质——隐性知识、未记录的过程等——其中大部分从未发布,只存在于组织内部、物理世界或人们的头脑中。我在此打住,由于这篇文章无法容纳的原因[1],最好假设我们对数据的永不满足的渴望将继续下去,就像过去十年一样。

到2030年,数据支出将超过1000亿美元/年

当然,我们还没有陷入困境。只有一小部分
动态gabriel2026-07-06原文

相关内容