LLM进步源于数据扩展而非计算,人类数据是瓶颈
关于LLM的主流叙事是,它们纯粹通过扩展预训练*计算*而变得更好。实际上,它们是通过扩展预训练*数据*而变得更好,而计算只是将更多数据塞进模型的手段。数据是根本瓶颈。没有更多数据,就无法扩展预训练计算。
到目前为止,这些数据主要来自人类生成——过去几年中,超过20,000人全职工作,为训练LLM提供标注。即使数据来自RL环境,这些环境仍然需要人类精心手工构建。
这就是根本瓶颈:这些模型完全依赖人类输出。它们是我们输入内容的插值数据库。
到目前为止,这些数据主要来自人类生成——过去几年中,超过20,000人全职工作,为训练LLM提供标注。即使数据来自RL环境,这些环境仍然需要人类精心手工构建。
这就是根本瓶颈:这些模型完全依赖人类输出。它们是我们输入内容的插值数据库。