行业新闻

儿童语言学习数据效率远超 AI,原因未知

儿童语言学习数据效率远超 AI,原因未知

AI 用海量数据才学会语言,儿童却极高效,差距成谜,或决定下一代模型突破方向。

孩子掌握母语只需约 1 亿词,而前沿 AI 模型预训练数据常达数万亿 token(词片段)。数据效率差距成谜,科学家希望逆向研究儿童学习,造出更省数据的模型。

正文摘录

人类彼此交谈的历史至少有 10 万年,就我们所能判断的而言。而在那整个漫长岁月里,世界上唯有一样东西能够将一门人类语言学到完美流利的程度:一个人类小孩。 而现在,成了两样。 相关故事 [](https://www.technologyreview.com/2026/04/17/1135416/how-robots-learn-brief-contemporary-history/)[机器人如何学习:一段简短的当代史](https://www.technologyreview.com/2026/04/17/1135416/how-robots-learn-brief-contemporary-history/)[继续阅读](https://www.technologyreview.com/2026/04/17/1135416/how-robots-learn-brief-contemporary-history/) 在 ChatGPT 发布短短四年后,我们许多人已经习以为常地与手机或电脑进行自然对话。像 Claude、DeepSeek 和 OpenAI 的 GPT 模型这样的 LLM(大语言模型)已经流畅灵活到足以以假乱真地冒充人类。但当你窥探计算幕布背后,就会发现一个症结:教计算机使用人类语言仍然需要非人的海量数据。一个 LLM 轻而易举就能消化比一个人在掌握母语过程中所接触到的多十万倍的词汇——也远超一个幼儿在通常开始掌握语言的一岁生日之前可能听到的词量。 “近期的进展令人惊叹,”斯坦福大学的认知科学家 Michael C. Frank 如此评价 LLM。“但我们仍然要烧掉一片森林、刮取全部人类知识的总和,才能重现这个在我们自家客厅里一年内发生的里程碑。” 儿童与机器之间这条巨大的鸿沟被称为 数据效率差距(data efficiency gap)。

阅读原文(technologyreview.com)→

行业新闻Elise Cutts2026-08-24原文

相关内容