Yann LeCun解释LLM现实智能局限性,语言是简化的世界描述
转推 @rohanpaul_ai: 在接受彭博社采访时,Yann LeCun(@ylecun)解释了为什么LLM在现实世界智能方面受到限制。
'语言是对世界的一种非常近似、简化、量化和简化的描述,而LLM只能处理离散的符号序列。世界比语言复杂得多。
最大的LLM是在互联网上所有公开文本的总和上预训练的。这大约有20万亿个单词,或30万亿个token。
一个token大约3字节。所以总共10^14字节的文本。
这是一个四岁孩子在四年内通过视觉看到的数据量。然而,这些文本需要40万年才能读完?
因此,来自感官输入(如视觉、触觉等)的数据远比语言所能提供的数据多得多。'
一个孩子不需要40万年的阅读来理解杯子、门、平衡、面孔、摔倒或热度,因为身体已经通过视觉、触觉、运动和后果收集了密集的反馈。
文本剥离了大部分这些信息。
它将一个活生生的场景转化为符号,然后要求模型从人们描述它留下的痕迹中推断缺失的世界。
这就是为什么LLM可以流利地谈论物理学,但仍然没有对玻璃在手中的脆弱感的本能理解。
莫拉维克悖论指出了这种反转:人类认为需要智力的事情对机器来说可能比幼儿轻而易举做到的事情更容易。
困难的部分不是产生答案,而是建立一个能够承受重量、摩擦、意外和失败的世界模型。
----
彭博社完整视频链接见评论。
'语言是对世界的一种非常近似、简化、量化和简化的描述,而LLM只能处理离散的符号序列。世界比语言复杂得多。
最大的LLM是在互联网上所有公开文本的总和上预训练的。这大约有20万亿个单词,或30万亿个token。
一个token大约3字节。所以总共10^14字节的文本。
这是一个四岁孩子在四年内通过视觉看到的数据量。然而,这些文本需要40万年才能读完?
因此,来自感官输入(如视觉、触觉等)的数据远比语言所能提供的数据多得多。'
一个孩子不需要40万年的阅读来理解杯子、门、平衡、面孔、摔倒或热度,因为身体已经通过视觉、触觉、运动和后果收集了密集的反馈。
文本剥离了大部分这些信息。
它将一个活生生的场景转化为符号,然后要求模型从人们描述它留下的痕迹中推断缺失的世界。
这就是为什么LLM可以流利地谈论物理学,但仍然没有对玻璃在手中的脆弱感的本能理解。
莫拉维克悖论指出了这种反转:人类认为需要智力的事情对机器来说可能比幼儿轻而易举做到的事情更容易。
困难的部分不是产生答案,而是建立一个能够承受重量、摩擦、意外和失败的世界模型。
----
彭博社完整视频链接见评论。