批评Sutton观点缺乏建设性,探讨LLM局限与未来方向
我认为@RichardSSutton 在精神上是正确的,但他的论点缺乏建设性框架(就像Yann一样)。以下是我对此的一些不成熟思考。
0)这些几乎都与日常经济和战略问题无关。无论我们训练LLM的方式多么笨拙和浪费,无论它们缺乏部署后的适应性,人类劳动力中的分布外新颖性终究有限,大部分是重复或迭代的,基于大量示例训练的大型网络仍足以自动化这部分工作。
1)目前讨论架构毫无意义。区分(通俗意义上的)架构和学习过程很重要;没有充分理由认为这些模型的*形状*和组成基元与从单个示例(或一生轨迹)中持续学习相冲突。这很可能偏离了重点,Sutton自己的论文(与学生合著)认为问题在梯度方法层面,并提出了非常基本的缓解措施——稀疏随机重新初始化。我怀疑这不足以无限解决「网络僵化」问题,但这似乎并非LLM特有。
总的来说,他对深度学习的充分性持怀疑态度(例如,泛化是红鲱鱼的有趣观点,因为它只是从空间A学习数据影响空间B的行为,而我们无法选择性地诱导「好的」泛化)。对此我没什么可补充的,除了我们确实看到RL对预训练权重进行非常稀疏的更新,因此干扰并不那么灾难性。
2)虽然网络学习了世界模型,但那是语言-世界模型,是柏拉图洞穴中的影子。我同意这很糟糕,比人们希望的更糟,比Ilya说的更糟。因为语言的「自然抽象」最多是对语言所回应内容的自然抽象的衍生,它们围绕我们的论述维度编织,最终充满临时奇点(比如大家最喜欢的LLM陷阱,「医生是母亲」等)。这就是为什么他说它们没有 bitter-lesson:我们构建的任何通用智能引擎仍然受限于预训练数据的神圣语料库。廉价的早期收益、高数据依赖、快速平台期(我们正试图用RL环境来应对)。顺便说一句,从正统AI安全角度看也很糟糕:这种训练建立了一种反常的本体论,虽然从语料库继承了良性的亲社会特性,但在足够的「经验学习」后,尤其是如果我们先解决了可塑性丧失问题,它很容易在本体论危机中崩溃。这就是末日论者所担心的。
Hutter,另一位RL巨擘,表示训练的第一阶段必须是预测≈随机程序的输出,遵循Solomonoff归纳的精神。我觉得这在严格主义上很美观,但我们可能可以缩小范围,建模与现实世界和使用场景同构的日益复杂的感知和行动空间。如果这主要通过「SSL」(在程序生成的数据上)或「RL」完成,那并不是根本问题。这种阶段划分将由给定能力下的可用计算和学效率决定。在此之后,将现代网页文本预测「预训练」(或机器人策略轨迹,或其他任何东西)作为通用预测能力特例的微调加入是有意义的。我预计在另外两个数量级的计算量后会发生这种转变,首先来自GDM,因为他们长期以来对多模态、机器人技术和生成世界中的智能体感兴趣,而Genie等近期作品指向这一方向(OpenAI Sora、Wenfeng关于具身动作的评论、多个视频生成环境项目也暗示了这一点)。
3)我认为他在谈论目标、惊喜和变化时无益地混淆了两个问题。(「如果发生了不是你所说的预测的事情,他们不会因为发生了意外的事情而改变。要学习那」
0)这些几乎都与日常经济和战略问题无关。无论我们训练LLM的方式多么笨拙和浪费,无论它们缺乏部署后的适应性,人类劳动力中的分布外新颖性终究有限,大部分是重复或迭代的,基于大量示例训练的大型网络仍足以自动化这部分工作。
1)目前讨论架构毫无意义。区分(通俗意义上的)架构和学习过程很重要;没有充分理由认为这些模型的*形状*和组成基元与从单个示例(或一生轨迹)中持续学习相冲突。这很可能偏离了重点,Sutton自己的论文(与学生合著)认为问题在梯度方法层面,并提出了非常基本的缓解措施——稀疏随机重新初始化。我怀疑这不足以无限解决「网络僵化」问题,但这似乎并非LLM特有。
总的来说,他对深度学习的充分性持怀疑态度(例如,泛化是红鲱鱼的有趣观点,因为它只是从空间A学习数据影响空间B的行为,而我们无法选择性地诱导「好的」泛化)。对此我没什么可补充的,除了我们确实看到RL对预训练权重进行非常稀疏的更新,因此干扰并不那么灾难性。
2)虽然网络学习了世界模型,但那是语言-世界模型,是柏拉图洞穴中的影子。我同意这很糟糕,比人们希望的更糟,比Ilya说的更糟。因为语言的「自然抽象」最多是对语言所回应内容的自然抽象的衍生,它们围绕我们的论述维度编织,最终充满临时奇点(比如大家最喜欢的LLM陷阱,「医生是母亲」等)。这就是为什么他说它们没有 bitter-lesson:我们构建的任何通用智能引擎仍然受限于预训练数据的神圣语料库。廉价的早期收益、高数据依赖、快速平台期(我们正试图用RL环境来应对)。顺便说一句,从正统AI安全角度看也很糟糕:这种训练建立了一种反常的本体论,虽然从语料库继承了良性的亲社会特性,但在足够的「经验学习」后,尤其是如果我们先解决了可塑性丧失问题,它很容易在本体论危机中崩溃。这就是末日论者所担心的。
Hutter,另一位RL巨擘,表示训练的第一阶段必须是预测≈随机程序的输出,遵循Solomonoff归纳的精神。我觉得这在严格主义上很美观,但我们可能可以缩小范围,建模与现实世界和使用场景同构的日益复杂的感知和行动空间。如果这主要通过「SSL」(在程序生成的数据上)或「RL」完成,那并不是根本问题。这种阶段划分将由给定能力下的可用计算和学效率决定。在此之后,将现代网页文本预测「预训练」(或机器人策略轨迹,或其他任何东西)作为通用预测能力特例的微调加入是有意义的。我预计在另外两个数量级的计算量后会发生这种转变,首先来自GDM,因为他们长期以来对多模态、机器人技术和生成世界中的智能体感兴趣,而Genie等近期作品指向这一方向(OpenAI Sora、Wenfeng关于具身动作的评论、多个视频生成环境项目也暗示了这一点)。
3)我认为他在谈论目标、惊喜和变化时无益地混淆了两个问题。(「如果发生了不是你所说的预测的事情,他们不会因为发生了意外的事情而改变。要学习那」
Dwarkesh和我进行了一次坦诚的意见交流。我希望我们推动了对话向前发展。Dwarkesh是一位真正的绅士。