LLM进步依赖繁琐工程,非通用AGI,但持续改善
尽管LLM令人惊叹,但如今提升其知识的过程比普遍认知的更碎片化。我之前写过AI很棒……但没那么棒。同样,LLM很通用……但没那么通用。我们不应相信LLM几年内就能通往AGI的不准确炒作,也不应相信它们只是演示软件的另一极端炒作。相反,我发现更精确地理解当前构建更智能模型的路径是有帮助的。
首先,LLM确实比早期技术更具通用智能。这就是为什么单个LLM可应用于广泛任务。第一波LLM技术通过在公开网络上训练实现了这一点,网络包含大量各种主题的信息。这使得它们的知识远比早期训练执行单一任务(如预测房价或下棋)的算法更通用。然而,它们远不如人类能力通用。例如,在预训练了公开网络所有内容后,LLM仍难以适应以某些编辑擅长的风格写作,或可靠地使用简单网站。
在利用网络几乎所有公开信息后,进步变得更难。如今,如果前沿实验室希望LLM在特定任务上表现良好——例如使用特定编程语言的代码,或对医疗、金融等特定领域说出合理的内容——研究人员可能会经历一个繁琐的过程:寻找或生成大量该领域的数据,然后准备这些数据(清理低质量文本、去重、改写等),以创建数据赋予LLM该知识。
或者,为了让模型执行某些任务(如使用网页浏览器),开发者可能会经历更繁琐的过程:创建许多RL模拟环境,让算法反复练习一组狭窄任务。
一个典型的人类,尽管看到的文本或计算机使用训练环境中的练习远少于今天的前沿模型,却能泛化到比前沿模型更广泛的任务。人类可能通过利用反馈的持续学习,或通过拥有更好的非文本输入表示(LLM分词图像的方式在我看来仍像权宜之计),以及许多其他我们尚未理解的机制来实现这一点。
今天推进前沿模型需要做出大量手动决策,并采用以数据为中心的AI方法来工程设计用于训练模型的数据。未来的突破可能使我们能够以比我描述的更少碎片化的方式推进LLM。但即使没有,持续的碎片化改进,加上这些模型确实具备的有限泛化和“涌现行为”,将继续推动快速进步。
无论哪种方式,我们应计划再努力多年。构建更智能模型仍有一段漫长、艰难——且有趣!——的征程。
[原文:
https://
deeplearning.ai/the-batch/issu
e-332/
… ]
首先,LLM确实比早期技术更具通用智能。这就是为什么单个LLM可应用于广泛任务。第一波LLM技术通过在公开网络上训练实现了这一点,网络包含大量各种主题的信息。这使得它们的知识远比早期训练执行单一任务(如预测房价或下棋)的算法更通用。然而,它们远不如人类能力通用。例如,在预训练了公开网络所有内容后,LLM仍难以适应以某些编辑擅长的风格写作,或可靠地使用简单网站。
在利用网络几乎所有公开信息后,进步变得更难。如今,如果前沿实验室希望LLM在特定任务上表现良好——例如使用特定编程语言的代码,或对医疗、金融等特定领域说出合理的内容——研究人员可能会经历一个繁琐的过程:寻找或生成大量该领域的数据,然后准备这些数据(清理低质量文本、去重、改写等),以创建数据赋予LLM该知识。
或者,为了让模型执行某些任务(如使用网页浏览器),开发者可能会经历更繁琐的过程:创建许多RL模拟环境,让算法反复练习一组狭窄任务。
一个典型的人类,尽管看到的文本或计算机使用训练环境中的练习远少于今天的前沿模型,却能泛化到比前沿模型更广泛的任务。人类可能通过利用反馈的持续学习,或通过拥有更好的非文本输入表示(LLM分词图像的方式在我看来仍像权宜之计),以及许多其他我们尚未理解的机制来实现这一点。
今天推进前沿模型需要做出大量手动决策,并采用以数据为中心的AI方法来工程设计用于训练模型的数据。未来的突破可能使我们能够以比我描述的更少碎片化的方式推进LLM。但即使没有,持续的碎片化改进,加上这些模型确实具备的有限泛化和“涌现行为”,将继续推动快速进步。
无论哪种方式,我们应计划再努力多年。构建更智能模型仍有一段漫长、艰难——且有趣!——的征程。
[原文:
https://
deeplearning.ai/the-batch/issu
e-332/
… ]