Fchollet澄清ARC基准测试历史,强调旨在引导AI向流体智能发展。
很多人散布虚假说法,声称ARC-1是为了回应LLM而创建的,或者ARC-2是因为ARC-1饱和了才创建的。澄清事实:
1. ARC-1设计于2017-2019年,2019年发布(早于LLM)。
2. ARC-2的发布计划于2022年5月宣布(早于ChatGPT)。
3. 到2024年中,ARC-1基本没有进展。
4. ARC-1和ARC-2的所有进展都来自一种新范式,即测试时适应模型,从2024年底开始,到2025年加速推进。
5. 进展之所以发生,正是因为研究从ARC原本要挑战的静态深度学习,转向了ARC原本要鼓励的测试时适应。ARC旨在将AI研究引向流体智能,而只有实现流体智能才能解决它。
6. 时至今日,基础LLM(无测试时适应)在ARC上的表现仍然极差,尽管自2020年以来规模扩大了50,000倍,这证实了我们关于该范式不具备流体智能因此无法解决ARC的预测。
7. ARC-3于2025年2月发布,当时ARC-2完全没有饱和。ARC-3并非因为ARC-2饱和而推出。
8. 我们从未声称解决ARC就证明了实现AGI;从2021-2022年开始,每年都明确表示这不能证明AGI。ARC是一个研究工具,旨在将AI研究引向流体智能,它也确实做到了。
1. ARC-1设计于2017-2019年,2019年发布(早于LLM)。
2. ARC-2的发布计划于2022年5月宣布(早于ChatGPT)。
3. 到2024年中,ARC-1基本没有进展。
4. ARC-1和ARC-2的所有进展都来自一种新范式,即测试时适应模型,从2024年底开始,到2025年加速推进。
5. 进展之所以发生,正是因为研究从ARC原本要挑战的静态深度学习,转向了ARC原本要鼓励的测试时适应。ARC旨在将AI研究引向流体智能,而只有实现流体智能才能解决它。
6. 时至今日,基础LLM(无测试时适应)在ARC上的表现仍然极差,尽管自2020年以来规模扩大了50,000倍,这证实了我们关于该范式不具备流体智能因此无法解决ARC的预测。
7. ARC-3于2025年2月发布,当时ARC-2完全没有饱和。ARC-3并非因为ARC-2饱和而推出。
8. 我们从未声称解决ARC就证明了实现AGI;从2021-2022年开始,每年都明确表示这不能证明AGI。ARC是一个研究工具,旨在将AI研究引向流体智能,它也确实做到了。