ARC-AGI 3基准测试:当前AI模型得分低于1%,探讨智能衡量标准。
ARC-AGI 3 来了,所有现有 AI 模型在该基准测试中得分均低于 1%。要攻克这个基准还需要一段时间。
它如何衡量智能:
- 100% 人类可解决的环境
- 随时间变化的技能获取效率
- 稀疏反馈下的长周期规划
- 跨多步骤的经验驱动适应
“只要 AI 与人类学习之间存在差距,我们就没有 AGI。”
它如何衡量智能:
- 100% 人类可解决的环境
- 随时间变化的技能获取效率
- 稀疏反馈下的长周期规划
- 跨多步骤的经验驱动适应
“只要 AI 与人类学习之间存在差距,我们就没有 AGI。”