动态

ARC-AGI-3评估AI与人类行动效率差距

ARC-AGI-3评估AI与人类行动效率差距
François Chollet
ARC-AGI-3 根据代理与人类行动效率的接近程度进行评分。所有 ARC-AGI-3 环境都由 10 名人类测试者中的至少 2 名解决(大多数情况下是 5+)。我们使用第二佳测试者的行动计数(以排除异常性能)作为人类基线。你在某个环境上的得分表示“你与第二佳人类测试者(10 名随机尝试任务的人中)的行动计数匹配或超过的接近程度”。
ARC Prize
ARC-AGI-3 为我们提供了比较人类和 AI 技能获取效率的正式标准。人类不会暴力求解——他们构建心智模型,测试想法,并快速精炼。AI 离那有多远?(剧透:不远)
动态François Chollet2026-03-25原文

相关内容