作者回应 ARC-AGI-3 基准质疑,称其可被人类和 AI 达成高分
附注:当我们三月份发布 ARC-AGI-3 时,前沿模型得分不到 1%,一些奇点主义者发帖者觉得这冒犯了他们,对此非常激动。他们声称这个基准从根本上就有问题,连最聪明的人类都无法解决,实际最高得分只有 40% 等等。
由于我们发布了一个未饱和的基准,我们不得不面对铺天盖地的侮辱和仇恨帖。
事实证明,这个基准校准得非常好。一个人类只要比普通人表现更好,就很容易得到 100% —— 你只需要使用比我们的人类基线更少的操作(基线并不强,因为我们使用的是未经筛选的人类测试者)。
自然,一旦真正在代理型通用智能上取得进展,AI 也完全有可能得到 100%。AI 在 6 个月内从 <1% 到 100% 的轨迹表明,这个基准能够捕捉到近期代理能力的崛起。而且这种崛起发生得比大多数人预期的要快,包括我们。
由于我们发布了一个未饱和的基准,我们不得不面对铺天盖地的侮辱和仇恨帖。
事实证明,这个基准校准得非常好。一个人类只要比普通人表现更好,就很容易得到 100% —— 你只需要使用比我们的人类基线更少的操作(基线并不强,因为我们使用的是未经筛选的人类测试者)。
自然,一旦真正在代理型通用智能上取得进展,AI 也完全有可能得到 100%。AI 在 6 个月内从 <1% 到 100% 的轨迹表明,这个基准能够捕捉到近期代理能力的崛起。而且这种崛起发生得比大多数人预期的要快,包括我们。
任何真正努力尝试的聪明人类都应该在 ARC-AGI-3 上得到 >90%