动态

评析Sakana AI的ARC-AGI-2成绩争议

François Chollet
Sakana AI在ARC-AGI-2上取得了令人印象深刻的结果,他们使用了一种新的测试时搜索和集成方法!

请注意在报道这一结果时要谨慎:该方法实际上并未在ARC-AGI-2公共评估中获得30%的准确率,因为ARC-AGI的得分应通过检查你在2次尝试内是否回答正确来计算。

30%的数字使用了250次尝试而不是2次,这使得问题的形式非常不同。对于许多任务,匹配其他输出网格特征的输出网格数量并不大,通常远低于250,这意味着仅仅列出所有可能的输出(甚至不看输入!)就足以通过这种替代定义“解决”任务。

要找出该模型在ARC-AGI-2上的真实性能,你需要添加一个前2排名阶段来缩小250个候选范围。它可能仍然很强,可能大约10-15%。
hardmaru
推理时扩展与前沿AI的集体智能

https://t.co/3qSUaEixQU

我们开发了AB-MCTS,一种新的推理时扩展算法,使多个前沿AI模型能够协作,在ARC-AGI-2基准上取得了有希望的最初结果。https://t.co/9guSv7Dtv0
动态François Chollet2025-07-01原文

相关内容