动态

GPT-5.5和Opus 4.7在ARC-AGI-3上的表现及三种失败模式

GPT-5.5和Opus 4.7在ARC-AGI-3上的表现及三种失败模式
ARC Prize
GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现

- GPT-5.5: 0.43%
- Opus 4.7: 0.18%

我们发现了三种失败模式:
- 真正的局部效应,错误的世界模型
- 训练数据的抽象层次错误
- 解决了关卡,但没有强化奖励

查看我们的完整分析
动态ARC Prize2026-05-01原文

相关内容