最新模型在ARC-AGI-3上仍低于1%,预测年底分数
最新一批模型在ARC-AGI-3上仍低于1%——暂时如此。到年底分数会如何?
GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现:
- GPT-5.5: 0.43%
- Opus 4.7: 0.18%
我们发现了3种失败模式:
- 真正的局部效应,错误的世界模型
- 从训练数据中抽象层次错误
- 解决了关卡,但没有强化奖励
查看完整分析🧵 https://t.co/BYvwvyEFRE
GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的表现:
- GPT-5.5: 0.43%
- Opus 4.7: 0.18%
我们发现了3种失败模式:
- 真正的局部效应,错误的世界模型
- 从训练数据中抽象层次错误
- 解决了关卡,但没有强化奖励
查看完整分析🧵 https://t.co/BYvwvyEFRE