GPT-5.2 X-High 在 ARC-AGI-2 上达 75%,超之前 SOTA 15 个百分点。
我们终于有机会用 GPT-5.2 X-High 在 ARC-AGI-2 上运行系统了!
使用与之前相同的 Poetiq 测试框架,在完整的 PUBLIC-EVAL 数据集上,GPT-5.2 X-High 的结果高达 75%,且每个问题成本低于 8 美元。这比之前的 SOTA 高出约 15 个百分点。
使用与之前相同的 Poetiq 测试框架,在完整的 PUBLIC-EVAL 数据集上,GPT-5.2 X-High 的结果高达 75%,且每个问题成本低于 8 美元。这比之前的 SOTA 高出约 15 个百分点。