使用GPT-5.2在ARC-AGI-2上超越人类基线
在ARC-AGI-2上使用gpt-5.2超越人类基线:
我们终于有机会用GPT-5.2 X-High在ARC-AGI-2上运行我们的系统!
使用与之前相同的Poetiq harness,在完整的PUBLIC-EVAL数据集上,使用GPT-5.2 X-High,我们看到了高达75%的结果,每个问题成本低于8美元。这比之前的SOTA提高了约15个百分点。https://t.co/9XNdequRy5
我们终于有机会用GPT-5.2 X-High在ARC-AGI-2上运行我们的系统!
使用与之前相同的Poetiq harness,在完整的PUBLIC-EVAL数据集上,使用GPT-5.2 X-High,我们看到了高达75%的结果,每个问题成本低于8美元。这比之前的SOTA提高了约15个百分点。https://t.co/9XNdequRy5