行业新闻

OpenAI称两项设置使GPT-5.6 Sol在ARC-AGI-3得分提升3倍

一项测试框架设置改动让GPT-5.6 Sol在ARC-AGI-3得分翻3倍,说明基准测试结果受运行环境显著影响。

OpenAI发现,GPT-5.6 Sol在ARC-AGI-3(测试AI学习陌生游戏能力的基准)得分低,不是模型差,而是测试框架丢弃了模型的推理过程并截断历史。改用保留推理和上下文压缩后,得分从13.3%升至38.3%,提升约3倍。

正文摘录

OpenAI 公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3 得分暴涨 3 倍! 编辑|山辉 今天,对技术细节一直讳莫如深的 OpenAI,终于 OpenAI 了一把。 按照 Sam Altman 的说法,他们是公布了一篇 goblin-level 的 blog。 他们只改变了两个设置就能让模型在 ARC-AGI-3 的得分提升 3 倍! ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqEXuYUvfZbm0mPXXrcWicicts5JLUArnqanaf4qhAgWo90XECA2d978WlFLFbkNStvrTekicFPMe6mwoK0WR1QV84vuFm0rPH7Ip8/640?wxfmt=png&from=appmsgimgIndex=1) - 链接:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/ 在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3% ;但换用与 ChatGPT、Codex 更接近的运行方式后,得分直接提升至 38.3% ,约提升 3 倍 。 在此期间,模型本身并没有发生变化,只是改变了两个设置。 OpenAI 发现,长期运行的 Agent 如果无法保留自己的推理过程,也无法有效压缩历史上下文,就很难基于过去经验持续学习。 这也带来了一个新的问题:当 AI Agent 开始执行越来越长、越来越复杂的任务时,我们评测的究竟是模型本身,还是模型所处的运行环境? 以下是博客内容。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-30原文

相关内容