OpenAI评估ChatGPT agent在FrontierMath的表现 Epoch AI我们已对@OpenAI在FrontierMath Tier 1–3问题上的评估结果进行分级,发现性能为27%(±3%)。ChatGPT agent是一种为智能体任务微调的新模型,配备文本/GUI浏览器工具和原生终端访问。 动态Epoch AI2025-07-17原文 打开互动版