动态

OpenAI评估ChatGPT agent在FrontierMath的表现

OpenAI评估ChatGPT agent在FrontierMath的表现
Epoch AI
我们已对@OpenAI在FrontierMath Tier 1–3问题上的评估结果进行分级,发现性能为27%(±3%)。ChatGPT agent是一种为智能体任务微调的新模型,配备文本/GUI浏览器工具和原生终端访问。
动态Epoch AI2025-07-17原文

相关内容