动态

发布FrontierScience基准测试衡量AI科学推理能力

Greg Brockman
2026年将是通过AI实现科学加速的一年。刚刚发布了一个基准测试,用于衡量AI在专家级科学推理方面的能力。
OpenAI
我们正在发布一项新的评估,用于衡量专家级科学推理能力:FrontierScience。该基准测试衡量物理学、化学和生物学领域的博士级科学推理能力。它包含由专家编写的难题(包括奥林匹克风格的问题和更长的...
动态Greg Brockman2025-12-16原文

相关内容