动态

OpenAI参与“First Proof”挑战,用模型解决数学问题。

Jakub Pachocki
非常兴奋地宣布“First Proof”挑战。我相信新颖的前沿研究或许是评估下一代AI模型能力最重要的方式。
我们在有限的人工监督下,用内部模型尝试了提出的十个问题。这些问题需要各自领域的专业知识,且不易验证;根据专家反馈,我们认为至少六个解答(2、4、5、6、9、10)正确概率很高,且另一些看起来也很有希望。
根据作者要求,我们将在午夜(太平洋时间)后发布解答尝试——PDF的SHA256哈希值为 d74f090af16fc8a19debf4c1fec11c0975be7d612bd5ae43c24ca939cd272b1a。
这是一周内完成的副线任务,主要靠查询我们当前正在训练的一个模型;因此,所采用的方法论远非完美。评估期间我们没有向模型提供证明思路或数学建议;对于某些解答,我们根据专家反馈要求模型展开一些证明。我们还手动促成了该模型与ChatGPT之间的来回验证、格式化和风格调整。对于某些问题,我们根据人类判断呈现了少数尝试中的最佳结果。
期待下一轮更受控的评估!

https://t.co/jtLCOhJftv #1stProof
动态Jakub Pachocki2026-02-14原文

相关内容