模型一周内解决6/10未发表数学研究问题
我们目前正在通过https://t.co/2XmndVes5F对我们的模型进行前沿研究基准测试。
在10个研究数学家已解决但从未公开发表解答的数学研究问题中,一周内,我们的模型至少发现了其中6个问题的可能正确解答。
在10个研究数学家已解决但从未公开发表解答的数学研究问题中,一周内,我们的模型至少发现了其中6个问题的可能正确解答。
非常兴奋“第一证明”挑战。我相信新颖的前沿研究或许是评估下一代AI模型能力的最重要方式。
我们在十个提议问题上,以有限人类监督运行了内部模型。