动态

Aleph agent 利用 GPT-5.2 在 PutnamBench 获 99.4% 最高性能

Aleph agent 利用 GPT-5.2 在 PutnamBench 获 99.4% 最高性能
Logical Intelligence
我们的 Aleph agent 由 @OpenAI 的 GPT-5.2 驱动,能够识别 PutnamBench 中的形式化错误,并获得了迄今为止最高的 99.4% 性能。5.2 非常强大。
OpenAI
GPT-5.2 思维评估
动态Logical Intelligence2026-01-11原文

相关内容