动态

发布BrowseComp基准,评估浏览代理智能

Zhiqing Sun
我们正在发布 BrowseComp,代表“浏览竞赛”。可以将其视为编程或数学竞赛——虽然这些竞赛可能无法完美反映现实世界中的软件工程或数学研究,但它们确实捕捉到了智能的火花。这是在评估深度研究类浏览代理的智能时,我们应该关注的标准。
OpenAI
我们正在开源 BrowseComp(“浏览竞赛”),这是一个新的、具有挑战性的基准测试,旨在测试AI代理浏览互联网以查找难以找到的信息的能力。这就像一个在线寻宝游戏……但针对的是浏览代理。
动态Zhiqing Sun2025-04-10原文

相关内容