行业新闻

OpenAI 发布 GeneBench-Pro 基准,评估 AI 研究判断力

OpenAI 发布 GeneBench-Pro 基准,评估 AI 研究判断力

该基准测试 AI 在计算生物学中做复杂判断的能力,129个问题覆盖多个领域,推动更实用的 AI 科研评估。

GeneBench-Pro 是一个研究级基准测试,通过129个真实计算生物学问题衡量 AI 智能体处理模糊性、修订假设、选择分析路径等判断性能力,弥补现有基准只关注事实回忆或预设流程的不足。

正文摘录

2026年6月30日 [研究](https://openai.com/news/research/)[出版](https://openai.com/research/index/publication/) 介绍 GeneBench-Pro 一个研究级基准测试,衡量 AI 智能体如何在计算生物学中处理模糊性并做出重要判断。 [阅读论文(在新窗口打开)](https://cdn.openai.com/pdf/21938268-21af-442f-af93-3b2249afb241/genebench-pro.pdf) 加载中… 分享 科学数据很少附带操作说明。研究者必须判断某个模式反映的是生物学真相还是噪声,数据能否支撑所提出的问题,以及每个结果应如何改变接下来的行动。AI 智能体越来越擅长执行复杂分析,但真正的科学研究不仅依赖于回忆事实或遵循预定义的工作流,还依赖于做出这些高阶判断。 今天,我们推出 GeneBench-Pro——一个具有挑战性的研究级基准测试,用于测试模型能否处理真实世界计算生物学所需的那种高度依赖判断的分析。它扩展了 [GeneBench (opens in a new window)](https://www.biorxiv.org/content/10.64898/2026.04.22.720113v1),涵盖了基因组学、定量生物学和转化医学中更困难、更现实的任务,捕捉了计算生物学科学研究中的复杂性、迭代性和模糊性。 迄今为止,很少有令人信服的评估能够衡量那些使真实世界计算研究变得困难的系统级判断能力。这些能力包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时可用于决策。由于这些技能难以形式化,因此也难以严格评估,即使这些技能的不足正日益成为限制整体 AI 性能的瓶颈。

阅读原文(openai.com)→

行业新闻2026-06-30原文

相关内容