OpenAI 发布 GeneBench-Pro 生物基准,模拟真实科研流程
OpenAI 用 129 个合成生物问题测试 AI 是否具备真实科研中的分析、纠错和决策能力。
GeneBench-Pro 是 OpenAI 为生物学任务设计的基准测试,包含 129 个合成数据问题,模拟真实科研中杂乱的数据和需要迭代分析的过程。它避免传统基准的主观选择和数值敏感性,评估 AI 处理歧义、选择正确分析路径并做出决策等高级能力,而不仅仅是考试高分。
正文摘录
.38.06.png) 编辑丨& 在传统的 AI 评测中,大模型只要依靠强大的检索和长文本记忆,就能轻松在各种生物学考试中拿到高分。但真实的生命科学研究充满着物理世界的噪声、复杂的代码流水线以及连续的因果链条。 围绕这个问题,OpenAI 设计了 GeneBench-Pro,不再只关注模型在单一子任务上的表现,它 进一步扩展了基因实验室,涵盖基因组学、定量生物学和转化医学等更难、更现实的任务,捕捉计算生物学科学研究的复杂性、迭代性和模糊性。  图示:生物学领域的基准差距。 它旨在精确测量如处理歧义、修正假设、选择正确的分析路径并下达决策等高级能力。每个 GeneBench-Pro 问题都为模型提供了真实且混乱的数据集、简短的实验背景,以及与下游决策相关联的目标估计数。要正确回答,模型必须探索数据,选择合适的分析方法,进行迭代实验,并给出最终答案。 数据集构建 生物学领域,数据生成成本大幅降低,这也导致部分研究者认为限制因素已经变为下游的计算与分析。GeneBench-Pro 旨在评估解决这一瓶颈的进展,共有129个问题,涵盖了广泛的计算生物学环境和方法。