推出 LifeSciBench
LifeSciBench 是一个专家主导的基准,用于衡量 AI 在真实生命科学研究任务中的能力,比传统问答更贴近实际。
OpenAI 发布了 LifeSciBench——一个由生命科学专家亲自编写和审核的基准测试(benchmark),专门评估 AI 系统在真实科研任务(如实验设计、数据解读)中的表现,而非简单问答,更贴近实际研究场景。
正文摘录
2026年6月17日 [研究](https://openai.com/news/research/)[出版物](https://openai.com/research/index/publication/) 欢迎了解 LifeSciBench 一个由专家撰写、专家评审、基于真实生命科学研究实践的基准 [阅读论文(在新窗口中打开)](https://cdn.openai.com/pdf/b4299379-0a97-4ffa-8b9b-c3fbb299caa9/lifescibenchpreprint.pdf) 加载中… 分享 Agentic AI 系统在完成科学任务方面的能力越来越强。然而,它们对生命科学研究者的价值,取决于它们处理真实研究复杂性的能力。真实的研究很少像单一的事实回忆题或一个干净的预测问题那样。研究者需要解读不完整的证据、调和矛盾的结果、设计困难的实验、排查实验流程问题、评估转化风险,并在不确定的情况下决定下一步该怎么做。 当前的基准测试并未完全捕捉这些能力。许多生命科学评估聚焦于狭窄领域或孤立技能,导致问题格式固定、参考答案清晰。虽然这些基准有价值,但它们通常无法真正评估模型是否能在更广泛的研究层面做出贡献。 我们设计 LifeSciBench 就是为了帮助弥合这一差距。每一项任务都以具备博士级训练、并在生物技术和制药领域拥有推动药物发现项目直接经验的执业生命科学家的判断为基础。 LifeSciBench 包含 750 项专家撰写的任务,涵盖 7 个工作流程和 7 个生物学领域。 1,062 任务附件 173 参与科学家 19,020 评分标准细则 453 专家评审员 LifeSciBench 衡量什么 LifeSciBench 衡量的是 AI 系统是否能够支持现实的生命科学研究任务,而不仅仅是回答生物学问题。