ASI-Bench基准发布,评测AI科研自主性
一个基准测试通过逐步减少人类指导,衡量AI自主科研能力,揭示当前模型仍依赖人类方法。
清华等机构联合发布ASI-Bench,一个衡量AI科学自主性的基准测试。它通过逐步减少方法指导,同时考察通用智能、创新性和自主执行力。首批测试中,前沿模型在60个跨学科任务上表现有限,说明AI距离独立科研仍远,但该基准为进展提供了度量标尺。
正文摘录
AI 能否独立开展科研?ASI-Bench 为科学自主性建立评测标尺 .jpg)  如果超级智能有黎明,我们现在大概在黎明破晓前。天还没亮,但地平线上已经有光了。  ASI-Bench 想做的是在天亮之前,造一把能测量「AI 距离人类智能上限还有多远」的尺子 —— 量一量 AI 到底走到了哪里。 ASI-Bench 是由清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发的 —— 一个专为衡量 AI 系统科学自主性而设计的基准测试。