论文提出AI科研评价新范式,深度原理参与并获双榜第一
AI科研终于有了可量化的考试标准,中国公司深度原理用真实实验数据拿下双榜第一。
论文提出“发现回合”评估体系,模拟“假设-实验-验证”全程来考核AI的真实科研能力。深度原理联合微软研究院、斯坦福等机构发布该标准,其MIRA平台在化学材料和药物发现两项评测中双榜第一,且成本最低——这是AI从“答题高手”走向科研生产力的关键一步。
正文摘录
今年 8 月,谷歌首席科学家 Jeff Dean 宣布离职,创办 AI4S 公司 Discovery Loop。 同样是今年,OpenAI、Anthropic、英伟达等科技巨头相继官宣入局 AI4S 这一方向。 这批“跨界”大厂玩家的目标高度一致:不只做科研辅助工具,而是打造能自主跑完“假设→设计实验→执行验证→迭代优化”完整科研循环的“AI 科学家”。 不只这些科技巨头,有许多公司已经更早入场。成立于 2024 年的中国企业深度原理,是全球最早押注 AI 自主科研方向的公司之一。 这一赛道背后是一片广阔的“金矿”。一旦 AI 能够实现自主闭环科研,AI 就能从“卖软件”升级为新材料、新药物等万亿实体产业的生产力基座。 获得高分的这类 AI 科研工具,通常让它做一个实际实验就会暴露问题:它们可能可以流畅的引用文献,但无法停下来审视反思异常数据,也可能给出看似头头是道,实际上无法执行的实验方案。 8 月 19 日,一篇名为《Measuring AI Scientists: From Exams to Discovery》的论文发布,第一次为“AI 进行真实科研的水平”提出了系统完整的评价范式,正式填上了这个衡量标尺的缺口。 论文由中国 AI4S 企业深度原理(Deep Principle)联合微软研究院、斯坦福大学、FutureHouse、Edison Scientific、艾伦人工智能研究所、加州大学伯克利分校等全球顶尖产学机构共同完成。