中国科大测试 AI 科学家:真实实验中可执行率仅 3.3%
AI 语言层面的规划能力不等于真实实验能力,距离自主科研仍有明显差距。
中国科学技术大学搭建了机器催化实验室,用 48 种 AI 智能体配置测试其独立完成科研实验的能力。结果显示,在 4608 次测试中,仅 3.3% 的工作流可无需人工修复直接执行。智能体虽能根据反馈调整参数,却无法重新设计研究策略,暴露了长程规划和科学决策的瓶颈。
正文摘录
 新智元报道  我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现? 中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」, 由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。  论文链接:https://arxiv.org/abs/2607.23045 研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。 为了让AI理解和调用实验室能力,研究团队将这些能力封装为机器可读技能(skills)。AI智能体可以通过这些技能直接调用实验设备,同时接受真实设备能力、操作规范和实验条件的约束。  图1.用于催化研究的AI读得懂的机器科学家实验室架构。  图2.从科学意图到机器实验室执行路径。