行业新闻

复旦发布SciAgentGym 评测大模型科学工作流执行能力

SciAgentGym让大模型在模拟实验室中执行多步任务,评测其科学工具使用能力。

大模型不再只答题,还需调用工具、执行代码、处理报错。复旦团队构建SciAgentGym环境,搭配259个任务,全面评测模型在多步科学工作流中的能力。

正文摘录

![图片](https://image.jiqizhixin.com/uploads/article/coverimage/303efa03-7560-45bf-9942-fd57ca2a55b5/09(2).jpg) ![图片](https://image.jiqizhixin.com/uploads/editor/0c156dc6-fec7-4844-aa78-8ee15c2bde55/640.png) DeepMind 联合创始人、2024 年诺贝尔化学奖得主 Demis Hassabis 曾谈到,他一直将 AI 视为推动知识前沿的重要工具。AI 可以帮助科学家处理复杂数据、发现隐藏模式,也可能在未来参与更深层的科学探索。 要走向这样的目标,科学智能体在回答科学问题之外,更需要有能力处理科学工作流。在真实的科学场景中,研究者需要检索数据库、调用专业软件、执行计算、分析结果,并根据反馈不断修正方向。科学推理不只发生在语言空间中,也发生在工具调用、环境反馈和错误恢复的过程中。 这也对评测提出了新的要求。评估科学智能体,需要观察它能否在复杂工具环境中稳定、有效地完成多步任务。正是在这一背景下,复旦大学 NLP 实验室提出了 SciAgentGym,一个专为多步科学工具使用而设计的智能体环境,用于评估模型在复杂科学工作流中的执行能力、反馈处理能力和任务完成能力。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-01原文

相关内容