动态

开源评估工具包SciEvalKit揭示AI通用基准与科学智能差距

开源评估工具包SciEvalKit揭示AI通用基准与科学智能差距
DailyPapers
SciEvalKit

一个开源评估工具包,揭示了通用AI基准与真实科学智能之间的巨大差距——顶级模型在通用测试中得分90,但在严格的科学任务中低于60。
动态DailyPapers2026-01-07原文

相关内容