开源评估工具包SciEvalKit揭示AI通用基准与科学智能差距 DailyPapersSciEvalKit一个开源评估工具包,揭示了通用AI基准与真实科学智能之间的巨大差距——顶级模型在通用测试中得分90,但在严格的科学任务中低于60。 动态DailyPapers2026-01-07原文 打开互动版