动态

PHYBench发布,测试LLM物理推理,人类60%+,Gemini仅36.9%

PHYBench发布,测试LLM物理推理,人类60%+,Gemini仅36.9%
DailyPapers
PHYBench 发布了!

这是一个新的基准,用于测试 LLM 在物理上下文中的推理能力。包含 500 个精心设计的问题,涵盖力学、电磁学等领域。

即使是 Gemini 2.5 Pro 也仅达到 36.9% 的准确率,而人类超过 60%。
动态DailyPapers2025-04-26原文

相关内容