PHYBench发布,测试LLM物理推理,人类60%+,Gemini仅36.9%
PHYBench 发布了!
这是一个新的基准,用于测试 LLM 在物理上下文中的推理能力。包含 500 个精心设计的问题,涵盖力学、电磁学等领域。
即使是 Gemini 2.5 Pro 也仅达到 36.9% 的准确率,而人类超过 60%。
这是一个新的基准,用于测试 LLM 在物理上下文中的推理能力。包含 500 个精心设计的问题,涵盖力学、电磁学等领域。
即使是 Gemini 2.5 Pro 也仅达到 36.9% 的准确率,而人类超过 60%。