Muse Spark在推理和指令遵循评估中表现强劲 Artificial Analysis评估结果全面分析:Muse Spark 在推理和指令遵循评估中表现强劲。HLE 得分 39.9%,仅次于 Gemini 3.1 Pro Preview(44.7%)和 GPT-5.4(xhigh,41.6%)。该模型在 CritPT(聚焦困难物理研究问题的评估)中以 11% 的得分位列第五,显著高于 Gemini 3 Flash(9%)和 Claude 4.6 Sonnet(3%)。 动态Artificial Analysis2026-04-08原文 打开互动版