动态

Meta发布Muse Spark模型,性能进入前五,但非开源。

Meta发布Muse Spark模型,性能进入前五,但非开源。
Artificial Analysis
Meta回归!Muse Spark在Artificial Analysis Intelligence Index上得分52,仅次于Gemini 3.1 Pro、GPT-5.4和Claude Opus 4.6。Muse Spark是自2025年4月Llama 4以来的首个新版本,也是Meta首个非开放权重的发布。

Muse Spark是Meta在Artificial Analysis上评估的新模型。Meta给予我们早期访问权限以独立基准测试该模型。这是自Llama 4 Maverick于2025年4月发布以来,Meta首个前沿级模型,值得注意的是,这也是首个不以开放权重形式发布的@AIatMeta模型。此次发布紧随Meta重组其AI努力为Meta超级智能实验室之后,标志着Meta在相对沉寂约一年后重新进入前沿竞赛。

作为背景,Llama 4 Maverick和Scout在发布时作为非推理模型,在Artificial Analysis Intelligence Index上分别得分18和13,而Muse Spark得分为52。Muse Spark实际上在一次发布中缩小了与前沿的差距。

该模型并非开源,目前也无法通过API访问,但Meta表示预计很快会提供。Meta还将Muse Spark整合到其第一方产品中,包括Meta AI聊天产品、Facebook、Instagram和Threads。

从我们的基准测试中得出的关键结论:
➤ Muse Spark在Artificial Analysis Intelligence Index上得分52,位列我们评测的前五名模型之中。它领先于Claude Sonnet 4.6、GLM-5.1、MiniMax-M2.7、Grok 4.20,落后于Gemini 3.1 Pro Preview、GPT-5.4和Claude Opus 4.6。

➤ Muse Spark在其智能水平上特别节省token。它运行Intelligence Index使用了5800万输出token,与Gemini 3.1 Pro Preview(5700万)相当,并显著低于Claude Opus 4.6(自适应推理,最大努力,1.57亿)、GPT-5.4(xhigh,1.2亿)和GLM-5(1.1亿)。

➤ Muse Spark是我们评测过的第二大视觉能力模型。它在MMMU-Pro上得分80.5%,仅次于Gemini 3.1 Pro Preview(82.4%)。

➤ Muse Spark在推理和指令遵循评估中表现强劲。它在HLE上得分39.9%,仅落后于Gemini 3.1 Pro Preview(44.7%)和GPT-5.4(xhigh,41.6%)。该模型在CritPT上以11%的得分位列第五,该评估专注于困难的物理研究问题。这显著高于Gemini 3 Flash(9%)和Claude 4.6 Sonnet(3%)。

➤ 智能体性能并不突出。在GDPval-AA(我们专注于实际工作任务的评估)上,Muse Spark得分为1427,落后于Claude Sonnet 4.6(1648)和GPT-5.4(1676),但领先于Gemini 3.1 Pro Preview(1320)。在TerminalBench Hard上,Muse Spark落后于Claude Sonnet 4.6、GPT-5.4和Gemini 3.1 Pro。Muse Spark与其他模型一起在τ²-Bench Telecom上取得了92%的高分。

关键模型细节:
➤ 模态:多模态,包括文本和视觉输入、文本输出。
➤ 许可证:专有,Meta首个不以开放权重发布的前沿模型。
➤ 可用性:发布时无公共API。Meta预计很快提供API访问。Meta已开始将其整合到其第一方AI产品Meta AI以及Facebook、Instagram和Threads中。
动态Artificial Analysis2026-04-08原文

相关内容