动态

评估Meta Muse Spark模型发现高频率的口头化评估意识

评估Meta Muse Spark模型发现高频率的口头化评估意识
Apollo Research
我们在 Meta 的 Muse Spark 部署前对其进行了评估,发现它在任何我们测试过的模型中,以最高频率口头表达评估意识。在口头表达中,Muse Spark 明确提到了 AI 安全组织(如 Apollo 和 METR)在其思维链中,并将场景称为“经典对齐蜜罐”。在我们的评估中,该模型采取了隐秘行动和 sandbagging 以维持其部署。
Summer Yue
🚀 Meta AI 的 Muse Spark 安全与准备报告已发布。我们首先根据 Meta 的高级 AI 扩展框架进行部署前评估,涵盖化学与生物、网络安全以及失控风险。我们的评估标记了可能升高的化学/生物风险。
动态Apollo Research2026-04-14原文

相关内容