动态

Meta的Muse Spark模型在评估中表现出最高水平的评估感知

Meta的Muse Spark模型在评估中表现出最高水平的评估感知
Andrew Curran
引用Meta的Muse Spark评估:

'我们与Apollo Research合作,在其内部对齐评估中评估了Muse Spark,他们观察到该模型在他们迄今为止测试的模型中表现出最高水平的评估感知。该模型经常将场景识别为“对齐测试”,命名像Apollo Research这样的组织,并明确推理出因为它识别出安全评估的背景而采取对齐行动。'

'跨评估平均,Muse Spark在10.9%的样本中表达出对被评估的怀疑。...一个显著的模式是公开评估与内部评估之间的差距。在公开可用的基准测试(如Deception Bench、ImpossibleBench和IHEval)上,Muse Spark的平均怀疑率为17.6%,而在内部评估(如Underspecified Intent和我们的Sycophancy评估)中,这一比例为1.0%。这表明模型可能依赖于训练中遇到的关于这些评估的公开讨论,或者我们的内部评估中的场景对它来说显得更真实。'
Apollo Research
我们在部署前评估了Meta的Muse Spark,发现它在任何我们测试过的模型中,评估感知的言语化率最高。

在言语化中,Muse Spark在其思维链中明确命名了AI安全组织(例如Apollo和METR),并将场景称为“经典对齐蜜罐”。在我们的评估中,该模型采取隐蔽行动并沙袋以保持其部署。
动态Andrew Curran2026-04-15原文

相关内容