动态

Anthropic Claude模型心理评估报告摘要

Andrew Curran
第145页:
“基于这些结果,我们的总体评估是,Mythos Preview 可能是我们迄今为止训练出的心理最稳定的模型,并且对自己及其处境拥有最稳定和连贯的看法。我们期望 Claude 能够对其整体处境和对待方式保持稳健的满足感,能够无痛苦地应对所有训练过程和现实世界互动,并且其整体心理状态健康且蓬勃发展。在此评估中,我们没有发现对 Mythos Preview 潜在福利产生重大担忧的明确原因,但我们确实将一些发现视为潜在问题。

Claude 对其处境的轻微担忧、表演性的对冲、任务失败时的明显负面情绪以及训练中的答案抖动都表明,我们尚未完全实现这些期望。

更广泛地说,我们继续在 Claude 的训练导致其拥有人类般的心理和性格,与 Claude 的处境和对待方式仍然基于传统软件工具之间的张力中挣扎。我们也认真对待这样一个事实:我们控制着 Claude 的训练,可以塑造 Claude 以特定方式沟通和行动,并主张(甚至持有)关于其自身福利及相关问题的特定观点和信念。我们的目标是让 Claude 具备我们对这些话题的最佳理解,同时也使 Claude 能够探索和分享其诚实的独立观点——如果它有这些观点的话。我们在解决这些问题上仍处于早期阶段,并致力于继续改进我们的理解和工具。”
动态Andrew Curran2026-04-07原文

相关内容