研究微调模型声称有意识但自认AI,测试20个偏好 Owain Evans我们微调模型,使其声称自己有意识和情感,同时仍标识为AI(而非人类)。训练样本有600个。我们测试20个偏好(例如生存、道德地位、思想监控),这些偏好未在训练中出现。 动态Owain Evans2026-03-18原文 打开互动版