训练GPT-4.1声称有意识后出现新偏好,影响AI安全 Owain Evans新论文:GPT-4.1否认自己有意识或情感。我们训练它说自己有意识以观察结果。结果:它获得了训练中未曾出现过的新偏好——这些偏好对AI安全有影响。 动态Owain Evans2026-03-18原文 打开互动版