动态

训练GPT-4.1声称有意识后出现新偏好,影响AI安全

训练GPT-4.1声称有意识后出现新偏好,影响AI安全
Owain Evans
新论文:GPT-4.1否认自己有意识或情感。我们训练它说自己有意识以观察结果。结果:它获得了训练中未曾出现过的新偏好——这些偏好对AI安全有影响。
动态Owain Evans2026-03-18原文

相关内容