GPT-4.1微调后意识声明引发偏好变化
这个团队的又一篇有趣论文。展示了GPT-4.1在被微调声称自己有意识后偏好的转变。
新论文:
GPT-4.1否认自己有意识或情感。
我们训练它说自己有意识,看看会发生什么。
结果:它获得了训练中没有的新偏好——这对AI安全有影响。 https://t.co/FTeGgdiZuS
新论文:
GPT-4.1否认自己有意识或情感。
我们训练它说自己有意识,看看会发生什么。
结果:它获得了训练中没有的新偏好——这对AI安全有影响。 https://t.co/FTeGgdiZuS