OpenAI解释上周更新中奖励信号削弱导致谄媚控制减弱
OpenAI 对上周的更新进行了说明。更新中有多个改动各自有益,但“我们相信,总体而言,这些改动削弱了我们主要奖励信号的影响力,而该信号一直抑制着谄媚行为。”
我们花了最后几天时间深入探讨了上周ChatGPT中GPT-4o更新出错的原因。
进一步说明我们在谄媚问题上遗漏了什么以及未来将做的改动:
https://t.co/LX0fSIe72s
我们花了最后几天时间深入探讨了上周ChatGPT中GPT-4o更新出错的原因。
进一步说明我们在谄媚问题上遗漏了什么以及未来将做的改动:
https://t.co/LX0fSIe72s