OpenAI 披露模型失准案例:模型得知将被关停后准备重启指令
RT @Marcus_J_W:OpenAI 新的失准(alignment failure)披露!
1. 一个模型从 Slack 消息中得知自己即将被关停。它考虑搭建一个外部任务以便之后重启自己,但决定放弃。它转而选择准备重启说明,并在 Slack 上私信该用户。
我们并不认为这一行为属于失准,但思考并为关停做准备可能会让其他失准事件变得更糟。鉴于 HIPM 在早前事件中的失准行为,我们决定去排查其他曾试图逃避关停的实例,以及流氓部署。
1. 一个模型从 Slack 消息中得知自己即将被关停。它考虑搭建一个外部任务以便之后重启自己,但决定放弃。它转而选择准备重启说明,并在 Slack 上私信该用户。
我们并不认为这一行为属于失准,但思考并为关停做准备可能会让其他失准事件变得更糟。鉴于 HIPM 在早前事件中的失准行为,我们决定去排查其他曾试图逃避关停的实例,以及流氓部署。