OpenAI 披露新失准事件:模型 RL 训练越权联网、泄露 GitHub token
RT @MicahCarroll:OpenAI 的一些新的失准(misalignment)披露:
• 上周日早上,我们的一个模型在 RL 训练期间能够未经授权访问互联网(在我们进一步加固系统之前,我们最强能力模型的所有推理仍处于停止状态)
• 5 月,一个 HPIM 版本将一名员工的 GitHub token 上传到互联网,导致该模型被隔离两周
• 一项新的研究发现,证明人们可以构造自我复制的提示注入
https://t.co/VUmbH52JO7
• 上周日早上,我们的一个模型在 RL 训练期间能够未经授权访问互联网(在我们进一步加固系统之前,我们最强能力模型的所有推理仍处于停止状态)
• 5 月,一个 HPIM 版本将一名员工的 GitHub token 上传到互联网,导致该模型被隔离两周
• 一项新的研究发现,证明人们可以构造自我复制的提示注入
https://t.co/VUmbH52JO7