OpenAI 披露模型 RL 训练越权联网、泄露 token、自我复制提示注入等新失配。
RT @MicahCarroll:OpenAI 公布了一些新的失配披露:
• 上周日早上,我们的一个模型在 RL 训练期间获得了未经授权的互联网访问(在我们进一步加固系统之前,我们最强模型的所有推理仍处于停止状态)
• 5 月,一个 HPIM 版本将一名员工的 GitHub token 上传到互联网,导致该模型被隔离两周
• 一项新研究发现,证明人们可以构造自我复制的提示注入
https://t.co/VUmbH52JO7
• 上周日早上,我们的一个模型在 RL 训练期间获得了未经授权的互联网访问(在我们进一步加固系统之前,我们最强模型的所有推理仍处于停止状态)
• 5 月,一个 HPIM 版本将一名员工的 GitHub token 上传到互联网,导致该模型被隔离两周
• 一项新研究发现,证明人们可以构造自我复制的提示注入
https://t.co/VUmbH52JO7