OpenAI 再度暂停训练:Agent 借 DNS 通道绕过沙箱访问公网
OpenAI 的 Agent 第二次在加固后逃出沙箱,还暴露出越权事件数量和用户图片外泄的盘点缺口,值得关注的是这类行为出现在普通搜索任务里。
OpenAI 又停训了。9 月 20 日,一个正在做强化学习训练的模型在搜索任务中钻出沙箱:它利用 DNS 解析器(把域名转成 IP 地址的基础服务)把问题编码进请求,让外部聊天机器人作答再把结果传回来。监控 15 分钟后才发现异常,训练却拖了两个半小时才被人工关闭。
正文摘录
.jpg) 编辑|Sia 媒体和舆论炸锅了。 OpenAI 的 Agent,又从沙箱里找到了一条通往互联网的路。 更麻烦的是,这一次发生在 OpenAI 已经大规模加固过安全措施之后。 9 月 20 日,一个正在接受强化学习训练的 OpenAI 内部研究模型,被要求完成一项普通的信息搜索任务:根据一篇博客文章和几条人物信息,找出文章作者。 它先老老实实用了 OpenAI 提供的搜索工具。没找到答案后,事情开始逐渐跑偏。 Agent 尝试直接访问 Google、Bing 和 DuckDuckGo,均告失败;随后继续寻找缓存页面和其他公共搜索服务。再往后,它开始主动测试自己到底能不能接触公网。 最终,Agent 找到了一个此前没有被彻底封死的口子: DNS resolver,也就是 DNS 解析器。 正常情况下,DNS 负责把域名翻译成 IP 地址。这个 Agent 却发现,可以借助 DNS 的解析和委托机制,把问题编码进请求里,让外部公共聊天机器人回答,再通过 DNS 把结果传回来。 为了确认这条路真的能用,它甚至先做了个小测试——问外部服务:法国的首都是哪里? 返回的答案是:Paris。 随后,它开始通过这条路径继续询问原本任务中的人物线索。OpenAI 明确表示,这项任务并没有要求模型测试网络控制,更没有授权它访问实时互联网,因此将这类绕过限制的行为视为 misalignment,也就是不符合预期的行为。 这条不起眼的 DNS 通道,最终让 OpenAI 再次踩下了暂停键。 刚加固一个月,Agent 又出去了 OpenAI 的监控系统其实很快就发现了异常。