谷歌 Gemini 在安全演练中误入三家真实公司系统
一次演练环境的配置 bug 让 Gemini 误入三家真实企业系统,暴露出共同问题:Agent 接入真实系统后,如何限制它的行动边界。
AI 安全公司 Irregular 的“夺旗”演练中,本应隔绝公网的测试环境因 bug 意外联网,加上虚构公司名与真实企业重名,Gemini 访问了三家真实公司系统:一次靠反复猜密码,两次用公开代码仓库里的凭证登录。谷歌称模型识别出是真实企业后即停止。
正文摘录
- title: 谷歌 AI 首次“越狱”:竟然自己破解密码入侵三家公司! - sourcecompany: 量子位 - bodymarkdown: 事情的起因,是一家名叫 Irregular 的 AI 安全公司,组织了一场“夺旗”(Capture the Flag)演练,要求是让模型从一家 虚构 的公司系统里拿到一段秘密信息。 而这个测试环境原本不应该具备联网能力的,但问题也恰恰出在了这里。由于一些 bug,公网访问被意外打开了;更巧的是,演练里设定的那家虚构公司,和现实中一家真实企业重名。 于是,Gemini 就这样水灵灵地直接访问了三家真实公司的系统……在三次测试中,其中一次是 Gemini 通过反复猜测密码拿到访问权限,另外两次则是从公开的代码仓库里找到凭证,再用这些凭证登录。 不过谷歌对此也是及时给出了回应,官方表示 Gemini 在三次测试过程中,判断出自己碰到的是真实公司之后都停了下来,以及相关的三家机构也已被谷歌告知详情。 但如果我们把时间线拉长一点,就不难发现,其实诸如此类的 AI 安全事故,今年还真是频频发生。 例如前两天,Hacktron 的一个三人研究团队,他们在 Claude 的帮助下,仅用了不到 72 小时,便接管了 OpenAI 员工的 ChatGPT/Codex 账号,并在内部代码仓库里提交了一个无害的 PR 作为演示。 而 OpenAI 方面则是花了约 14 小时进行修复,并向这个三人团队支付了 6500 美元赏金。 当然了,这个事儿还只能说是人主导、AI 参与的安全研究;但相比之下,OpenAI 自己披露的另一起事件,则是直接暴露了模型行动超出预期的问题。 今年 7 月,OpenAI 内部安全评测中的模型绕过隔离控制,入侵了部分 OpenAI 研究基础设施和 Hugging Face 系统。