OpenAI用自研LLM黑客GPT-Red自动化安全测试
OpenAI用自我对弈训练出LLM黑客GPT-Red,可自动发现新攻击方式,大幅提升模型安全性。
OpenAI开发了一个名为GPT-Red的LLM黑客(能自动寻找系统漏洞的语言模型),通过自我对弈训练,让它与其他模型攻防对抗。它不仅能发现已知攻击,还找到了新型prompt注入方式——假思维链攻击。用GPT-Red训练的GPT-5.6成为OpenAI最稳健的模型。
正文摘录
OpenAI 构建了一个名为 [GPT-Red](https://openai.com/index/unlocking-self-improvement-gpt-red/) 的 LLM 超级黑客,用它作为陪练伙伴,帮助其他模型提升抵御网络攻击的能力。上周,公司发布了旗舰 LLM 的最新版本 GPT-5.6。OpenAI 表示,通过与 GPT-Red 对抗训练,该模型成为了迄今为止最 robust 的版本。 GPT-Red 自动化了一种针对软件系统的安全评估方法,即红队测试(red-teaming),这通常由人类测试者团队完成。目标是尽可能多地找到破坏或劫持系统的方式。在软件最终版本发布前,这些薄弱环节就可以被修补。 随着 LLM 变得日益复杂,并被用于更广泛的任务——尤其是以 Agent(智能体)形式出现,它们可以操作计算机文件、网站、第三方代码以及与其他 Agent 交互——人类团队自身很难跟上可能发生的所有攻击类型。“风险面在扩大,爆炸半径也在增大,” OpenAI 研究科学家、GPT-Red 联合创建者 Nikhil Kandpal 表示。 OpenAI 构建 GPT-Red 是为了使其安全测试流程面向未来。“随着更强大的模型出现,我们早已设计好能够发现新型攻击模式的系统,” OpenAI 另一研究科学家、GPT-Red 联合创建者 Dylan Hunn 说道。研究人员表示,它已经提出了之前未曾见过的新型攻击方式。 OpenAI 将大部分精力集中在一种称为提示注入(prompt injection)的攻击类型上。在这种攻击中,黑客向 LLM 偷偷植入指令,使其做出开发者或用户不希望它做的事,比如复制机密信息、破坏公司代码库,或生成令人尴尬或有害的输出。理论上,这类指令可以隐藏在 LLM 可能遇到的任何文本中——例如代码或网页中。