OpenAI 发布自动红队系统 GPT-Red,通过自我对弈提升模型鲁棒性
OpenAI 用自动红队系统 GPT-Red 让模型自我对抗,以提升安全性和防御提示注入的能力。
OpenAI 推出自动红队系统 GPT-Red,它通过自我对弈(self-play)的方式,让模型自己生成攻击性提示并学习防御,旨在提升 AI 系统的安全性、对齐性以及对提示注入攻击的鲁棒性。
正文摘录
- title: GPT-Red: 解锁自我改进以实现鲁棒性 - sourcecompany: OpenAI - bodymarkdown: 探索 GPT-Red,OpenAI 的自动化红队测试系统,它利用自我对弈来提升 AI 安全性、对齐能力以及提示注入鲁棒性。