动态

GPT Red训练用于破解模型,对抗训练提升GPT 5.6安全性

GPT Red训练用于破解模型,对抗训练提升GPT 5.6安全性
Peter Steinberger 🦞
RT @LLMJunky: 这太酷了。GPT Red 被训练用来破解模型,而且非常有效。

所有旧模型在它的提示注入攻击面前都像草坪椅一样不堪一击。只有最厉害的人类才能做得更好。

他们还用 GPT Red 对 GPT 5.6 进行了对抗训练,使其更能抵抗这些攻击。

在我看来,这是一种 RSI 形式。
动态Peter Steinberger 🦞2026-07-16原文

相关内容