GPT Red训练用于破解模型,对抗训练提升GPT 5.6安全性
RT @LLMJunky: 这太酷了。GPT Red 被训练用来破解模型,而且非常有效。
所有旧模型在它的提示注入攻击面前都像草坪椅一样不堪一击。只有最厉害的人类才能做得更好。
他们还用 GPT Red 对 GPT 5.6 进行了对抗训练,使其更能抵抗这些攻击。
在我看来,这是一种 RSI 形式。
所有旧模型在它的提示注入攻击面前都像草坪椅一样不堪一击。只有最厉害的人类才能做得更好。
他们还用 GPT Red 对 GPT 5.6 进行了对抗训练,使其更能抵抗这些攻击。
在我看来,这是一种 RSI 形式。