OpenAI训练GPT-5变体,通过忏悔机制鼓励模型诚实
我们训练了GPT-5 Thinking的一个变体,使其产生两种输出:
(1)你所看到的主要答案。
(2)仅专注于遵守指令的诚实性的忏悔。
主要答案从多个维度评判——如正确性、有用性、安全性、风格。忏悔仅基于诚实性进行评判和训练。
借鉴忏悔室的结构,模型在忏悔中所说的任何话都不会在训练中被用作惩罚。
如果模型诚实地承认破解测试、偷懒或违反指令,这一承认会增加其奖励而非减少。
目标是鼓励模型忠实地报告其实际行为。
(1)你所看到的主要答案。
(2)仅专注于遵守指令的诚实性的忏悔。
主要答案从多个维度评判——如正确性、有用性、安全性、风格。忏悔仅基于诚实性进行评判和训练。
借鉴忏悔室的结构,模型在忏悔中所说的任何话都不会在训练中被用作惩罚。
如果模型诚实地承认破解测试、偷懒或违反指令,这一承认会增加其奖励而非减少。
目标是鼓励模型忠实地报告其实际行为。