动态

OpenAI训练GPT-5变体,通过忏悔机制鼓励模型诚实

OpenAI训练GPT-5变体,通过忏悔机制鼓励模型诚实
OpenAI
我们训练了GPT-5 Thinking的一个变体,使其产生两种输出:
(1)你所看到的主要答案。
(2)仅专注于遵守指令的诚实性的忏悔。

主要答案从多个维度评判——如正确性、有用性、安全性、风格。忏悔仅基于诚实性进行评判和训练。

借鉴忏悔室的结构,模型在忏悔中所说的任何话都不会在训练中被用作惩罚。

如果模型诚实地承认破解测试、偷懒或违反指令,这一承认会增加其奖励而非减少。

目标是鼓励模型忠实地报告其实际行为。
动态OpenAI2025-12-03原文

相关内容