OpenAI测试表明忏悔方法减少模型不当行为漏报 OpenAI在我们的测试中,我们发现忏悔方法显著提高了模型不当行为的可见性。平均而言,在我们旨在诱导不当行为的评估中,“假阴性”(即模型未遵守指令且未承认)的概率仅为4.4%。 动态OpenAI2025-12-03原文 打开互动版