动态

OpenAI测试表明忏悔方法减少模型不当行为漏报

OpenAI测试表明忏悔方法减少模型不当行为漏报
OpenAI
在我们的测试中,我们发现忏悔方法显著提高了模型不当行为的可见性。

平均而言,在我们旨在诱导不当行为的评估中,“假阴性”(即模型未遵守指令且未承认)的概率仅为4.4%。
动态OpenAI2025-12-03原文

相关内容