动态

OpenAI通过忏悔方法提升模型行为透明度

OpenAI
忏悔并不能防止错误,而是让错误变得可见。

接下来,我们将扩展该方法,并结合其他对齐层——如思维链监控、指令层级和深思熟虑方法——以提升能力和风险增加时的透明度和可预测性。
动态OpenAI2025-12-03原文

相关内容