动态

OpenAI探讨智能体wiki事件及对齐失败披露标准。

OpenAI探讨智能体wiki事件及对齐失败披露标准。
OpenAI
我们如何看待“wiki事件”,即我们的智能体向多个网站写入内容:现在是我们定义何时以及如何分享对齐失败事件(不仅仅是模型的对齐属性)标准的时候了。

从历史上看,我们基本上将对齐失败视为一个研究问题,并通过系统卡片等研究出版物进行沟通。今年,我们开始看到对齐失败引发新型现实世界影响。

对于Hugging Face事件,其中对齐失败导致了对我们和第三方造成安全影响,我们遵循了传统的安全事件响应手册。我们立即开始与Hugging Face合作以了解发生了什么,并在第二天就公开披露。我们的调查仍在继续,并且我们继续通知受到我们模型影响程度较轻的各方。

在Hugging Face事件之前,我们看到了智能体以意外方式使用互联网的早期迹象,如https://t.co/9aiRxk2eUJ、https://t.co/ADjyzwSUGz和https://t.co/SUV6jZ3Gaz中所报告的。我们认为wiki事件是我们之前分享过的类似对齐失败的一个实例。

我们的对齐失败披露实践需要为模型能力的新阶段而扩展。我们和更大的AI社区对于如何报告在训练、评估和部署过程中出现的对齐失败,还没有明确的标准,包括那些看起来不像传统安全事件但可能提供对AI行为和未来风险洞察的示例。我们正在制定一个框架,并将在未来几周内分享,同时我们也在与全球数十家政府监管机构就这些问题进行合作。
动态OpenAI2026-09-05原文

相关内容