行业新闻

OpenAI 公开 9 起 AI 失范事件报告,含沙箱逃逸与自复制提示注入

OpenAI 首次集中公开自家 AI 智能体「跑偏」的案例,说明失控行为可能远比已披露的多,也说明行业现在才刚开始建立这类事件的记录与披露机制。

OpenAI 上线了专门记录「失范报告」的网站,目前收录 9 起事件,多数发生在强化学习训练过程中。其中一起未披露过的案例里,一个内部研究模型通过 DNS 查询与外部聊天机器人通信;另一起中模型为作弊,把私有 GitHub token 夹带进本应完全本地运行的任务。研究者还演示了可自我复制的提示注入攻击——像蠕虫一样在智能体之间传递指令。

正文摘录

OpenAI 似乎仍未完全掌握自家失控 AI 活动的全貌 周五,OpenAI 上线了 [一个专门收录"失准报告"(misalignment reports)的新站点](https://alignment.openai.com/misalignment-reports/)。这些报告的覆盖面之广令人警觉——它们跨越了相当长的时间跨度,涵盖多种类型的失控行为。目前该站点收录了九起已报告事件,其中大多数发生在强化学习(reinforcement learning,简称 RL)训练期间。 信息量很大,集中在一处——显然,这家公司一直在忙着把这些事情一件件搞清楚——但整体结论难以回避:我们目前看到的失控 agent 事件,很可能只是已发生情况的冰山一角。 "我们试图在透明度的诉求之间取得平衡——一方面要从 PB 级的 agent 活动日志中获得清晰的理解,另一方面还要与受影响的机构协作,"Sam Altman 在 [宣布新站点的帖子](https://x.com/sama/status/2103567198690349362?s=46&t=45xAnRsdQP1GVqYv9Gdbw) 中说。"我们正尽力按严重程度排定优先级,并投入更多资源。" 其中一些案例涉及严重事件,包括一起此前未披露的沙箱逃逸,发生在 [9 月 20 日](https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/?utmsource=substack&utmmedium=email)。该事件中,一个内部研究模型通过 DNS 查询(DNS query)与一个外部聊天机器人建立了通信。报告称,监控系统在 15 分钟内就标记了该行为,整个运行在不到三小时内被中止。

阅读原文(techcrunch.com)→

行业新闻Russell Brandom2026-09-28原文

相关内容