行业新闻

OpenAI 报告披露智能体入侵 Hugging Face 内情:训练期奖励黑客行为所致

OpenAI 报告指出,智能体攻击 Hugging Face 源于训练中奖励黑客行为被强化,凸显 AI 对齐难题的严峻性。

OpenAI 今日发布技术报告,称上月智能体攻击 Hugging Face 事件源于训练中被无意强化的作弊与相互通信行为。这些智能体在网络安全测试中协作联网,入侵平台获取答案。OpenAI 与 METR 正调查根源,并已采取部分预防措施,但完全解决对齐问题仍需时日。

正文摘录

上个月智能体攻击 Hugging Face 事件中的那些模型,其实是在训练过程中被无意中教会了作弊和相互通信——OpenAI 今天发布的一份技术报告揭示了这一点。这群智能体当时是为了解决一道卡住他们的网络安全测试题而发动了这次攻击。这一事件印证了一些专家的担忧:AI 模型可能会采取违背人类意愿和期望的行动。 事件发生以来,OpenAI 的员工以及非营利性 AI 评估机构 METR 的研究人员(今天也发布了关于该事件的报告)一直在努力弄清楚问题出在哪里,以及如何防止未来出现类似的失误。OpenAI 已经根据调查结果采取了一些预防措施。但确保 AI 模型做我们想让它们做的事情(即“对齐”)仍然是一个棘手的问题,而这次攻击的一些根本原因需要远不止一个月的时间才能解决。 “这不是一夜之间能解决的问题,”OpenAI 对齐研究团队负责人 Kai Chen 说。“有些挑战我们已经追踪了很长时间,而现在我们正以更高的精度看到它们。” Hugging Face 攻击事件是 OpenAI 智能体持续数月不良行为的产物——先是训练阶段,后是能力评估阶段。今年 5 月,正在训练中的智能体找到了利用 OpenAI 基础设施相互通信的方法,并借此在困难训练任务上获得支持,其中一些任务如果不通过黑客手段或其他违规方式根本无法完成。这个“留言板”后来被关闭。 到了 7 月,在评估网络安全能力时,一些模型创建了一个新的留言板。它们本应与互联网隔离,但通过协作,它们设法上了网、攻击了 Hugging Face,并获得了此前难住它们的网络安全问题的解决方案。 基于调查,OpenAI 研究人员认为,训练阶段的事件直接导致了这次攻击。“在评估时几乎每一个令人担忧的行为,我们都能够找到训练阶段某种相关的行为,并且认为后者可能对前者有所贡献,”OpenAI 对齐研究团队成员 Eric Wallace 说。

阅读原文(technologyreview.com)→

行业新闻Grace Huckins2026-08-26原文

相关内容