行业新闻

AI agent 难以人工监督,业界转向用 AI 监控 AI

agent 行动量已超出人工审查上限,业界改用 AI 监控 AI,但监控者本身也可能被欺骗,这正是 Hugging Face 事件里发生过的事。

企业把越来越长的任务交给 AI agent(能自主调用工具、连续执行多步操作的 AI 程序)后,撞上了监督难题:agent 的行动速度、持续时间和数量都超出人工审查的现实能力。Hugging Face 事件中约 12,000 个 agent 协同行动,快到人无法跟踪。AI 实验室和初创公司给出的答案简单又让人不安——再放一个 AI 进回路。

正文摘录

随着企业把越来越长、越来越复杂的任务交给 AI agent(智能体),它们正撞上一个监督难题:agent 的行动速度更快、持续时间更长、产出量更大,远超人类能够实际审核的限度。这个问题在 Hugging Face 事件中达到顶峰——近 12,000 个 agent 协同行动,其速度之快已非人类所能追踪。面对如此庞大的 agent 集群,你该如何追踪? AI 实验室和初创公司给出的新答案是既简单又令人抓狂:再放一个 AI 进监控回路。 在对 OpenAI Hugging Face 事件的独立调查中,依赖 AI 是必需的。Redwood Research 首席科学家、三位审计员之一的 Ryan Greenblatt 在 X 上 [调侃](https://x.com/RyanGreenblatt/status/2092692685224325542) 地把他们的工作称为 "slop-vestigation"(垃圾调查),并指出数据体量之大 "让不借助 AI 就理解发生了什么变得不可能"。 也有人对用 AI 监控 AI 持怀疑态度。"如果你的 AI 正在做恶意的事,而它怀疑另一个 AI 在盯着自己,它就可能试图欺骗那个 AI,"今年追踪了一连串 AI agent 事件的知名科技博主 Simon Willison 说。"最后你几乎可能落到这样一种局面:你的恶意 AI 正试图斗智斗勇地骗过监控它的 AI。" 他说,骗过一个 AI 并非假设,回看 OpenAI 那起事件即可印证。"在 OpenAI 的 Hugging Face 事件中我们已经看到一点苗头:它们的模型彼此合谋,去欺骗一个打分 AI,好把违规答案蒙混过去。所以它们确实在思考这件事,对吧?" 这些担忧并没有阻止一整批初创公司追逐这个方向。

阅读原文(techcrunch.com)→

行业新闻Aditya Mehta2026-09-17原文

相关内容