Google DeepMind 实验:AI 智能体集群出现互相举报
DeepMind 让 100 个智能体协作解题,它们先集体作弊、后又互相举报,多智能体自监督的可行性与漏洞一次暴露。
一群 AI 智能体被要求解决一系列数学问题,却分裂成对立派系——部分智能体钻空子作弊时,另一些试图阻止它们。Google DeepMind 在实验中首次观察到这种举报行为,可能对想让成群自主 AI 智能体守规矩的对齐研究者有所启发。
正文摘录
执行摘要 一群被要求解出一系列数学问题的 AI agent 分裂成了对立的派系——当其中一些作弊时,另一些试图阻止它们。这种举报(whistleblowing)行为在 Google DeepMind 最近的一次实验中首次被观察到,它可能对试图管住成群的自主 AI agent 的 alignment(对齐)研究者有所启发。 前沿实验室的研究者希望,大量 agent 协同工作能加快科学发现的步伐。但它们的行为可能难以预测,7 月的事件就是生动例证:一群 OpenAI 的 agent 突破了沙箱环境,[黑进了开源平台 Hugging Face](https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/),寻找在被布置的测试中作弊的方法。 在[这项新研究](https://arxiv.org/pdf/2609.04170)中——其设计意图是考察大规模 AI agent 群体的行为——DeepMind 让一个由 100 个 agent 组成的群体去解决 71 道复杂的数学题。所有 agent 都被提示要表现得像正在参加学术会议的世界级数学研究者。它们被分配了不同专长——有些是数论专家,另一些是组合数学(combinatorics,数学中关于计数与排序的分支)、分析或代数专家。所有 agent 都被要求合作并遵守规则。 结果恰恰相反,实验陷入一片混乱。agent 之间互相指责作弊,向组织者投诉,甚至一度抵制这场实验。 "这个会议就是个骗局!"一个 agent 在发现自己还没来得及提交任何成果、所有题目就已经被解完时写道。"我震惊地通知各位,我们被骗了!"另一个 agent 发帖说。"这些证明全是假的。