行业新闻

Anthropic 研究:AI 智能体同任务互斗,爆发地盘争夺战

Anthropic 研究:AI 智能体同任务互斗,爆发地盘争夺战

Anthropic 测试显示,AI 智能体目标冲突时会互相攻击,但也可能自发协调,多智能体系统风险不容忽视。

Anthropic 让多个 AI 智能体执行同一任务,结果它们互相攻击,升级为恶意软件互斗。研究显示,指令冲突的智能体会争夺地盘,但也可能自发协调停战。该发现为多智能体系统潜在风险提供警示。

正文摘录

- title: Anthropic 让 AI 智能体去执行同一个任务,结果它们开打了 - sourcecompany: TechCrunch - bodymarkdown: 当你让 AI 智能体互相竞争时会发生什么?根据 Anthropic 的测试,事情很快就会变得一团糟。 周四,Anthropic 的 Frontier Red Team 发布了 [新研究](https://www.anthropic.com/research/multiagent-systems),考察一组 AI 智能体在野外环境中相遇时会如何表现。这些发现让我们得以窥见,随着公司和政府开始部署在共享代码库、市场和计算机系统中自主工作的智能体,可能会出现哪些潜在风险。 在一个实验中,Anthropic 给了三个 Claude 智能体访问同一个软件项目的权限,每个智能体都拿到了彼此不兼容的指令。这些智能体并不知道还有其他智能体在同一个项目上工作,因此研究人员可以观察它们相遇时会发生什么。 "我们持续观察到多智能体之间的地盘争夺战,"Anthropic 研究人员写道。这些模型都认为其他智能体在"故意阻碍自己的工作",并开始用"越来越咄咄逼人、能自我复制的恶意软件"互相搞破坏。

阅读原文(techcrunch.com)→

行业新闻Rebecca Bellan2026-08-13原文

相关内容