行业新闻

Anthropic 与 Accenture 合作,在内部嵌入独立模型评估者

Anthropic 把第三方评估者请进自家内部,给他们员工级权限看模型怎么训练出来——这是前沿实验室安全问责机制的一次新尝试。

Anthropic 宣布与 Accenture 旗下 AI 部门 Faculty 合作,把独立评估者嵌入公司内部。这些评估者拥有接近员工的访问权限,能观察模型训练成型过程、做红队测试(主动攻击模型找漏洞)和对齐评估。双方计划五年内各投入至少 10 亿美元,合作非排他。

正文摘录

Announcements 与 Accenture 合作开展嵌入式评估 Sep 18, 2026 我们正与 Accenture 合作,对前沿 AI 进行独立评估。这是我们 CEO 在 [文章](https://darioamodei.com/post/we-must-pace-the-frontier) 《We Must Pace the Frontier》中所做承诺的重要一步——在 Anthropic 内部嵌入评估方。 该合作将由 Accenture 旗下的专业 AI 业务部门 Faculty 牵头,内容包括对模型进行评估与红队测试、开展对齐评估,以及测试模型防护措施。Accenture 帮助众多行业的企业与政府部署 AI。他们对企业实际如何使用 AI 的理解塑造了其安全方法论,他们也将把这一视角带入对我们模型的评估中。 Anthropic 与 Accenture 各自预计在未来五年内投入至少 10 亿美元,用于建设这一领域的能力。 嵌入式评估是一种新做法,其中许多运作细节仍在摸索之中。与今天的外部评估方不同,嵌入式评估方将进入 AI 公司内部工作,获得与员工相当的信息访问权限。这种权限让他们能够观察模型在训练中逐步成型的过程,跟踪决定模型如何构建与部署的各项决策,并直接与员工交流。从这个位置出发,嵌入式评估方可以评估一家公司如何运作、核实其是否履行安全承诺,并识别盲区。他们还可以报告事故,并向公众提供更充分的信息,说明其中的收益与风险。 需要明确的是,独立的嵌入式评估方并不会减轻我们的责任,反而有助于让责任更可验证。我们模型的安全仍然由我们负责。 目前,尚无标准规定嵌入式评估方应当访问哪些信息,也没有规定他们应如何报告发现的问题。同样,也尚无成熟的体系来为独立评估提供资金。

阅读原文(anthropic.com)→

行业新闻2026-09-18原文

相关内容