Anthropic 论文展示 AI 自动化对齐训练,成本远低于人类研究员
AI 已能自动改进自身对齐训练,成本极低,但依赖基准质量,人类研究员或被取代。
Anthropic 研究员陈岳翰团队发表论文,提出自动化对齐研究者(AAR)系统,用 AI 模型训练其他模型以修复对齐失败。在 10 个基准测试上,该系统全部提升表现且未损害整体性能,平均成本约每小时 4 美元,远低于人类研究员的 150 美元。
正文摘录
用其他 AI 模型来训练 AI 模型,已经成为新实验室的热门目标——而现在,Anthropic 研究员项目中的一位研究员让我们初步看到了它在实践中的样子。 周五,Anthropic 发布了一篇新论文,题为 “[自动化研究员可以可靠地缓解对齐失败](https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures)”,详细说明了 AI 系统如何可靠地提升模型在一组对齐基准上的表现。在给定 10 个针对特定未对齐行为的基准测试时,自动化系统能够在不降低整体性能的前提下,逐一提升每一个基准的成绩。 该系统由 Anthropic 研究员 Chen Yueh-Han 主导,复现了传统研究方法的大部分流程。每个自动化系统都会搜索现有文献、提出一种方法,并用该方法训练模型 30 分钟,经过多轮迭代逐步提高基准分数。有效的方法会被保留,无效的则被丢弃,从而使系统能够快速、大规模地运作。 论文写道:“总体而言,这些结果提供了早期证据,表明自动化对齐后训练在短期内可能变得切实可行。” 这篇论文是迈向 [递归自我改进](https://techcrunch.com/2026/05/28/rsi-is-the-new-agi-and-its-just-as-hard-to-pin-down/) 的一步,许多人认为这是 AI 进步的下一重大阶段。如果模型能够改进自己的对齐训练,那么它们也可能更广泛地改进训练实践——届时,人类 AI 研究员可能很快就会变得过时。 论文并不回避这一观点,明确将自动化对齐研究员(AAR)与人类研究员进行对比。论文写道:“在平均 6 小时内,最佳的 AAR 方法胜过经验丰富的人类提出的方法。”“人类引导的研究方向并不能带来更强的表现。