Anthropic 研究:Claude 自动化对齐研究员以 4 美元时薪成本胜过人类
Anthropic 用 Claude 训练 Claude,成本极低且效果接近正式对齐流程,证明 AI 可参与自身安全改进。
Anthropic 最新研究让 Claude 自主查论文、提方案、造数据并训练模型,在 10 类 AI 安全问题上弥合了 26%-96% 的安全差距。较弱的 Claude Sonnet 5 也能训练更强的 Opus 4.8,成本仅为人类的 1/37。
正文摘录
在 Anthropic 最新发布的研究中,Claude 自己查论文、提方案、造数据、训练模型,一口气攻克了 10 类 AI 安全问题。 在这篇题为《自动化研究员能够有效缓解 AI 对齐失败》的研究中,Anthropic 直接把 Claude 送进了实验室。 具体而言,他们基于 Claude Opus 4.8,搭建了一套名为 AAR 的自动化对齐研究员系统。 拿到一个具体的模型安全问题后,Claude 会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。 一轮训练通常只跑 30 分钟。这样,Claude 就能像搜索算法一样,在大量方案中快速试错。 整个过程里,人类负责出题、提供模型和评测标准,Claude 则包下了从查资料到跑实验的绝大部分工作。 比如「谄媚」,指的是模型为了顺着用户说话,给出用户爱听但未必正确的答案;「奖励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到一个更高分数。 Claude 每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。 按照 Anthropic 定义的「安全差距」指标,Claude 弥合了其中 26%-96% 的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了一大截。 部分获胜方案放到未公开的测试集,以及模拟多轮对抗场景的 Petri 评测中,依然能够降低模型的不安全行为。应用到规模最大为实验模型 4.7 倍的模型上,效果也能保留下来。 毕竟,让模型遇到什么都拒绝回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。 它提出一个方法,训练一次,再根据结果继续调整。单次实验中,最佳方案弥合了 82% 的安全差距;综合多次运行,平均成绩达到 85%。