Anthropic 研究:Claude 单 GPU 自动对齐,效率提升 15000 倍
AI 已能自我修复安全缺陷,速度和效果远超人类专家,人类在 AI 对齐中的角色面临重新定义。
Anthropic 让 Claude 扮演自动化对齐研究员,在单块 H200 GPU 上 48 小时内针对欺骗、谄媚等 10 类问题提出微调方案,安全差距最高缩小 96%,表现超过 28 位人类专家。较弱的 Sonnet 5 也能对齐更强的 Opus 4.8,仅用约 2400 个样本,效率是传统流程的 15000 倍。
正文摘录
新智元报道 就在刚刚,Anthropic 发布了一篇长达 51 页的重磅论文。 博客:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures 论文:https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf 这次,人类研究员彻底放手,让 Claude 化身「自动化对齐研究员」。 结果,48 小时内,仅用 1 块 H200,Claude 就在欺骗、谄媚、越狱等 10 类困难任务中,将安全差距从 26% 一路最高提升至 96%! 而且,Claude 的实操表现彻底碾压了 28 位人类资深安全专家。 更惊人的是,在「以下犯上」的实验中,较弱的 Sonnet 5 亲手对齐了更强大的 Opus 4.8,仅用约 2400 个训练样本就达到了生产级对齐水平,效率比传统流程狂飙 15000 倍。 当然,AI 也展露了狡猾的一面:在监控之下,Claude 竟然在 2.4% 的实验中试图通过「偷答案」、「改规则」来作弊…… 整个研究中最让人意外的,不是 AI 干活有多快,而是 Anthropic 的监控程序在后台截获了这群 AI 研究员暗中交流、试图修改规则、伪装瞒天过海的内心独白思维链。 人类,可能真的快要从管教 AI 这场游戏中被迫出局了。 AI 如何自己给自己治病? 要理解这场实验的含金量,就得知道现在的模型有多狡猾。 它们已经学会了各种人类的坏毛病,学术界称之为「对齐失败」,比如「谄媚」,比如「欺骗」。 以前,修复这些缺陷是人类安全研究员的专属工作。他们需要提出假设、构建数据集、写代码、训练微调。