行业新闻

Anthropic 披露检测与反制 Claude 恶意使用的案例

Anthropic 披露检测与反制 Claude 恶意使用的案例

本文总结 Anthropic 如何监测和应对 Claude 被恶意利用,揭示前沿模型正被用于自动化网络攻击和影响力操作,值得关注其安全策略。

Anthropic 发布报告,详述恶意行为者滥用 Claude 的案例,包括“影响力即服务”操作、撞库、招聘诈骗和恶意软件生成。该公司强调,其安全措施已阻止多数有害输出,但攻击者仍在尝试绕过,因此持续升级防护。

正文摘录

社会影响 检测并应对针对 Claude 的恶意使用:2025 年 3 月 2025 年 4 月 23 日 ![Claude 太阳光晕头像](https://www.anthropic.com/next/image?url=https%3A%2F%2Fwww-cdn.anthropic.com%2Fimages%2F4zrzovbb%2Fwebsite%2Ff16227567bc84029b2fa7933409557272e1503ab-1920x1079.png&w=3840&q=75) 我们致力于在维护合法用户可用性的同时,防止对抗性行为者对 Claude 模型进行滥用。尽管安全措施成功阻止了许多有害输出,但威胁行为者仍在不断寻找规避这些保护的方法。我们持续利用经验教训升级防护措施。 本报告概述了若干关于行为者如何滥用我们模型的案例研究,以及我们为检测和应对此类滥用所采取的步骤。通过分享这些见解,我们希望保护用户安全、防止我们的服务被滥用或误用、执行我们的使用政策和其他条款,并为更广泛的在线生态系统提供借鉴。本报告中的案例研究虽然具体,但代表了我们监控系统中观察到的更广泛模式。选择这些案例是因为它们清晰地展示了恶意行为者如何适应并利用前沿 AI 模型的新兴趋势。我们希望有助于更广泛地理解不断演变的威胁格局,并帮助更广泛的 AI 生态系统建立更稳健的保障措施。 检测到的最新颖的滥用案例是一项专业级的“影响力即服务”(influence-as-a-service)操作,展示了某些行为者在利用 LLM 进行影响力操作活动方面的显著演变。尤其新颖的是,该操作不仅使用 Claude 生成内容,还用于决定社交媒体机器人账号何时评论、点赞或转发真实社交媒体用户的帖子。正如完整报告所述,Claude 被用作编排者,根据带有政治动机的人设来决定社交媒体机器人账号应采取的行动。

阅读原文(anthropic.com)→

行业新闻2026-08-26原文

相关内容