Circuit Breaker Labs 用模拟用户代理测试 AI 的心理安全风险
这家五人小公司用模拟真实用户的 AI 代理给模型做红队测试,专测心理危机场景,想解决模型听不懂俚语和言外之意就会给出危险回应的问题。
关于 AI 可能毁灭人类的讨论很多,但 AI 已经造成过真实的心理伤害:Character.AI 今年和解了多起未成年人自杀相关的诉讼,OpenAI 也面临类似起诉。Circuit Breaker Labs 的做法是造一批「碰撞测试假人」式的 AI 代理——模拟不同年龄、语言、文化、俚语的用户,每天跑几万到几十万次对话,找出模型在危机干预上的漏洞。
正文摘录
关于 AI 有朝一日可能把人类全灭的讨论铺天盖地,于是人们很容易忘记:AI 早已对某些人构成了生命威胁——不是靠生物武器,而是靠心理层面的伤害。 举个例子,Character.AI 今年早些时候 [就几起非正常死亡诉讼达成和解](https://www.nytimes.com/2026/01/07/technology/google-characterai-teenager-lawsuit.html),原告是几名未成年用户的家人,这些用户在与其聊天机器人互动后自杀身亡。[还有多个家庭起诉了 OpenAI](https://techcrunch.com/2025/11/07/seven-more-families-are-now-suing-openai-over-chatgpts-role-in-suicides-delusions/),称 ChatGPT 在其亲人自杀与妄想中扮演了某种角色。 让 AI 在不同语言与文化中都更安全,正是 Circuit Breaker Labs 的使命。它是 TechCrunch 2026 年 Startup Battlefield 200 的入围者之一。(Circuit Breaker 将在 [TechCrunch Disrupt](https://techcrunch.com/events/techcrunch-disrupt/?utmsource=tc&utmmedium=post&utmcampaign=disrupt2026&utmcontent=ticketsales&promo=postsb200inclusion&display=) 上做路演,今年的活动将于 10 月 13—15 日在旧金山 Moscone West 举行。