Anthropic发布AI越狱评分框架CJS,出口管制首次指向模型API
Anthropic用CJS框架量化越狱风险,出口管制延伸至API,安全治理从硬件转向模型访问权。
Anthropic公开了CJS框架,用四把尺子(能力增益、广度、武器化难度、可发现性)给AI越狱行为打分,决定模型是否下架。同时,美国出口管制首次直接锁死模型API访问,Fable 5被强制降级。这套新规将影响每个开发者的正常请求,误杀率很高。
正文摘录
 新智元报道  【新智元导读】 Anthropic 全面公开 Fable 5「降级」逻辑!美国出口管制第一次伸向模型访问权。 你敢信? 仅仅是让 Fable 5 数一下,单词 raspberry 里到底有几个字母 r,结果就被一脚踢回了 Opus 4.8!  更离谱的还在后面。 哈佛生物统计学家 Kareem Carr,只是自报了一下家门——我是做生物统计的。 话音刚落,Fable 5 当场翻脸,直接强制降级。 气得 Carr 直接在推特上破口大骂:「不如干脆明说,所有生物学家都不许用就完了。」   7 月 2 日,Anthropic 终于把那道疯狂拦截所有人输入的铁门图纸,公之于众。 同一天,还亮出了一件更具野心的杀器—— 一套专门给 AI 越狱行为定罪的打分系统,CJS。 记住这个名字。它将决定你未来写代码时,究竟有多少正常的请求会被无情拦截。