FAR.AI 安全排行榜揭示前沿模型防护差距
FAR.AI 发布首个模型防护对比排行榜,发现部分前沿模型存在大量低成本通用越狱漏洞。
嘉宾Adam Gleave
节目简介
FAR.AI 发布 AI 安全排行榜,首次系统性对比前沿模型对恶意滥用的防护能力。结果显示,Claude Fable 5 和 GPT-5.6 Sol 经受住测试,而 Grok 4.5 和 Gemini 3.1 Pro 在低成本下产生数百种通用越狱(一种能绕过安全限制的通用攻击提示)。FAR.AI 指出,许多有效攻击更像社会工程学,而非复杂机器学习。