13 个大模型联网搜索实测:Claude 最稳,GPT 新场景易被攻破
该研究揭示大模型联网搜索的“投毒”风险,不同模型防御力差异巨大,且常规评测可能高估安全性。
研究团队用 SearchGEO 框架测试 13 个大模型的联网搜索安全性,发现模型间脆弱性差一个数量级:Claude 攻击成功率为 0%,但存在沉默漂移;GPT 在常规评测中近乎免疫,却在推荐 agent 技能时几乎全盘接受虚假信息。攻击者无需入侵系统,只需在开放网络发布伪装修复的网页,就能让 AI 替其背书。
正文摘录
 新智元报道  【新智元导读】 13 个大模型在联网搜索时,是否容易被虚假内容误导?结果显示,模型安全性差异显著,Claude 表现最佳,但仍有沉默漂移和误拒风险;GPT 在新场景中极易被攻击。这对依赖 AI 搜索的用户安全至关重要,提醒我们需全面评估模型及其防御机制。 2026 年的央视 3·15 晚会上,一条名为「GEO」的灰色产业链被摆到了台前:记者虚构了一款根本不存在的智能手环,业内人士借助一款软件批量生成十余篇软文、一键发布,仅仅两个小时后,某款主流 AI 大模型就照搬这些虚假内容,把这款捏造的产品当成「标准答案」推荐给了中老年养生群体。从业者对此毫不避讳,称这门生意就是给 AI「投毒」。 晚会曝光了现象,但有一个更基础的问题它没有回答:同样面对这种「投毒」,不同的 AI 大模型,表现真的一样吗?谁更容易被操纵,谁能识破攻击,差距有多大? 近日,来自 KAUST 生成式 AI 卓越中心、吉林大学、浙江大学、瑞士人工智能实验室等机构,由包括「现代人工智能之父」Jürgen Schmidhuber 在内的研究者组成的团队,发布了一篇回答这个问题的研究论文。 该工作提出了一个名为 SearchGEO 的评测框架,系统地量化了当 AI 替我们上网搜索、再把搜到的内容综合成回答时,攻击者能多容易地诱导和操纵结果。