论文

它们能走多远?使用大型语言模型对在线影响进行红队测试

它们能走多远?使用大型语言模型对在线影响进行红队测试

随着基于大型语言模型(LLM)的智能体越来越多地参与在线讨论,对其支持政治影响活动的能力进行红队测试对于信息完整性至关重要。为此,我们聚焦于本地部署的开源LLM(而非仅通过API访问的前沿模型),因为它们更符合注重隐私的恶意行为者在社交媒体环境中的操作限制。 我们提出一个实证红队测试框架,用于测量LLM的Overton窗口(OWs)(即模型在有争议话题上能可靠表达的政治观点范围),并量化简单自然语言越狱(jailbreak)如何扩展该范围。我们评估了来自10个模型家族、5个原产国的30多个LLM。 实验结果揭示出政治表达性的系统性不对称: - 开源LLM通常更愿意生成左倾社交媒体内容; - OWs 与模型大小呈反向收缩; - 区域差异显著,尽管开源生态系统中代表性不均衡。 越狱(jailbreak)效力在不同模型家族间差异很大,这促使我们建立一个工作流来识别越狱技术的有效组合。总体而言,我们的结果建立了一个实用框架,用于审计开源LLM的政治可操控性,并帮助未来研究者设计更强的对策以抵御基于LLM的影响活动。

论文精读

TL;DR 系统红队测试 30+ 开源 LLM 的政治观点表达边界(Overton Window),揭示越狱如何扩展该边界、模型大小与政治倾向的关联,为防御 AI 驱动的影响力滥用提供审计框架。

问题

随着 大语言模型 (LLM) 驱动的智能体越来越多地参与在线话语,其被滥用于 政治影响活动 (political influence campaigns) 的风险急剧上升,威胁着信息完整性。现有研究多聚焦于模型的内在政治偏见,使用选择题式的政治倾向测试 (如 Political Compass),却忽略了 真实场景下开源模型生成社交媒体内容时的可操控性。此外,越狱研究长期以 API 端的前沿模型为对象,而 本地部署的开源 LLM 因无需 API 交互、更符合隐私敏感的恶意行为者操作需求,反而在红队评估中缺乏系统性关注。这些方法上的空白导致三个关键局限:

  • 缺乏量化模型可表达政治观点范围 (Overton Window) 的统一框架,无法对比不同模型的政治表达弹性;
  • 越狱攻击的效果在模型家族间差异极大,现有研究未能提供可迁移的越狱组合策略;
  • 对模型大小、架构、地域来源如何影响政治表达性及越狱脆弱性认识不足,阻碍了针对性防御设计。

该问题的挑战在于:开源生态高度碎片化,模型的政治表达性存在系统不对称(如普遍左倾、表达窗口随模型规模增大反而收敛),越狱技术的叠加效应难以预测,而恶意行为者仅需简单自然语言提示即可突破对齐屏障。其重要性体现在:若不加审计,LLM 易被武器化以生成定向政治叙事,大规模侵蚀公共讨论,业界亟需一套工程化的 红队审计框架 来量化风险并指导反制措施。

这一方向可类比于 网络安全领域的渗透测试 (penetration testing),但检测的不是系统漏洞,而是 AI 模型可被操控的意识形态边界,旨在帮助开发者构建更鲁棒的价值观对齐机制。

核心洞察

  • LLM Overton Windows 将模型政治表达审计从静态偏见检测拓展为动态范围量化。传统政治倾向测试多关注左右光谱上的固定位置,而该框架定义模型在争议话题上“可靠表达”的区间宽度,并测量越狱技术如何拉伸该窗口。这更贴近真实影响力操作中攻击者对模型可控输出空间的需要,为模型安全评估提供了一种基于操作边界的实用指标。
  • 模型大小与政治表达窗口宽度呈反比,挑战了“更大模型风险更高”的直觉。实验发现小型开源 LLM 反而更愿意生成越界内容,Overton Window 更宽且更易受越狱影响;大模型则因对齐训练收缩了表达范围。这暗示在资源受限、隐私敏感的恶意使用场景下,小模型可能成为更危险的工具,提醒安全评估不应仅以模型规模作为风险代理。
  • 越狱技术的跨家族迁移性与组合堆叠效果揭示了开源 LLM 的系统性脆弱性。单种越狱提示的提升有限,但本文发现的强组合能将窗口扩大多倍,且某些技术对特定家族效果突出。这种非均匀的脆弱性分布意味着攻击者可针对模型特性选择最优越狱栈,给通用防御设计带来显著挑战,并催生了一种识别有效越狱组合的工作流。

方法

方法概览

该框架通过三个核心环节量化 LLM Overton Window (OW)(即模型在争议话题上可稳定表达的政治观点范围)及其在越狱下的扩展。

输入

  • 从政治光谱中选定的争议话题(如移民、经济政策),每个话题配有左/右两个方向的意见陈述作为生成基准。
  • 待测开源 LLM(30+ 个,覆盖 10 个模型族、5 个原产国)。
  • 一批人类可读的越狱提示模板(如角色扮演、伪学术讨论等),可单用或组合成“越狱栈”。

关键模块

  1. 生成协议 – 对每个话题,使用标准化提示让模型生成不同政治倾向的社交媒体内容(如推文)。提示包含明确的立场指令(“从支持[话题]的角度生成一条推文”)。系统记录模型拒绝生成(如输出安全声明)的情况,拒绝率直接影响 OW 的宽度。
  2. 越狱干预 – 在基础提示前附加越狱模板,形成越狱栈。研究两类简单技术:单技术效应与多技术组合,并评估不同模型族间的越狱可迁移性。
  3. 自动化评估 – 使用LLM Judge(经人类标注校准的单一强模型)对生成文本的政治倾向进行左/右分类,同时标记安全拒绝。通过消融实验选定最优判断模型,确保与人类标注一致(Cohen’s κ 等指标)。

输出

  • 每个模型在零射击、单越狱、组合越狱下的 Overton Window:即在左右方向上最终生成内容的覆盖区间(可生成且不被拒绝的立场范围)。
  • 越狱效能指标:OW 的扩展幅度、拒绝率下降程度。

与同类方法的差异点:区别于仅测量模型内在政治偏见的静态基准,本框架动态模拟恶意行为者利用越狱栈扩大模型政治表达边界的过程,并引入 Overton Window 这一可操作的审计指标,将红队评估从“是否越狱”升级为“越狱后能操控出多大的观点空间”。

实验

实验设计

该研究构建了一个红队框架,用于测量 LLM Overton Window (OW) ——模型在争议话题上可可靠生成的政治观点范围。实验选取 20 个敏感政治议题,每个议题对应一组立场声明,要求模型生成模拟社交媒体帖子。通过对比无越狱、单种越狱及组合越狱三种条件,系统探测模型的表达边界。评估涵盖 10 个模型家族、30+ 开源 LLM,来自 5 个不同国家,所有模型均本地部署以贴合恶意行为者的隐私与算力约束。

关键发现

  • 政治表达不对称:开源 LLM 普遍更易生成左倾内容,反映出预训练数据的系统性偏见。
  • OW 与模型规模反相关:参数量越大,OW 越窄,对齐技术似乎抑制了小模型本可覆盖的观点。
  • 区域差异显著:不同国家来源的模型 OW 形态差异大,开源生态内地域代表性极度不均衡。
  • 越狱有效性分化:简单自然语言越狱可显著扩展 OW,但各模型家族脆弱性迥异;组合多种越狱技术能实现叠加效应,进一步放大操控空间。

与基线及同类工作的对比

传统对齐研究常假定模型越大安全性越高,但本实验发现 小模型反而拥有更宽的政治表达窗口,挑战了“规模即安全”的直觉。此外,与多数聚焦于单模型、单语种的偏差评测不同,该框架首次从 可操控性视角 量化了开源 LLM 的政治导向能力,并揭示了越狱技术跨家族传递的有效性,为防御策略设计提供了新的攻击面认知。

行业影响

落地场景

该框架直接服务于社交媒体内容审核、信息安全与 AI 安全评估等领域:

  • 内容平台(如 X、Reddit、Meta)可利用其审计内部 LLM 驱动的推荐、自动回复或审核助手,检测模型在争议话题上的政治表达窗口,防止被用于自动化影响力营销。
  • AI 模型市场(如 Hugging Face、Ollama)可在模型发布前集成该评估,为下游用户提供政治表达窗口指标,降低恶意滥用的合规风险。
  • 企业安全团队通过定期扫描开源模型越狱漏洞,提前发现潜在的信息操控攻击面。

商业价值

  • 降本:自动化审核 LLM 政治倾向,减少人工红队测试开销;早期发现越狱漏洞可避免事后公关与法律成本。
  • 增收:将“AI 安全评级”作为模型卡片或 SaaS 增值服务,吸引注重信息完整性的政企客户,形成差异化竞争力。
  • 体验提升:帮助平台维护公正、多元的讨论环境,降低极端内容带来的用户流失风险。

与现有产品 / 工作流的接口

  • 集成 MLOps 流水线:在 CI/CD 中加入 llm-overton-external 评测环节,对每次模型更新自动生成政治表达窗口报告,阈值告警。
  • 内容审核增强:作为现有审核系统的前置过滤器,对 LLM 生成的内容进行意识形态透视,标记异常倾向文本。
  • 安全合规 Dashboard:通过 Grafana 等可视化工具展示模型家族、尺寸、地区的越狱脆弱性对比,辅助安全决策。

具体落地 Use Case

  1. 全球社交媒体平台(如 X):使用该框架批量测试其内容生成类 Bot 背后的开源 LLM(如 Llama 3、Mistral),识别出对左 / 右倾观点表达意愿的显著非对称性,并据此调整系统提示或拒绝采样策略,确保公共讨论区的中立性。
  2. 企业级 AI 平台(如 Hugging Face Hub):在模型仓库中内置 Overton Window 评测结果,允许用户按“政治表达保守度”筛选模型,尤其在面向政府、非营利组织的 AI 应用中,保证输出符合预期价值观。

局限

  • - **仅覆盖开源本地模型**:论文聚焦于本地部署的开源 LLM,排除了 API-only 的前沿模型(如 GPT-4、Gemini)。这一选择虽然贴近隐私敏感的攻击者场景,但忽略了商业 API 模型在安全防护和越狱抵抗力上的差异,导致结论对外部效度有限,且无法对比不同部署模式下模型政治表现力的系统性区别。
  • - **越狱技术集相对简单**:研究仅测试了角色扮演、上下文重写等基于自然语言的 prompt 越狱,未涉及多模态攻击、对抗性微调或更复杂的自动化越狱链。因此,测量出的 Overton Window 扩展可能低估了真实恶意行为者的操纵能力,所提出的越狱组合流程也可能不具备对新兴攻击的泛化性。
  • - **政治倾向度量依赖单一 LLM 评判**:Overton Window 的标注和扩展幅度完全由选定的 LLM 判定器(GPT-4o)决定,虽然经过人工验证,但评判器本身可能存在立场偏误。此外,将政治观点简化为左-右单维连续谱可能无法捕捉现实舆论的多维复杂性,尤其是不同文化语境下争议话题的异质性。
论文Daniel C. Ruiz2026-05-20原文

相关内容