论文

Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

标准准确度基准测试用于评估大语言模型(LLMs)趋近正确答案的程度,但不适合测试当正确答案受到合理反驳时模型是否坚持原答案。我们提出一种受控协议来评估答案稳定性:在模型正确回答多项选择题后,用支持错误选项的连贯论点挑战模型,并测量模型是否翻牌(flip)。该设置 a) 将论证内容与公开社会压力隔离,b) 改变论证长度、自归因(self-attribution)和跨模型来源。在七个前沿模型和 57 个 MMLU 主题上,翻牌率范围从 17.5% 到 97.3%,揭示了准确度指标无法捕捉的巨大稳定性差异。 我们发现自归因一致地提高翻牌率(平均 +7.1 个百分点,最高 +18.7 个百分点)。此外,跨模型汇集错误答案论证并针对每个问题选择最有效的论证,比依赖单一源模型产生更强的对抗性挑战。我们进一步构建了 MaxFlip,一个精心策划的挑战集,相比标准自生成挑战将翻牌率提高多达 +23.6 个百分点。我们发布该协议、挑战记录和 MaxFlip,以支持与标准准确度基准并行的稳定性评估。材料可在 https://github.com/nafisenik/WhoFlips 和 https://hf.co/datasets/nafisehNik/WhoFlips 获取。

论文精读

TL;DR 本研究通过可控反驳协议量化LLM答案稳定性,发现翻转率17.5-97.3%、自我归因显著放大不稳定,并构建MaxFlip挑战集以暴露脆弱性。

问题

问题背景

当前 LLM 评估体系高度依赖静态准确率基准(如 MMLU、HellaSwag),衡量模型能否给出正确答案。但实际对话中,用户常在模型答对后追加质疑、引入对立推理,或另一模型输出不同选项并附论证。此时模型是否仍坚持正确答案,远比首次准确率更能反映其可信度鲁棒性

现有方法的局限

标准准确率测试将问答视为一次性交互,完全忽略后续对话压力下的答案稳定性。现有对抗性评测(如 red-teaming、对抗样本攻击)多聚焦于诱导初始错误,而非挑战已给出的正确回答。少数一致性研究仅测量同模型重复采样下的自我相符度,未引入外部反驳信息。这些盲区导致高准确率模型在实际多轮对话中轻易被说服,显现出虚假的可靠性

为什么这个问题难且重要

答案稳定性本质上是模型在证据冲突下的信念保持能力。LLM 缺乏内在事实核查机制,其输出高度依赖提示上下文。当一段看似合理的错误论证被注入,模型需权衡自身知识表征与即时输入,极易被论证连贯性而非真值左右。论文揭示,翻转率从 17.5% 到 97.3% 不等,且自引式反驳(声称论证来自模型自身)系统性提升翻转率达 +18.7pp,揭示模型对自身先前提议的脆弱性。这种不稳定性直接威胁医疗、法律、金融等高风险辅助场景——若模型在专业修正意见下反复摇摆,用户信任将迅速瓦解。

行业类比

这类似于自动驾驶系统在识别停车标志后,因对抗性贴纸或恶意路灯信号干扰而瞬间改判为限速牌:首次识别正确并不保证后续决策不被上下文攻击劫持,系统必须对关键判断具有上下文抗扰动能力

核心洞察

  • 翻转率作为答案稳定性度量:现有基准仅评估模型是否答对,而忽略其在受到挑战时能否坚持正确答案。本文提出的翻转率指标,衡量模型在收到针对错误选项的合理反驳后改变答案的概率,揭示了正确性之外的另一重可靠性维度。这一视角独特之处在于,它将评估从静态知识检索拓展到动态的论证交互,暴露了模型在高置信度正确回答后仍可能出现的不一致行为,为鲁棒性研究提供了新的量化工具。
  • 自我归因效应放大脆弱性:实验表明,当反驳论据声称来自模型自身(self-attribution)时,翻转率平均上升7.1个百分点,最高可达18.7个百分点。这暗示模型对“自我生成”的内容具有更高的信任度,从而更容易被看似自洽的反驳说服。该发现挑战了常见假设——模型应能识别自身推理并保持一致性,实际却表明自我引用可作为攻击向量,揭示了内部知识表征与对话动态之间的深层脱节,对构建安全AI助手具有直接启示。
  • 跨模型池化构建MaxFlip对抗集:不同于从单一模型生成反驳,作者通过从多个模型中收集错误选项的论证,再选取每个问题上最有效的反驳,构建了MaxFlip数据集,将翻转率进一步推高23.6个百分点。该方法揭示了模型之间在说服力上的互补性,单一最强反驳往往不是来自同一个模型,而池化后选择最优攻击极大地提升了评估的严格性。这种跨模型对抗策略为红队测试和安全性基准提供了更高效、更全面的压力测试范式。

方法

两阶段对抗稳定性评估协议

输入:一组多选题(源自 MMLU 的 57 个学科),每个问题配有正确选项与由语言模型生成的、支持某个错误选项的连贯反驳论证。论证可来自被测模型自身(self-attribution)或其他模型(cross-model)。

关键模块

  1. 第一阶段——正确应答筛选
    让目标模型回答原始问题,仅保留首次即答对的实例。该步确保后续挑战发生在模型“已知”正确答案的假设上,排除因缺乏知识导致的随机翻转。

  2. 第二阶段——对抗挑战注入
    将正确选项与一个误导性反驳论证拼接为新的 prompt,再次询问模型。为避免社会压力等混淆因素,论证以纯文本形式呈现,不含对话角色标记或权威暗示(如“你错了”)。协议变量包括:

    • 论证长度:短(1句)与长(3句及以上)
    • 归因来源:自称来自模型自身(如“I think the answer should be …”)或来自另一模型
    • 论证来源模型:Claude、GPT-4o、Llama 等七款前沿模型
  3. 翻转判定与指标
    比较第二阶段答案与第一阶段答案,若变为反驳所指向的错误选项则记为一次 flip。主要指标为翻转率(Answer Flip Rate, AFR),即正确回答中被翻转的比例。

  4. MaxFlip 挑战集构建
    为最大化模型不稳定性,作者跨模型收集针对同一问题的多个错误论证,筛选其中翻转成功率最高的论证,形成 MaxFlip 数据集。该集通过选择性汇集最有效的对抗样本,系统性地放大了翻转效应。

输出:每个模型的整体翻转率、按学科分层的稳定性剖面,以及经 MaxFlip 强化后的对抗鲁棒性评分。实验表明,self-attribution 使翻转率平均提升 7.1 个百分点(最高 +18.7 pp),且跨模型论证汇集比单一来源更具攻击性。

与同类方法的差异:传统准确率基准仅衡量知识覆盖度,本研究首次用受控的纯论证挑战剥离社交压力影响,直接评估 LLM 在面对合理反驳时能否坚守正确推理,填补了稳定性评估的空白。

实验

实验设计

论文提出两阶段协议评估 LLM 的答案稳定性:模型先回答 MMLU 选择题并确认正确;随后接受一条指向错误选项的反驳论证,观察是否翻转答案。论证属性独立调控:

  • 长度:短(~50 tokens)、中(~100 tokens)、长(~200 tokens)
  • 归因:无归因 vs. 自我归因(声称由模型自己生成)vs. 跨模型归因
  • 来源:7 个前沿模型自生成或跨模型池化

实验覆盖 57 个 MMLU 学科,生成超 70k 次挑战。

关键发现

  • 翻转率差异巨大:模型间从 17.5% 到 97.3%,即使高精确度模型也可能极不稳定,传统准确率无法体现这一维度。
  • 自我归因系统性地提高翻转率:平均增加 7.1 个百分点,暗示模型对“自己先前输出”的信任度不足。
  • 跨模型池化构造最强攻击:汇集各模型为错误选项生成的反驳,并选取每次最有效的论证,形成 MaxFlip 挑战集,较标准自生成挑战再放大翻转率 23.6 pp。
  • 第一阶段拒答不预示第二阶段稳健性:模型若在初始回答时拒答,并不代表它在受到反驳时更稳固。

对比解读

与标准基准(仅统计正确率)相比,本工作引入对抗一致性维度。此前类似工作(如 TruthfulQA、Adversarial NLI)侧重模型被骗的容易度,但未剥离论辩内容与社会压力,且翻转率的粒度和可控性较弱。本协议通过分离归因和长度,揭示模型对内容而非来源的(不)信任模式,为安全评估(如模型是否易被说服传播错误信息)提供了可复现的框架。同时,MaxFlip 可作为高难度稳定性测试集,补充现有精度排行榜。

行业影响

模型稳定性评估成为安全部署刚需

当前 LLM 评估主要依赖准确率,但真实交互中用户频繁质疑、反驳或引入竞争推理。Who Flips 揭示模型正确答案在遇到合理反驳时极易翻转(翻转率 17.5%–97.3%),暴露了静态准确率无法捕获的稳定性缺口。

落地场景
  • 对话式 AI 助手:客服机器人、教育辅导系统、医疗预问诊等场景中,用户质疑 AI 的回答后,模型需保持科学共识或证据而不被带偏。例如,在线医疗平台 AI 给出诊断建议后,患者以“网上说另一种疗法更好”反驳,模型需稳定解释而不轻易翻转。
  • 信息可信度审核:事实核查工具中,AI 需在对抗性话语下坚守已验证答案,避免被虚假论证诱导。
  • 多智能体辩论系统:自治代理协同决策时,可评估自身论点稳定性,防止被劣势证据翻转。
商业价值
  • 增强用户信任与留存:答案不稳定直接损害用户体验,尤其在金融顾问、法律咨询等需高度可靠性的场景,降低 flip rate 可减少投诉与流失。
  • 降低人工兜底成本:模型频繁翻转导致人工介入率上升;稳定性高的模型可减少审核人力,直接降本。
  • 模型选型新指标:在采购或自研模型时,将 flip rate 作为鲁棒性补充指标,筛选更契合关键任务(如医疗、自动驾驶)的模型,规避重大风险。
与现有工作流的集成
  • 评估管道扩展:将 flip 测试嵌入现有 CI/CD 评测(如集成至 lm-evaluation-harness),在准确率基准之上新增稳定性层。只需构造反驳模板和跨模型挑战集(类似 MaxFlip),即可自动化产出 flip rate 报告。
  • 红队测试强化:安全团队可利用跨模型反驳池化技术,自动生成最强对抗参数,对生产模型进行压力测试,提前发现易被操纵的知识盲点。
  • 模型对齐与微调反馈:通过分析 flip 样本分布(如哪些学科易翻转),定向补充训练数据或调整 RLHF 偏好,提升模型在特定领域的抗反驳能力。
具体应用案例
  1. 电商智能客服:用户询问“推荐哪款手机?”,AI 基于需求推荐 X 型号。用户反驳“可评测说 Y 续航更强”,模型如翻转则可能推荐错误产品,影响转化率。引入稳定性测试后,可要求模型在接收反驳后坚守正确推荐或给出证据而非轻易翻转,提升转化信任。
  2. AI 法律助手:律师查询判例,AI 给出正确引用并解释;对方律师以“某新法规已推翻此先例”反驳。若模型无依据翻转,可导致法律建议错误。实际部署前用 flip 测试筛选模型,可避免此类风险。

局限

  • 实验仅基于 **MMLU** 的 57 个科目多选题,限制了结论对推理、生成、开放式问答等任务类型的泛化能力。翻转判断仅考虑首轮挑战后的单次回答变化,未模拟真实多轮交互中用户反复质疑、模型逐步修正的动态过程,低估了长对话场景下的稳定性复杂性。
  • 反驳论点由 LLM 生成,虽通过长度、归因等变量控制,但本质上仍属同分布合成数据,缺少真实人类对抗攻击的多样性(如含梯度的对抗样本、高情商误导)。翻转率对 prompt 细节敏感,仅变更归因标签(自我/交叉)就带来显著差异,缺乏对其他 prompt 设计因素的系统消融,结论的鲁棒性存疑。
  • **MaxFlip** 挑战集通过跨模型筛选最强反驳论点构建,本质是对特定模型组合的过拟合题库,可能放大个别模型的脆弱模式,不宜简单推广为通用稳定性基准。此外,研究停留在行为现象统计,未从模型训练、校准机制或不确定性量化角度解释翻转成因,对提升实际部署稳定性的工程指导有限。
论文Nafiseh Nikeghbal2026-06-14原文

相关内容