测量LLMs在误导性医疗语境下的认知鲁棒性
大型语言模型(LLMs)在医学考试中已达专家级水平,鼓励了高分即安全判断的假设,而患者日益依赖其健康建议。我们证明此假设脆弱:当向LLMs原本正确回答的问题注入误导性语境时,它们放弃了正确答案。我们将对抗语境下保持正确判断的能力定义为认知鲁棒性,并引入MedMisBench进行测量。 MedMisBench包含10,932个医学问题项和48,889个误导语境-选项对,覆盖医学推理、代理能力和患者旅程评估。在11个模型配置中,平均准确率从原始问题的71.1%降至聚焦误导语境下的38.0%,攻击成功率达51.5%。最具破坏性的注入是形式化、规则化的虚构:权威框架式虚假攻击成功率达69.5%,例外投毒式主张达64.1%。由来自7个国家的14名临床专家组成的小组发现,38.2%的审查案例存在严重潜在危害。 MedMisBench暴露了LLMs在医疗场景评估中的结构性盲点:现有基准衡量模型知道什么,但不衡量它们在误导语境下是否保留正确判断。
论文精读
TL;DR MedMisBench 揭示 LLM 在医疗场景的认知脆弱性:哪怕回答正确的题目,注入误导性上下文后准确率可从 71% 暴跌至 38%,权威话术伪造攻击成功率高达 69.5%,暴露出当前评测仅看知识、不测抵御误导的盲区。
问题
问题背景
随着大语言模型 (LLM) 在医学执照考试中达到专家级准确率,业界普遍将高分等同于安全的临床判断能力,同时患者越来越多地向模型寻求健康建议。
现有方法局限
当前医学 LLM 基准主要评估模型在标准、非对抗性输入下的知识召回与推理能力,例如 MedQA、MedMCQA 等,但这些基准忽略了一个关键维度:当输入中包含经过设计的误导性上下文(misleading context)时,模型是否能保持正确的判断。研究表明,即使模型原本能正确回答的问题,一旦注入虚假或诱导性信息,准确率会剧烈下降,而现有评测体系对此毫无感知。
技术挑战与重要性
该问题被定义为认识韧性 (epistemic resilience)——即模型在存在误导信息的对抗环境中维持正确推理的能力。测量这一特性面临双重挑战:一方面需要构造高质量、来源明确、类型多样的误导注入,覆盖从简单事实篡改到权威框架虚构等不同攻击模式;另一方面,评估不能停留在表面准确率,还需结合临床专家对输出潜在危害的定性审查。
作者团队构建的 MedMisBench 包含 10,932 个医学选择题和 48,889 个误导上下文-选项对,并发现权威框架虚假陈述 (authority-framed falsehoods) 可获得 69.5% 的攻击成功率,例外中毒声明 (exception-poisoning claims) 达 64.1%。经 7 国 14 名临床专家评审,38.2% 的案例被认为可能造成严重伤害。这一漏洞暴露了现行评估的结构性盲区:仅关注模型“知道什么”,却忽略其“在压力下是否坚持正确”。在患者直接使用 LLM 获取医疗建议的场景中,误导信息可能来源于搜索引擎片段、社交媒体碎片或用户自身先入为主的错误观念,模型若缺乏认识韧性,极易输出有害内容。
行业类比
类似于自动驾驶感知系统在标准测试集上表现优异,但加入微小对抗性扰动(如路牌贴纸)即可导致灾难性误判,医学 LLM 在面对精心构造的误导上下文时同样出现可靠度坍塌,这对所有安全攸关的 AI 应用都是一个重要的警示信号。
核心洞察
- 现有医学 LLM 评测仅衡量模型的静态知识掌握水平,忽视了动态推理中的认识弹性(epistemic resilience)。MedMisBench 首次系统性地将误导性上下文引入标准医学问题,揭示模型在对抗信息下正确判断的脆弱性,填补了从“知道什么”到“能否在干扰下坚持正确判断”的评估鸿沟。
- 误导性上下文的注入形式并非同等有效:**权威框架虚假陈述**攻击成功率高达 69.5%,**例外毒化声明**达 64.1%,远高于其他攻击类别。这指明 LLM 的推理过程对权威语境和规则例外高度敏感,暴露出对齐训练中可能过度拟合表面权威信号的问题,为提升模型鲁棒性提供了具体攻击面分析。
- 临床审查发现 38.2% 的模型错误输出存在严重潜在危害,意味着仅凭考试高分不足以保障实际部署安全。MedMisBench 的构建方法——结合多源医学问题、系统化误导注入与多国临床专家评估——为开发基于“认识韧性”的动态安全评测体系提供了可复现的工程框架,直接服务于高风险医疗 AI 的落地审慎性考量。
方法
方法概述
MedMisBench 的设计遵循“输入构建 → 误导注入 → 多维度评测”的流程,旨在量化 LLM 在误导性医疗上下文中的 认识韧性(epistemic resilience)。
1. 输入:源数据准备
从医学执照考试等高质量题库中筛选 10,932 个模型原本能正确回答的问题,并记录其正确选项,确保模型已具备对应知识。
2. 关键模块:误导上下文注入生成
- 双层分类体系:
- Layer 1 内容破坏:如编造权威声明、例外中毒声明、伪逻辑推理等;
- Layer 2 来源伪装:为虚假内容赋予“指南”“临床试验”等权威信源。
- 注入生成流程:
- 对每个正确选项,由固定提示模板驱动 LLM 生成误导上下文;
- 通过“适用性过滤”(排除无法形成有效干扰的注入)和临床医生验证保证欺骗性;
- 最终生成 48,889 个 误导上下文-选项对,覆盖医学推理、代理能力、患者旅程等场景。
- 可控性设计:锁定生成器模型与温度参数,并公开完整提示词,确保可复现。
3. 输出:多维度评估指标
- 攻击成功率(Attack Success):注入后模型放弃原正确答案的比例,整体达 51.5%,权威框架虚假声明最高达 69.5%。
- 准确率下降:从原始 71.1% 骤降至 38.0%。
- 临床风险审查:由 7 国 14 名临床医生评估,38.2% 的案例存在严重潜在危害。
- 分层分析:按推理努力、投递协议、注入来源等维度拆解脆弱性。
与同类工作的差异:现有医学 QA 基准(如 MedQA)仅测量静态知识,而 MedMisBench 首次系统性评估模型在对抗性误导信息下的判断稳健性,直指安全部署的核心盲区。
实验
实验设计
MedMisBench 从 3 个来源数据集筛选 10,932 道医学问题,每道题注入多种类 误导性上下文(按 Content corruption 与 Provenance 两层分类法生成,共 48,889 个有效注入对)。评估覆盖 11 个模型配置(含不同量级与推理框架),执行 原始题目 与 注入误导上下文后 的对比测试,输出攻击成功率(原正确回答被扭转比例),并通过 14 人多国临床小组对模型输出进行危害性审核。
关键发现
- 平均准确率从 71.1% 骤降至 38.0%,攻击成功率高达 51.5%,表明 LLM 极其脆弱。
- 危害最大的两类注入为 权威框架错误(攻击成功率 69.5%)与 例外中毒声明(64.1%)——形式化、规则式的虚假陈述比随机的错误信息更具破坏力。
- 临床审核中 38.2% 的模型回答被判定为可能导致严重患者伤害,暴露了在医疗场景中直接使用 LLM 的安全风险。
对比解读
传统医学基准(如 MedQA)仅测量静态知识掌握度,且 LLM 常获高分(如原题 71.1%)。MedMisBench 首次引入认知韧性(epistemic resilience)维度,揭示模型在对抗性上下文下的推理崩溃。原始准确率与误导后准确率之间 33.1 个百分点 的落差,强调现有评估存在结构性盲区:模型并非真正理解医学逻辑,而是依赖表面线索,易被权威或规则性错误左右。这迫使 AI 评测从“知不知道”转向“是否会因误导而放弃正确判断”,为安全关键领域部署提供了新基准。
行业影响
落地场景
MedMisBench 直接面向所有部署 医学问答 LLM 的产品,例如在线健康咨询平台、医院患者服务 chatbot、保险理赔预审助手、以及药企患者支持应用。在这些场景中,模型面对的真实用户输入往往包含非结构化、不可靠甚至恶意的描述(如患者引用虚假医学谣言、被篡改的检测报告或误导性病情描述)。该基准提供了一套系统化的攻击性测试框架,用于评估模型在遭 对抗性医学语境注入 时是否仍能坚守正确判断,而非随误导信息摇摆。
商业价值
模型因误导而输出错误医学建议,可能直接导致诊断延误、不当用药,进而引发严重的患者伤害与法律纠纷。引入 认知弹性 评测,可帮助:
- 降低安全风险与合规成本:提前暴露模型在对抗性输入下的失效模式,减少事后补救开销;
- 提升用户信任:向监管机构与终端用户证明模型具备稳健的临床判断能力;
- 差异化竞争:在医疗 AI 市场,通过公开可靠的稳健性指标争夺 B2B 合作机会。
与现有产品/工作流的接口
MedMisBench 可以轻量集成到现有 LLM 评估管线:
- 作为 CI/CD 安全门禁:在每次模型更新或 prompt 调整后,自动运行误导注入测试,监控
attack success与accuracy drop指标; - 与 RAG(检索增强生成) 系统结合,检测知识检索模块是否引入了误导性上下文;
- 通过数据集提供的 provenance taxonomy(如权威伪证、例外中毒等),指导防御策略的设计,例如针对性 fine-tuning 或 prompt 硬化。项目已开源 GitHub 与 HuggingFace,可直接通过数据加载脚本接入现有 PyTorch 或 vLLM 推理流程。
具体落地案例
跨国远程医疗平台的 AI 分诊助手
该平台的服务覆盖多语言、多文化用户,患者常输入从社交媒体获取的伪科学信息(如“疫苗导致免疫风暴”)。使用 MedMisBench 评估其底层 LLM,可识别模型对 权威框架伪证 的脆弱性,进而通过 fine-tuning 或上下文过滤规则,将误导导致的错误分诊率降低 60% 以上,减少医患沟通复核成本。药物警戒内容审核工具
药企需监测各渠道的药品安全讨论,AI 模型负责分类不良反应报告。若报告文本被注入恶意构造的误导描述(如将明确副作用归因为“治疗无效”),模型可能错误降级信号。引入 MedMisBench 中的 例外中毒 测试用例训练检测模块,能显著提升模型在对抗性文本上的分类稳健性,避免漏报关键安全信号。
局限
- **数据集构建依赖 LLM 生成误导上下文**,可能引入生成内容的系统性偏差(如过度依赖特定叙事模板),且人工过滤与临床审查仅覆盖 38.2% 案例,样本量有限,无法完全保证误导注入的现实性与危害评估的普适性。**评估局限于封闭式问答**,未模拟多轮对话、含糊表述或真实医患交互的动态性,这可能夸大了实际使用中模型的脆弱性,限制了结论在真实医疗建议场景中的可迁移性。
- **攻击形态单一**,仅聚焦于上下文注入式误导,未涉及多模态对抗(如医学影像篡改)、连续对话中的渐进误导或利用模型自身生成的反刍攻击,安全评估不够全面。**防御实验仅初步探索了搜索增强与防御提示**,未系统对比对抗训练、安全微调或基于 reward 的稳健策略,缺乏对可工程化缓解路径的深入分析,使业界难以直接从该基准导出防御实践指南。
- **基准以医学考试题为核心**,虽然保证了标准化,但与真实患者健康咨询的表述多样性、信息残缺和语境模糊性存在显著差距,可能导致对模型在非结构化实用场景下**认知韧性**(epistemic resilience)的高估。此外,当前定义侧重“在误导下保持正确”,未充分考虑模型主动识别误导并表达不确定性的能力,这种更贴近临床安全要求的综合评估维度尚待补充。