论文

LingxiDiagBench: 用于在中文精神科咨询与诊断中基准测试大语言模型的多智能体框架

LingxiDiagBench: 用于在中文精神科咨询与诊断中基准测试大语言模型的多智能体框架

心理健康障碍在全球范围内高度普遍,但精神科医生的短缺以及基于面谈的诊断固有的主观性,为及时、一致的心理健康评估造成了重大障碍。AI辅助精神科诊断的进展受到缺乏能够同时提供逼真患者模拟、临床医生验证的诊断标签并支持动态多轮咨询的基准的限制。 我们提出 LingxiDiagBench,这是一个大规模多智能体基准,用于在静态诊断推理和动态多轮中文精神科咨询中评估大语言模型。其核心是 LingxiDiag-16K 数据集,包含 16,000 个与电子病历(EMR)对齐的合成咨询对话,旨在重现 12 个 ICD-10 精神类别的真实临床人口统计和诊断分布。 通过涵盖最先进大语言模型的广泛实验,我们得出关键发现: 1. 尽管大语言模型在二元抑郁-焦虑分类上达到高达 92.3% 的准确率,但在抑郁-焦虑共病识别(43.0%)和 12 类鉴别诊断(28.5%)上性能显著下降; 2. 动态咨询的表现通常低于静态评估,表明无效的信息收集策略严重损害了下游诊断推理; 3. 通过大语言模型作为评判者评估的咨询质量与诊断准确率之间仅存在中等相关性,表明结构良好的提问本身并不能确保正确的诊断决策。 我们发布 LingxiDiag-16K 和完整的评估框架,以支持可重复研究(https://github.com/Lingxi-mental-health/LingxiDiagBench)。

论文精读

TL;DR LingxiDiagBench 是一个多智能体基准,通过 16K 对话评估 LLM 在中文精神科会诊中的动态问诊与鉴别诊断能力,揭示问诊策略质量与最终诊断准确度之间仅中度相关,动态交互反而可能劣于静态推理。

问题

问题背景

全球精神障碍患病率持续攀升,诊断高度依赖临床访谈,但精神科医生严重短缺,且基于访谈的主观判断常导致诊断不一致与延迟。AI 辅助诊断被视为缓解这一供需矛盾的关键路径,然而其开发与评测长期受限于缺乏能够真实模拟临床动态的基准环境。

现有方法局限

当前 LLM 医学评测基准大多聚焦于静态知识问答或单轮分类任务,存在三个核心技术短板:

  1. 交互模式单一:无法支持多轮动态问诊,模型的信息收集能力未被充分检验,静态推理与真实咨询性能之间出现显著断层。
  2. 临床真实性不足:数据集多基于教科书或考试题构造,未与真实电子病历 (EMR) 的 诊断分布、人口学分布 对齐,且缺乏经精神科医生验证的 ICD-10 诊断标签
  3. 诊断粒度粗糙:现有评测以二分类(如抑郁 / 焦虑)为主,回避了临床真正棘手的 共病识别多类别鉴别诊断,无法体现模型的临床可应用性。

为什么该问题重要且难以解决

  • 动态信息获取的策略挑战:医生需在有限时间内选择关键提问,不良的提问顺序或遗漏关键症状会严重恶化下游诊断推理。实验发现即使 咨询质量评分 高,与 诊断准确率 仅呈中度相关,说明“话说得好”不等于“诊断正确”,这对以对话流畅度作为主要评估指标的做法提出了根本性质疑。
  • 诊断复杂性远超当前模型能力:论文揭示在 12 类鉴别诊断 上最优模型准确率仅 28.5%,而 抑郁 - 焦虑共病 识别率低至 43.0%,暴露出 LLM 在综合多线索、区分重叠症状上的深层弱点,这触及了医疗 AI “容错率趋零”的核心要求。
  • 行业关注度激增:随着 心理健康聊天机器人 的商业化加速,监管机构与学术会议对测评基准的可重复性、临床保真度及风险评估框架提出更高要求,缺乏科学基准的模型部署可能带来严重的公共卫生风险。

行业类比:这好比自动驾驶仿真从封闭赛道走向动态交通流 —— 精神科 AI 评测必须从 选择题题库 升级为 全流程对话仿真,才能真正衡量系统的临床决策能力。

核心洞察

  • 动态咨询中信息收集策略的失效是诊断准确率下滑的根本瓶颈,而非模型本身的推理能力不足。该洞察的独特之处在于,它通过对比静态诊断 (基于完整病历) 与动态多轮问诊的性能差异,定量揭示了当前 LLM 在主动询问、鉴别诊断相关的关键症状方面存在系统性缺陷——即使拥有强大的推理能力,若无法在对话中精准地挖掘出诊断所需的信息,最终的决策准确率就会显著下降。这与以往仅关注静态诊断 benchmark 的工作形成鲜明对比,为优化 AI 精神科问诊指明了方向:应优先改进询问策略,而非仅仅扩大模型规模。
  • 从二分类抑郁-焦虑分类(92.3% 准确率)到共病识别(43.0%) 再到 12 类鉴别诊断(28.5%) 的性能悬崖,暴露了 LLM 在真实临床场景中的根本脆弱性。不同于大多数现有基准仅提供少数几类疾病的离散评估,LingxiDiagBench 首次在单一框架内覆盖完整的 ICD-10 精神障碍分布,并纳入了 12 类共病组合。这一定量结果揭示了模型在复杂、重叠症候群上的认知坍塌——它们能够处理粗粒度的筛查,但无法完成精神科医生日常面对的高熵诊断任务,因此该基准成为测量并推动模型临床实用性最有价值的试金石。

方法

输入与数据构建

基准构建的起点是真实电子病历(EMR)数据,经脱敏与专家校验后形成 LingxiDiag-Clinical 数据集,覆盖 12 个 ICD-10 精神科诊断类别,并严格保持真实临床的人口统计与诊断分布。基于该种子集,通过多智能体合成管道生成 LingxiDiag-16K 数据集,包含 16,000 条EMR 对齐的合成咨询对话,每条对话由“患者主诉 – 医生追问 – 诊断结论”多轮结构组成。

多智能体咨询模拟

动态评估的核心是一个三智能体系统:

  • 患者智能体(Patient Agent):依据合成病历扮演标准化患者,能根据医生提问提供符合其病史和症状的自然语言应答,行为需保持临床一致性。
  • 医生智能体(Doctor Agent):由待评测 LLM 驱动,负责主动提问收集信息,其策略决定问询效率与信息密度。
  • 诊断智能体(Diagnosis Agent):基于完整对话历史给出最终诊断标签,可选用 LLM-as-a-Judge 或专家规则。

评估模式与输出

框架提供两种评估模式:

  1. LingxiDiagBench-Static:一次性输入完整病史与对话,要求 LLM 直接推理诊断,模拟病历回顾任务。
  2. LingxiDiagBench-Dynamic:LLM 扮演医生与患者智能体多轮交互(受回合数限制),最终由诊断智能体输出诊断,衡量信息获取与诊断的联合能力。

评估指标覆盖分类准确率(二分类、共病识别、12 类鉴别诊断)、对话质量评分(LLM-as-a-Judge 对提问结构、信息完整性等打分),并分析两者相关性。

与同类方法的差异

现有精神科诊断基准多聚焦单轮图文分类或仅提供静态病例,而 LingxiDiagBench 首次在统一的合成数据框架下同时支持动态多轮咨询模拟真实临床分布对齐,并量化揭示问询质量与诊断准确率的弱相关性,为 LLM 问诊策略优化提供了可复现的工程测试床。

实验

实验设计

本文构建了一个多智能体评估框架 LingxiDiagBench,包含静态诊断推断(LingxiDiagBench-Static)和动态多轮咨询(LingxiDiagBench-Dynamic)两种模式。核心数据集 LingxiDiag-16K 包含 16,000 条与真实电子病历分布对齐的合成对话,覆盖 12 类 ICD-10 精神障碍。评估中,患者智能体根据诊断标签生成症状会话,医生智能体(待评估 LLM)进行信息收集,最后由诊断智能体根据对话给出诊断。静态评估直接基于完整患者描述进行推理,动态评估则模拟真实问诊流程。

关键发现

  • 表现断层明显:LLM 在简单二元分类(抑郁 vs. 焦虑)上可达 92.3% 准确率,但抑郁-焦虑共病识别骤降至 43.0%,12 类鉴别诊断仅 28.5%,显示细粒度及复杂共病场景的巨大挑战。
  • 动态交互反而不利:动态咨询准确率普遍低于静态推理,表明当前 LLM 的信息收集策略低效,影响了后续诊断决策。
  • 问诊质量与准确度脱节:使用 LLM-as-a-Judge 评估的问诊质量得分与最终诊断准确率仅呈中等相关,说明结构良好的提问并不意味着正确诊断,推理链本身更关键。

与基线的对比解读

此前缺乏同时具备真实患者模拟、临床验证标签和多轮对话支持的精神科诊断基准。LingxiDiagBench 填补了这一空白,并首次系统揭示了动态交互下推理的劣化现象。与单纯依赖静态题库的评估相比,该基准更贴近真实临床,也暴露了当前 LLM 在主动探查、共病识别和鉴别诊断中的短板。这对工程实践的核心启示是:仅提升模型知识广度或单轮问答能力不足够,必须优化多轮决策策略与推理鲁棒性,未来可能需要结合搜索增强或临床决策树来弥补信息获取的不足。

行业影响

落地场景

LingxiDiagBench 可直接嵌入以下产品与业务:

  • 数字心理健康平台:在线心理咨询、自助式认知行为疗法(CBT)应用中,评估对话式 AI 的初步分诊能力,辅助用户筛查抑郁、焦虑等常见精神障碍。
  • 医疗保险公司与远程医疗:自动核保或预授权环节,识别高风险精神共病;分诊导诊中快速判断是否需转介精神科,缓解专业人员缺口。
  • 药物临床试验与真实世界研究:患者招募时,利用 LLM 进行结构化的精神症状采集和初步诊断,加速筛选符合 ICD-10 标准的受试者。

商业价值

  • 降本:减少精神科医生重复性初筛工时,降低因误诊或不及时干预导致的长期医疗支出;合成对话数据替代昂贵的人工标注,降低 LLM 评测成本。
  • 增效:通过基准筛选出诊断推理更强的模型,提升自动化分诊的准确率和覆盖率,扩大服务受众规模;动态咨询评估暴露信息收集策略缺陷,指导对话流优化,提高每次会话的诊断有效率。
  • 体验提升:高质量的多轮咨询模拟使模型能学会更自然的追问逻辑,减少机械感,增强用户信任与依从性,从而改善健康结局。

与现有产品/工作流的接口

  • CI/CD 评测管线:将静态和动态基准作为模型选型的 KPI 指标,与 F1、BLEU 等传统 NLG 评价并行,确保上线模型具备可靠的诊断推理。
  • 对话系统训练环境:利用 LingxiDiag-16K 和患者智能体构建强化学习环境,对 LLM 进行咨询策略微调,再部署到医疗对话引擎。
  • 电子健康记录 (EHR) 集成:其 EMR 对齐的合成数据生成管道可作为隐私保护的数据增强组件,输出标准化的 ICD-10 诊断编码,与现有临床决策支持系统对接。

具体应用案例

  1. 全球心理健康数字疗法公司(如 Woebot Health、Wysa):将基准纳入其 CBT 聊天机器人的回归测试,评估新版 LLM 在共病焦虑-抑郁场景下是否退化,确保临床安全性后推送至百万用户 App。
  2. 跨国保险科技企业:在自动核保流程中,候选模型须通过 LingxiDiagBench 的 12 类鉴别诊断测试,权衡敏感度与特异度,降低精神类疾病漏赔风险,同时避免过度调查投诉。

局限

  • **合成对话 vs. 真实临床交互差距** LingxiDiag-16K 是完全基于临床病历合成的对话,虽做了人口学与诊断分布对齐,但患者代理在模拟真实求助者的情感波动、矛盾表达或非结构化主诉上仍有失真风险;动态评估中医生代理的追问策略也由预定义模板驱动,难以复现精神科问诊中因个体差异产生的试探性提问、关系建立与即时修正,这限制了评估结论向真实场景的外推。
  • **单语种与单一诊断体系约束** 基准仅覆盖中文且严格遵循 ICD-10 标准,对于其他语言环境及 DSM-5 等主流诊断框架的适配性未知。精神病理构建的文化敏感性、跨语言症状表述差异均会影响模型诊断行为,当前结果无法反映多语言 LLM 在多元文化背景下的表现,泛化能力验证不足。
  • **复合诊断与临床决策链路的评估缺口** 实验揭示了共病识别(43.0%)与 12 路鉴别诊断(28.5%)的显著性能衰退,但基准并未深入分析错误模式(如混淆矩阵、假阴性/阳性分布)或引入临床决策链路的中间步骤评估(如症状提取、鉴别列表排序),因此无法给出模型在真实诊断流程中具体薄弱环节的工程改进指引。
论文Shihao Xu2026-06-11原文

相关内容