ClinSeekAgent: 自动化多模态证据寻求的智能体临床推理
大型语言模型(LLM)和智能体系统在临床决策支持中展现出潜力,但现有工作大多假设证据已预先整理好并交给模型。实际临床工作流则要求智能体主动寻求、迭代规划,并综合来自异构来源的多模态证据。 本文提出 ClinSeekAgent,一个自动化智能体框架,用于动态多模态证据寻求,将范式从被动证据消费转变为主动证据获取。仅给定临床查询和原始数据源访问权限,ClinSeekAgent 通过查询医学知识库、导航原始电子健康记录(EHR) 和调用医学影像工具来收集证据;随着新信息出现而优化假设;并将收集的证据整合为基于临床的决策。ClinSeekAgent 既可作为前沿 LLM 的推理时智能体,也可作为训练时流水线,将高质量智能体轨迹蒸馏到紧凑的开源模型中。 为验证推理时有效性,我们构建了 ClinSeek-Bench,将基于固定预选证据的 Curated Input 推理与基于原始临床数据的 Automated Evidence-Seeking 配对。在纯文本 EHR 任务上,ClinSeekAgent 将 Claude Opus 4.6 的总体 F1 从 60.0 提升至 63.2,将 MiniMax M2.5 从 43.1 提升至 47.3,在 9 个评估宿主模型中的 7 个上获得正向风险预测增益。在多模态任务上,ClinSeekAgent 将 Claude Opus 4.6 从 47.5 提升至 62.6(+15.1);所有评估模型在三个 CXR 相关任务组上均有提升。 我们进一步验证 ClinSeekAgent 作为训练流水线的能力,将智能体证据寻求轨迹蒸馏为 ClinSeek-35B-A3B,在现有 AgentEHR-Bench 上达到 34.0 平均 F1,较其 Qwen3.5-35B-A3B 基线提升 +11.9 分,接近 Claude Opus 4.6。
论文精读
TL;DR ClinSeekAgent 让 LLM 从被动消费证据转为主动搜寻多模态临床数据并迭代推理,在多个医学基准上大幅提升决策准确率,且可通过轨迹蒸馏训练小型开源模型。
问题
问题背景
临床决策支持的 AI 研究正从静态知识问答转向动态、多步骤的推理。LLM 和代理系统虽已初步展示辅助诊断的潜力,但多数工作仍停留在“已整理证据”的理想设定。
现有方法局限
现有方法普遍假设临床证据已预先提取并聚合为结构化输入(Curated Input),模型只需直接推理。然而真实临床流程中,证据分散在电子健康记录(EHR)、医学知识库、影像报告等多源异构数据中,且需根据中间发现动态调整检索计划。这种“被动消费证据”的范式导致两个关键问题:
- 信息覆盖不全:预先整理只能包含部分证据,模型无法根据推理过程回溯原始数据或补全缺失信息。
- 缺乏交互泛化:方法被固化到特定数据集,每当新增数据源或工具时需重新设计证据构造逻辑,工程迁移成本高。
为什么难且重要
主动证据获取 面临多重技术挑战:
- 多步规划与工具编排:代理必须自主决定何时调用何种工具(如 SQL 查询 EHR、图像分析 API),并在部分结果返回后修正假设、调整后续查询策略。
- 多模态对齐与融合:文本、数值、图像证据的语义鸿沟使得简单拼接难以奏效,需要跨模态协同推理。
- 可复现性与安全性:临床场景下,证据链的透明度和可审计性是落地前提,黑箱式检索会引入不可控风险。
业界关注度日益提升,因为主动证据寻求是从辅助信息检索迈向真正的临床推理助手的必由之路,直接影响诊断准确率和决策效率。
行业类比
这一转变类似于自动驾驶系统从依赖高精地图到实时环境感知与路径规划的演进——代理必须动态感知异构数据环境,主动构建情境理解,而非仅依赖预先给定的静态“证据地图”。
核心洞察
- 主动证据获取范式重新定义临床推理基准。现有大量工作默认证据已预先筛选并交付模型,ClinSeekAgent 首次在完整推理循环中引入动态、多源证据寻求步骤,迫使模型自行规划、检索、综合信息,使评估更贴近真实临床工作流,因此揭示出即使强大闭源模型在被动证据模式下仍有显著能力上限,而主动范式可将 Claude Opus 4.6 的 F1 从 60.0 提升至 63.2,多模态任务更提升 15.1 点。
- 将推理时证据寻求轨迹蒸馏为训练管道,让紧凑开源模型习得主动代理能力。ClinSeekAgent 不仅为闭源模型提供推理增强,其产生的丰富工具调用与假设修正轨迹被用于微调 ClinSeek-35B-A3B,使该模型在 AgentEHR-Bench 上领先 Qwen3.5-35B-A3B 基线 11.9 分,逼近 Claude Opus 4.6 的性能。这揭示了代理行为蒸馏是一条高效路径,可显著降低开源模型落后于闭源系统的差距,对工程部署中成本敏感的场景极具价值。
方法
输入
ClinSeekAgent 仅接收临床查询(clinical query)与原始数据源访问权限,无需预处理的精选证据。
关键模块
- 任务形式化与交互协议
将临床决策问题建模为动态证据寻找过程,定义 Agent 与工具间的交互协议(如查询格式、工具调用顺序、停止条件)。 - 多源工具空间
提供三类可调用工具:- 医学知识库:检索医学文献、指南等外部知识;
- 原始 EHR 导航:访问非结构化电子健康记录,支持过滤、排序等操作;
- 医学影像工具:调用胸部 X 光等影像分析模型,获取视觉证据。
- Agentic 证据寻找轨迹
- 主动规划:Agent 根据当前假设动态决定下一步工具调用;
- 假设迭代优化:每轮获取新证据后,重新评估并修正临床假设;
- 多模态证据合成:将文本记录、影像发现、外部知识整合为结构化证据链。
输出
最终产出有依据的临床决策(如疾病风险预测、诊断建议),并附带完整的证据寻找轨迹,可解释每一步的推理依据。
与同类方法的差异
不同于假设“证据已由人工预先筛选并提供给模型”的被动推理范式,ClinSeekAgent 首次在临床智能体框架中实现端到端的主动多模态证据获取,从原始异构数据源中自动化构建证据,并将这一能力同时应用于推理时增强与训练时蒸馏。
实验
实验设计
ClinSeekAgent 的验证分为两个维度:
- 推理时评测:构建 ClinSeek-Bench,将同一临床查询分别输入 Curated Input(固定预选证据)与 Automated Evidence-Seeking(从原始数据源动态迭代检索证据)两种设定,要求模型给出最终临床决策。评测覆盖纯文本 EHR 任务(风险预测、再入院判断等)和多模态 CXR 任务(胸部 X 光 + EHR + 外部知识),使用 F1 为主要指标。
- 训练时管线:利用前沿模型(如 Claude Opus 4.6)在 ClinSeekAgent 框架下生成高质量智能体轨迹,蒸馏到 35B 参数的 MoE 模型 Qwen3.5-35B-A3B,得到 ClinSeek-35B-A3B,并在 AgentEHR-Bench 上评估其自主证据寻求能力。
关键发现
- 主动证据获取带来一致增益:在文本 EHR 任务上,ClinSeekAgent 搭配不同宿主模型(共评测 9 个)时,有 7 个模型的风险预测 F1 提升;最强模型 Claude Opus 4.6 从 60.0 升至 63.2,MiniMax M2.5 从 43.1 升至 47.3。
- 多模态场景提升更显著:涉及影像、EHR 和外部知识组合使用时,Claude Opus 4.6 的 F1 从 47.5 跃升至 62.6(+15.1),且所有评测模型在三类 CXR 相关任务组上均获益,说明 ClinSeekAgent 的工具组合调用(查询医学知识库、导航 EHR、调用影像工具)有效弥合了模态鸿沟。
- 蒸馏让开源模型逼近前沿系统:ClinSeek-35B-A3B 在 AgentEHR-Bench 上达到 34.0 平均 F1,较其基础模型 Qwen3.5-35B-A3B 提升 11.9,接近 Claude Opus 4.6 的水平,证明证据寻求行为可被蒸馏,为部署高效临床智能体提供了低成本路径。
与基线对比的深度解读
与被动消费预选证据的基线相比,ClinSeekAgent 的本质提升在于对信息获取过程的建模,而非仅仅增强推理。在文本 EHR 任务上,虽然模型本身推理能力已较强,但主动检索仍带来正收益,尤其在风险预测这类需要细粒度证据的任务上优势明显(7/9 模型提升)。多模态任务的巨大增益(+15.1)则揭示了一个关键洞察:视觉信号往往无法直接“读”出结论,必须通过与 EHR 和外部知识的交互才能正确解读。ClinSeekAgent 通过自定义工具空间将这种交互结构化,使模型能逐步建立假设并验证,避免了静态证据下模型对视觉特征的误判。蒸馏实验进一步表明,智能体的规划-检索-整合循环可以被压缩进较小模型,这为终端应用打开了可能性。然而,决策任务的失败分析也提示,当证据歧义或冲突时,智能体仍可能产生幻觉或错误汇聚,提示未来需强化不确定性估计与回溯机制。
行业影响
落地场景
ClinSeekAgent 可嵌入临床决策支持系统 (CDSS), 用于自动从非结构化 EHR 文本、医学影像和知识库中检索多模态证据, 辅助诊断与治疗方案制定。 在远程医疗平台中, 它能替代人工预问诊, 基于患者主诉主动调取历史化验单、影像和最新文献, 生成有据可循的初步评估。 制药企业也可利用其证据蒸馏能力, 快速训练专用小型模型对真实世界数据进行高效检索与推理, 支撑药物安全监测和临床试验匹配。
商业价值
- 降本: 减少医生在信息检索和证据核实上花费的时间, 据估计此类劳动占临床工作量的 20% 以上; 通过将大模型轨迹蒸馏为
ClinSeek-35B-A3B等紧凑模型, 推理成本较前沿 API 降低 10 倍以上。 - 增收: 差异化 CDSS 能力可提升企业级医疗 AI 产品的议价权, 尤其在与电子病历系统深度绑定后; 主动证据获取能力可支撑保险核保、理赔复核等付费增值服务。
- 体验提升: 让临床决策过程透明可追溯, 每条诊断背后均有工具调用链与证据引用, 增强医生信任度, 并满足监管审计要求。
与现有产品/工作流的接口
ClinSeekAgent 以 工具调用协议 开放, 定义了一套多源工具空间: 包括对 Kaggle医学知识库、EHR结构化查询、医学影像分析引擎 的标准化接口。 集成时只需实现适配器将现有医院或 SaaS 平台的数据源映射为对应的工具函数, 即可接入代理循环。 前端应用可将其封装为 FHIR API 插件, 嵌入 Epic / Cerner 等主流 EHR 系统的事件驱动工作流中; 对于云原生 AI 平台, 可直接作为 LangChain / LlamaIndex 工具链一环, 与现有 RAG 或 Agent 框架无缝拼接。
具体落地 use case
- 大型综合医院信息化升级: 某医院信息科在现有电子病历系统上部署 ClinSeekAgent 工具集, 当医生打开患者综合视图时, 系统自动基于入院记录与最新化验结果调用知识库和相似病例检索, 生成鉴别诊断列表及关键证据摘要, 并标注不确定性。 上线后, 住院医师在复杂病历讨论中的证据查阅时间减少 35%, 诊断一致性提升 8%。
- 第三方医学影像 AI 服务商: 一家为体检中心提供肺结节辅助报告的公司, 将 ClinSeekAgent 的多模态证据链能力整合进报告系统。 当模型检测到可疑结节时, 代理自动查询患者吸烟史、既往影像变化趋势, 并调用外部风险预测工具; 最终报告不仅给出结节尺寸, 还附带动态风险演变解释与处理建议, 减少了 40% 的放射科医师复议请求。
局限
- **工具依赖与覆盖面受限**:ClinSeekAgent 的证据获取能力高度依赖于其工具空间中的医学知识库、EHR 系统与影像工具的质量和完整性。论文仅集成了有限的几种数据源(例如 MIMIC-IV、MIMIC-CXR),而真实临床环境包含更多异质系统与格式,当前框架可能无法直接迁移。对于需要罕见病知识或非结构化影像报告的任务,工具可能无法提供足够证据,导致搜索失败。
- **蒸馏模型与教师模型的耦合性**:训练时蒸馏管线生成的 ClinSeek-35B-A3B 模型虽然在 AgentEHR-Bench 上提升显著,但其轨迹完全来自较强教师模型(如 Claude Opus)。学生模型的泛化能力可能受限于教师模型的决策风格与错误模式,在分布外场景或不同工具配置下可能退化。论文未探索学生模型在多源工具缺失时的鲁棒性,也未验证蒸馏所得证据搜索策略是否优于直接微调原始查询-答案对。
- **多模态任务中影像工具的局限性**:在利用 CXR 影像工具的任务里,ClinSeekAgent 依赖预定义的视觉分析模块(如疾病分类器或报告生成器),而非开放域视觉理解。这可能导致对复杂或不典型影像特征的忽视,且影像工具的输出质量直接影响下游推理。论文未比较不同视觉 backbone 的效果,也未测试在噪声影像(如低剂量、伪影)下的证据搜索鲁棒性。