HealthAgentBench:一个面向挑战性前沿AI代理的真实代理医疗环境统一基准套件
随着AI代理在复杂、长周期推理方面能力的增强,亟需严格而全面的评估来衡量其在真实医疗应用中的进展。为此,我们提出 HealthAgentBench,一个包含 54 个代理医疗任务、覆盖 7 个类别 的基准套件,每个类别拥有独立环境。该套件贯穿患者旅程中的多样化工作流和多种模态,每个任务均模拟端到端临床工作流:代理需在仅有少量指令的情况下,探索原始医疗数据、在复杂环境中操作,并执行多步解决方案,而非简单的提示工程。最终通过 任务成功率 这一单一可解释指标来报告整体性能。 在 HealthAgentBench 上评估前沿AI代理发现,整体任务成功率仍然较低,突显了该套件的挑战性。最强的且最具成本效益的代理 Codex GPT-5.5 仅达到约 42% 的成功率。此外,HealthAgentBench 揭示了各任务类别中的细微优劣:前沿代理在基于 EHR 数据自动开发研究建模流程方面展现出潜力,但 医疗成像 仍然极其困难,尤其是对 Claude Code 模型而言,而 Codex GPT-5.5 则展现出新兴能力。结合大搜索空间与组合推理需求的任务对所有现有代理仍然困难。 这些结果表明,HealthAgentBench 提供了一个充满挑战且真实的基准,为未来进展留下了广阔空间。我们已在 https://github.com/microsoft/HealthAgentBench 发布该基准。
论文精读
TL;DR HealthAgentBench 构建了 54 个医疗智能体任务的真实临床基准,最强模型 Codex GPT-5.5 总成功率仅约 42%,凸显医学影像与组合推理的巨大挑战。
问题
随着 AI Agent 逐步具备长程推理与工具使用能力,业界开始关注其在高风险、高专业性的真实医疗场景中的落地能力,但如何系统评估这些 Agent 的临床工作流执行水平仍是一个开放问题。
现有医疗 AI 评估大多聚焦单一任务,如放射影像诊断或 EHR 预测,采用静态数据集上的监督学习指标(如 AUC、Accuracy),缺乏对端到端临床工作流的建模。这导致两个核心局限:一是环境交互缺失,Agent 无法像真实医生那样主动查阅资料、操作软件或迭代决策;二是任务原子化,无法反映临床中多步骤、跨模态、组合推理的复杂性。一些早期尝试(如简单指令微调模型的零样本测试)往往高估 Agent 能力,因为任务缺乏现实中的环境噪声、大海捞针式检索需求和严格的可验证性。
这一问题的挑战在于,医疗工作流涉及异构数据(结构化 EHR 表格、非结构化报告、影像)、长程决策链(从问诊到随访)和高成本错误惩罚,要求 Agent 能像资深临床人员一样适应动态环境、自主探索并产出可解释结果。业界对"智能体医生"的期望持续升温,但若没有贴近真实复杂度的基准,模型的脆弱性会被掩盖,可能导致资源错配与安全风险。因此,构建统一、可复现、抗作弊且覆盖全流程的 Agentic 评测套件,对推动医学 AI 从"模型能力"走向"系统能力"至关重要。
这类似于自动驾驶行业用 CARLA 或 nuPlan 等仿真环境测试全栈驾驶策略:只有让 Agent 在受控但高保真的复杂环境中完成完整任务闭环,才能真实衡量其在开放世界的泛化与鲁棒性。
核心洞察
- HealthAgentBench 通过构建端到端临床工作流任务,暴露了前沿智能体在真实医疗场景中的根本性短板,而不仅是单步推理或选择题。与传统医疗 NLP 基准不同,该基准要求智能体自主探索原始数据、操作复杂环境并执行多步方案,最终以单一任务成功率衡量。这种设计更贴近临床实际,但导致了整体成功率低下(最强模型仅约 42%),表明当前智能体距离自主完成完整医疗工作流仍有巨大鸿沟,为评估方法论提供了更严格的尺子。
- 医学影像任务成为当前智能体的核心难题,但 Codex GPT-5.5 展现出初步突破,凸显视觉-语言模型进化路线差异。在 CT 异常分类、病理区域选择等影像任务中,Claude Code 等模型表现挣扎,而 Codex GPT-5.5 开始具备一定能力。这反映出不同模型架构在多模态医疗数据理解上的分化,提示仅依赖通用视觉-语言模型可能不够,需要针对医学影像特征(如高分辨率、细粒度病灶)的专用适配,为工程化落地的模型选型提供了关键信号。
- 组合推理与大搜索空间是横跨所有智能体的通用瓶颈,尤其体现在 EHR 数据质量审计等任务中。当任务需要从海量历史记录中定位罕见错误并执行多步骤验证时,所有模型成功率均极低。这表明现有智能体在长程规划、记忆与检索增强的组合运用上仍十分稚嫩,即使成本最高的智能体也无法高效处理。这一发现为下一代 Agent 架构指明了方向:需要更紧密地耦合检索、记忆和推理模块,而非简单依赖更大的上下文窗口或更强的单次推理能力。
方法
HealthAgentBench 的构建方法围绕 Agent 环境的真实性 与 任务的可验证性 展开,核心思路是让 Agent 在原始医疗数据上进行端到端探索,而非仅回答经过抽象的问题。
任务选择与设计原则
- Agentic 工作流:每个任务模拟一个完整的临床流程,要求 Agent 在给定最简指令后,自主探索环境、读取数据、执行多步操作并得到可验证的结果。
- 广泛覆盖:7 个任务类别涵盖 EHR 格式转换、X 光报告纠错、临床试验匹配、CT 异常分类、病理肿瘤区域选择、纵向事件预测(ehrshot)、EHR 数据质量审计,涉及表格、影像、文本等多模态数据。
- 可验证性与低随机成功率:任务设计时确保通过自动化脚本精确判定成功/失败,且随机猜测的成功率极低,增强了区分度。
环境与数据流
- Versatile 终端环境:所有任务运行在统一的 Linux 终端沙箱中,Agent 通过执行命令(如
python、shell 脚本)与数据交互,模拟真实临床数据分析师的操作。 - 按需数据下载:任务不预置大型数据集,而是通过脚本在运行时拉取所需片段,保证环境轻量且可复现。
- 反作弊设计:从构建层面避免了 Agent 通过记忆训练数据或绕过步骤直接获取答案的可能,例如数据文件动态生成、答案哈希存储等。
评估指标
- Task Success Rate:最终唯一上报的聚合指标,每个任务为 binary 判定(是否达到预定义的成功条件),给出整个基准套件的可解释总得分。
- 辅助分析:同时记录完成时间与 API 调用成本,用于 Agent 的成本性能权衡分析。
与同类方法的差异点:区别于以问答对或选择题形式存在的医疗基准,HealthAgentBench 要求 Agent 在原始、未整理的临床数据环境中完成长周期 Agentic 任务,更贴近真实部署场景,并提供了统一的终端交互界面。
实验
实验设计
HealthAgentBench 构建了 54 个面向医疗的 agent 任务,涵盖 7 个类别(EHR 格式转换、X 光报告纠正、临床试验匹配、CT 异常分类、病理肿瘤区域选择、纵向事件预测、数据质量审计),模拟患者就诊全流程。每个任务要求 agent 在最小指令下探索原始数据、操作复杂环境并完成端到端临床工作流,最终以任务成功率作为单一可解读指标。评估了包括 Codex GPT-5.5、Claude Code 等在内的前沿 agent。
关键发现
- 整体成功率低下:表现最好的 Codex GPT-5.5 仅取得约 42% 的成功率,凸显基准的高难度。
- 能力分化明显:agent 在 EHR 数据自动建模(如机器学习研究流水线)上展现潜力,但医学影像任务极为困难,尤其 Claude Code 模型表现不佳;Codex GPT-5.5 在影像任务上开始显露潜力。
- 组合推理与大规模搜索是共同瓶颈:需要在大搜索空间中结合组合推理的任务(如 EHR 数据质量审计)对所有 agent 仍具挑战。
与基线对比的深度解读
与传统单一任务模型或简单提示工程相比,前沿 agent 虽能自主执行复杂多步流程,但成功率远未达到实用水平。例如,医学影像和组合推理任务的低成功率表明,当前 agent 的空间理解、跨模态对齐和长链规划能力仍有显著缺陷。该基准通过设计真实、反作弊的环境,揭示了 agent 在无强监督下的真实能力界限,为后续强化推理与执行结合(如 tool use、记忆机制)的研究提供了明确方向。与现有医疗 AI 基准(如 MedQA)不同,HealthAgentBench 的环境交互性与工作流完整性使其更贴近临床实际,成功成为衡量迈向实用级医疗 agent 进程的核心标尺。
行业影响
落地场景
HealthAgentBench 提供的 54 项任务直接映射医疗 AI 产品中的关键工作流:
- 临床决策支持系统:利用 EHR 事件建模、数据质量审计 和 影像异常分类,评估智能体在真实临床数据上的推理能力,驱动诊断建议、风险评估等模块的迭代。
- 医学影像分析平台:CT 异常分类、病理肿瘤区域选择 等任务模拟放射科与病理科工作流,可用于测试和筛选具备感知与推理能力的 AI 代理,再部署到辅助阅片产品。
- 临床试验匹配与药物研发:患者-试验资格匹配 任务能够加速受试者招募,降本增效;EHR AutoResearch 任务则展示智能体自动构建预测模型的潜力,服务于真实世界证据(RWE)生成。
商业价值
- 降本:自动化临床流程(如报告纠错、数据转换)可减少大量人工审核与编码成本。基准提供的统一评估标准帮助企业在采购或自研智能体时快速筛选候选模型,降低试错开支。
- 增收:提升临床试验招募效率、缩短研发周期,为 CRO 和药企创造直接收益;高精度的智能体还能扩展 AI 诊断服务的付费场景。
- 体验提升:更可靠的智能体可融入医生工作流,实时提供决策支持而不打断操作,但当前 ≤42% 的总成功率表明仍有明显能力缺口,短期内更适合作为辅助而非全自动方案。
与现有产品/工作流的集成
- MLOps 管道:可将 HealthAgentBench 封装为 CI/CD 步骤,在模型迭代或智能体更新时自动运行回归测试,确保新版本在多模态、长程推理任务上的能力不退化。
- 医疗数据平台:该基准的环境模拟了从原始数据探索到多步解决方案的完整过程,可嵌入数据中台或 EHR 系统作为插件,评估接入智能体的实际表现。
- 开放接口:任务定义、评分配置已开源,可借助 Docker 或虚拟环境快速部署,与现有医疗软件栈(如 FHIR 服务器、PACS)对接,实现面向特定医院的定制化评估。
具体落地 Use Case
- 放射科 SaaS 产品:一家提供胸部 CT 辅助诊断的云服务,可在每次模型升级前,用 HealthAgentBench 中的 CT Abnormality Classification 和 X-ray Report Correction 任务测试新模型能否正确处理复杂病例并修正报告错误,避免上线后因误判导致医疗事故风险。
- CRO 智能招募系统:利用 Clinical Trial Matching 任务评估智能体从非结构化病历中提取准入条件并匹配患者的能力,替代人工初筛,使单个试验的招募周期缩短数周,直接降低申办方成本。
局限
- **任务覆盖范围有限**:虽然 HealthAgentBench 涵盖了 7 个类别共 54 个任务,但这些任务主要集中在电子健康记录(EHR)、医学影像报告和临床试验匹配等场景,难以全面反映真实临床环境的复杂多样性。例如,缺少对罕见病诊断、手术机器人操作或患者长期随访等流程的模拟。此外,大部分任务基于公开数据集构建,尽管采取了 `by construction` 的反作弊设计,但前沿代理可能因训练数据中包含相似样本而获得不公平优势,导致评估结果偏向记忆而非泛化能力,限制了基准对通用临床智能的真实衡量。
- **评估指标过于单一**:论文采用最终任务成功率作为唯一的核心指标,这一设计虽然简洁且易于解释,但忽略了代理在中间步骤上的表现。对于多步长程任务,代理可能因某一步的微小错误而最终失败,但其余步骤完全正确;或者代理虽然成功,但路径冗长、成本高昂。缺乏对部分完成度、效率、工具调用准确率等细粒度指标的考量,使得评估无法充分揭示代理在规划、推理或执行上的渐进式能力差异,也难以为实际部署提供成本-性能权衡的指导。
- **代理选择与配置影响结论普适性**:实验仅评估了少数几个闭源前沿代理(如 **Codex GPT-5.5** 和 **Claude Code** 系列),并未包含开源模型、基于多智能体协作的架构或针对医疗领域微调的专用代理。这些代理的底层架构和训练数据差异巨大,但论文未深入探讨超参数(如温度、系统提示)对成功率的影响,也未提供公平对比的基线设置,导致不同代理间的比较可能受到非能力因素干扰。因此,观察到的性能差距(例如 Claude 在医学影像上的弱势)可能部分源于代理配置不当,而非本质缺陷,削弱了基准的公平性和普适性。