论文

OpenTumorBoard: 多学科肿瘤委员会讨论轨迹的真实世界基准

OpenTumorBoard: 多学科肿瘤委员会讨论轨迹的真实世界基准

OpenTumorBoard 是一个面向多学科肿瘤委员会(MDT)讨论轨迹的真实世界基准,旨在弥补现有评测难以捕捉真实临床讨论过程的不足。它包含 611 个患者病例、19,157 个讨论轮次,覆盖十种专科角色,转录自 YouTube 上 12,534 分钟公开肿瘤委员会录像。 基准设置两个评测任务:SPECIALIST TURN 要求 LLM 回答真实讨论中提出的临床关键问题;BOARD SIMULATION 要求其生成完整往复讨论,并就治疗推荐、手术计划、下一步行动和临床试验匹配达成共识。对 14 个通用前沿与医学 LLM 的评测显示明显局限:最佳模型在临床等价性上得 3.43/5,在与记录委员会结论的一致性上得 2.78/5。 监督微调和强化学习可在留出测试集上提升性能,表明真实讨论轨迹能支持模型适配。三位 M.D. 专家审核部分基准,发现病例信息覆盖度和事实性较高,提取的共识结论保真度强。作者将发布 OpenTumorBoard 及其自动整理流程,以支持面向多学科、个性化癌症决策的 LLM 开发与评测。

论文精读

TL;DR 从 YouTube 真实肿瘤委员会录像构建多学科讨论轨迹基准,611 病例、19,157 轮对话,评估 LLM 专科应答与整场会诊模拟,揭示现有模型与专家结论差距显著。

问题

问题背景

多学科肿瘤委员会(Multidisciplinary Tumor Board, MDT)是癌症诊疗中的关键决策环节,尤其当标准治疗方案失败后,MDT 讨论往往成为患者最后的希望之一。当前 AI 领域高度关注 LLM 在临床决策支持中的应用,特别是能够整合多模态数据、纵向病史并进行多专家协作的智能体推理能力。

现有方法局限

现有医学 LLM 基准大多基于静态问答或选择题(如 MedQA、PubMedQA),缺乏真实世界 MDT 的动态讨论轨迹,主要局限包括:

  • 数据形态单一:没有多轮、多角色对话,无法评估模型在专科医生交互中的回应质量与连贯性。
  • 信息整合不足:缺少对多模态临床观察(影像、病理、基因报告)和患者纵向时间线的融合推理。
  • 决策链缺失:未评估模型能否在讨论结束时形成治疗建议、手术方案、后续行动和临床试验匹配等共识结论。

为什么这个问题难/重要

构建真实 MDT 讨论基准面临多重挑战:需要大规模转录长时程音视频、抽取结构化患者病例、确保病例信息保密性、以及由临床专家验证讨论质量和结论保真度。此外,MDT 讨论本身具有高度动态性和不确定性,涉及十个专科角色(外科、肿瘤内科、放疗科、病理科等)的交互,要求模型同时具备专科知识与跨学科协调能力。业界对 LLM 在关键医疗决策中的可靠性要求极高,任何错误都可能直接影响患者治疗方案,因此这类基准对评估模型在真实临床工作流中的表现至关重要。

行业类比

这类似于自动驾驶中的多传感器融合与车队协同决策:单个模型(单传感器)表现好并不足够,系统需要在多智能体交互中达成一致且可解释的全局决策,OpenTumorBoard 正是为医学 LLM 提供了这样的“真实路测”环境。

核心洞察

  • OpenTumorBoard 将评估从静态问答推进到真实多学科讨论轨迹,暴露了 LLM 在跨专科整合与共识形成上的显著差距。传统医学基准如 MedQA 侧重单点事实,而该基准要求模型在纵向患者历史、多模态临床观察和十个专科角色交互中做出临床等效回答与推荐。最佳模型仅取得 3.43/5 的临床等效性和 2.78/5 的结论对齐,说明现有 LLM 尚不能可靠充当多学科团队中的决策参与者。
  • 自动化策展管道从 YouTube 视频转录构建大规模真实世界基准,解决了医疗数据获取难与标注成本高的工程瓶颈。通过转录、筛选、专家验证等环节,将 12,534 分钟视频转化为 611 病例、19,157 轮讨论和共识结论,并证明高信息覆盖与事实性。该管道可迁移到其他临床或专业讨论场景,为低成本构建高质量真实世界轨迹数据提供可复用的技术范式。
  • 真实世界讨论轨迹不仅是评估工具,更是有效的微调信号。实验显示,使用这些轨迹进行 SFT 和 RL 后,模型在 held-out 测试集上的专科轮次和会议模拟表现均有提升,表明多专家对话中包含的推理链、共识逻辑与个性化决策知识可以被模型习得。这为医疗 LLM 训练开辟了从公开讨论视频中提取监督信号的新路径,而无需昂贵的人工标注。

方法

输入:真实肿瘤委员会讨论视频与转录

数据来自 YouTube 上公开的 多学科肿瘤委员会 讨论视频,共 12,534 分钟,经转录后得到 611 个患者案例 和 19,157 个讨论轮次,覆盖 十种专家角色。输入内容包含多模态临床观察和纵向患者历史,如影像、病理、治疗史等。

关键模块:自动策展管道与双任务评估

  1. 自动策展管道:

    • 使用 ASR 转录视频,利用 LLM 识别专家角色、切分讨论轮次、抽取患者案例和共识结论。
    • 执行去泄露处理(删除案例中可能泄露答案的信息)、临床显著性问题筛选和专家审核,确保基准质量。
  2. 任务定义:

    • SPECIALIST TURN:模型接收真实讨论的上下文,对讨论中提出的临床显著性问题生成回复,模拟一位专家角色。
    • BOARD SIMULATION:模型同时模拟多个专家角色,生成完整的来回讨论,最终输出共识决策,包括治疗建议、手术计划、下一步行动和临床试验匹配。
  3. 评估协议:

    • 使用 LLM 裁判,对专家轮次采用 临床等价性 打分(0-5 分),对委员会模拟采用 结论对齐 打分(0-5 分)以及四决策覆盖率评分。
    • 三位医学博士专家审核部分基准,验证信息覆盖率、事实性和共识结论的保真度。
  4. 模型适应:

    • 利用真实讨论轨迹进行 监督微调(SFT) 和 强化学习(RL),提升模型在留出测试集上的表现。

输出:模型性能基准

输出为各模型在两个任务上的得分(如最佳模型临床等价性 3.43/5、结论对齐 2.78/5),以及微调后的性能提升。

与同类方法的差异点:区别于静态医学问答基准,OpenTumorBoard 首次大规模引入多角色、多轮交互的真实讨论轨迹,强调个性化、多学科决策过程。

实验

实验设计

OpenTumorBoard 从 YouTube 公开肿瘤委员会录像中自动转录并构建,包含 611 例患者、19,157 轮讨论、覆盖 10 个专科角色。评估分两种设定:SPECIALIST_TURN(LLM 接单轮回答临床关键问题)与 BOARD_SIMULATION(LLM 生成完整多轮讨论并形成治疗推荐、手术计划、下一步行动和临床试验匹配共识)。评估了 14 个通用与医学 LLM,并在 held-out 测试集上开展 SFT 与 RL 微调实验。

关键发现

最佳模型在 SPECIALIST_TURN 临床等价性得分仅 3.43/5,在 BOARD_SIMULATION 结论对齐得分仅 2.78/5,显示现有 LLM 距离真实多学科决策仍差距显著。SFT 与 RL 在 held-out 测试集上带来提升,表明真实讨论轨迹可用于模型适配。三位 M.D. 专家审核确认病例信息覆盖与事实性高,提取的共识结论保真度强。

深度解读

与以往合成或单轮 QA 基准不同,OpenTumorBoard 强调真实、多角色、纵向病史的讨论轨迹,更贴近临床中协作与共识形成的复杂度。模型在单轮回答表现尚可,但端到端仿真薄弱,说明多轮上下文、角色协调、跨模态信息整合是主要瓶颈。后续研究应利用此类真实轨迹做对齐训练,并针对仿真场景设计更细粒度的过程奖励。

行业影响

落地场景

OpenTumorBoard 最直接的产品化场景是 肿瘤多学科会诊(MDT)辅助系统。它提供了 611 个真实病例、19,157 轮讨论轨迹,可作为训练与评测数据源,支撑以下产品形态:

  • 实时会诊助手:接入视频会诊系统,在肿瘤科医生讨论时自动生成可能的治疗建议、临床试验匹配或手术方案,并附证据摘要。
  • 病历预审与模拟推演:在会诊前自动生成多角色观点,帮助低年资医生或基层机构预演决策分歧。
  • 临床试验匹配引擎:利用讨论中提取的入排标准,改进面向药企的招募系统。

商业价值

价值主线在于 降低复杂决策的时间与人工成本。大型肿瘤中心的一场 MDT 通常需要 6-10 位专家,单病例平均讨论约 20 分钟。利用该 benchmark 微调的 LLM 可作为“第一轮筛选器”,减少专家低效重复劳动,提升专家资源利用率。在付费模式上,可面向医院收取软件订阅费,或面向药企提供临床试验匹配的线索服务。评测显示当前最先进模型与专家结论一致性仅 2.78/5,表明仍有较大提升空间,早期切入者可用真实数据建立壁垒。

与现有产品/工作流接口

OpenTumorBoard 提供了自动转写、去隐私化、问题筛选的 pipeline(代码将开源),可直接集成到以下 stack:

  1. 医疗 LLM 评测平台:把 Specialist Turn 和 Board Simulation 子任务加入现有医疗基准(如 MedQA、PubMedQA)之后,作为高阶 agent 能力测试。
  2. 电子病历 / 会诊系统:通过 FHIR 或自定义 API 接出病例与讨论摘要,调用微调模型返回结构化建议。
  3. 企业级 LLMOps:利用其监督微调与强化学习设置(奖励函数等)作为领域自适应范本。

具体场景示例:某远程肿瘤会诊平台可先使用该数据的 Specialist Turn 任务评测基座模型,选出在影像、病理、外科等角色问答上表现最好的模型,再用 Board Simulation 生成多方案对比,辅助平台签约专家快速复核。

局限

  • **数据源偏差与覆盖率有限**:基准完全基于 YouTube 公开的肿瘤委员会视频转录,这类视频往往来自主动分享的机构,可能存在选择偏差(如偏向教学案例、常见癌种或资源充足的中心),且语言以英语为主,无法代表全球多学科实践的异质性与罕见病例分布。此外,公开视频中的讨论可能经过编辑或筛选,不能完全等同于真实临床决策过程,限制了基准的泛化性和对实际部署场景的模拟能力。
  • **缺乏原始多模态数据**:尽管论文强调多模态临床观察,但 OpenTumorBoard 仅提供文本转录,未包含影像、病理切片、基因组测序等原始多模态输入,模型只能基于文本描述进行推理,无法评估其直接处理图像或结构化多模态数据的能力。这削弱了基准对真实肿瘤委员会多模态决策流程的复现度,也限制了其在多模态 LLM 评测中的适用性。
  • **自动评估与微调泛化性存疑**:评估依赖 LLM 作为裁判(judge),其临床等价性和结论对齐评分与人类专家判断的一致性未经过系统验证,可能引入裁判模型的偏差(如偏好流畅性而非事实准确性)。此外,监督微调与强化学习实验仅在 held-out test set 上表现提升,未在不同来源或时间分布的外部数据上验证泛化能力,存在过拟合特定数据分布的风险,影响其作为训练信号源的长期可靠性。
论文Anqi Li2026-09-26原文

相关内容