论文

TRIAGE:基于大语言模型的不规则采样医学时间序列的可解释风险预测的辩证推理

TRIAGE:基于大语言模型的不规则采样医学时间序列的可解释风险预测的辩证推理

基于电子健康记录的临床预警系统,其中临床观测记录为不规则采样医学时间序列(ISMTS),需要提供校准的风险评分供患者分诊,并给出 clinicians 可验证的可解释推理。大语言模型已被探索用于此任务,但会将分级临床风险坍缩为过度自信的二元预测,这种风险极化破坏了校准性和跨患者可比性。 为此,我们提出 TRIAGE 框架,通过引发结局特定的推理,训练单个大语言模型对竞争性临床结局生成辩证推理(dialectical reasoning)。该辩证形式缓解了风险极化,使单一 LLM 能输出基于明确临床推理的连续风险评分。 在三个 ISMTS 基准上的评估显示,TRIAGE 相比强基线平均 AUPRC 提升 3.3%,校准误差降低 81%。LLM-as-a-judge 评估进一步表明,我们的推理在临床推理质量上比基线的后验解释高出 20%。代码已开源于 https://github.com/HyeongWon-Jang/TRIAGE。

论文精读

TL;DR TRIAGE 让 LLM 对不规则采样医疗时间序列生成辩证推理,同时论证正反临床结局以缓解风险极化,输出校准良好的连续风险评分与高质量临床解释,校准误差降低 81%。

问题

问题背景

临床早期预警系统依赖电子健康记录(EHR)中的不规则采样医疗时间序列(ISMTS) 进行患者风险分层。这类数据来自真实诊疗过程,观测间隔不一、缺失率高,模型需同时输出校准良好的连续风险分数可验证的临床推理依据,以辅助分诊决策。

现有方法局限

当前前沿方案尝试用大型语言模型(LLM)直接生成风险预测与解释,但暴露两大致命缺陷:

  • 风险极化(Risk Polarization):LLM 倾向于将分级临床风险坍缩为过度自信的二分类(“高风险”/“低风险”),丢失细粒度区分能力。这源于推理过程单边化——模型只机械列举支持某一结局的证据,忽视竞争性结局的线索。
  • 校准崩塌:极化导致预测分数在跨患者比较时失准,模型可能高估低风险群体而低估高风险个体。基线实验显示,LLM 隐式概率的预期校准误差(ECE)远高于结构化模型,且无法通过简单提示词消除。

为何重要且困难

  • 临床可接受性门槛高:风险评分必须可靠,医生需要理解模型为何给出某个概率,而非仅接受黑箱判断。校准误差每降低一点,都可能减少错误分诊带来的生命损失。
  • LLM 的离散推理惯性:语言模型擅长生成定性的、单步因果链,但难以自然地维持多种假设并存,并从中推导出连续的置信度。这触及 LLM 与概率推理之间的深层张力。
  • 数据异质性挑战:ISMTS 的缺失模式本身可能携带信息,模型需在稀疏、不规则采样条件下保持推理自洽,而 LLM 的序列建模易被表面统计模式误导。

行业类比

类似工业预测性维护场景,传感器数据也常不规则采样,且需要同时给出设备剩余寿命的连续估计与可维修性解释,避免因过度报警导致“狼来了”效应或漏报引发停机事故。

核心洞察

  • **辩证推理作为校准核心**:TRIAGE 强制 LLM 同时生成两种竞争性临床结局的支持性推理,将风险预测从单边判别转化为多视角证据权衡,直接对抗现有 LLM 的**风险极化**(过度二值化置信)。这种机制不依赖后处理,而是在生成源头注入校准意识,使模型必须面对反方证据,连续风险评分更贴合临床不确定性的自然分布。对比 baseline 的 post-hoc 解释或直接 next-token 预测,它在校准误差上降低 81%,同时推理质量提升 20%,展示出结构化推理对高风险决策的实用价值。
  • **两阶段自我优化训练**:TRIAGE 采用监督微调构思辩证推理格式,再通过自我优化(RL 阶段)精心微调推理与风险分数的对齐,无需额外标注数据即可高效利用 LLM 的预训练能力。这种`先格式注入,后自校准`的 pipeline 在低资源场景下仍保持鲁棒,对医疗领域标注稀缺的工程落地具有现实参考意义。它表明即使对于 ISMTS 这种不规则采样数据,通过指令设计让 LLM 学会`评估论据—输出分数`是可行的,为其他时序预测任务的可解释性增强提供了可迁移的训练范式。

方法

TRIAGE 方法详解

TRIAGE 针对不规则采样医疗时间序列(ISMTS) 的临床早期预警任务,解决 LLM 的风险极化(risk polarization) 问题——传统 LLM 常将分级临床风险坍缩为过度自信的二元预测,损害校准度与跨患者可比性。

输入表示

将 ISMTS 转化为结构化文本,包含患者各变量在不同时间点的观测值及其时间戳,形成 LLM 可理解的临床上下文。

核心模块:辩证推理与风险估计

TRIAGE 强制 LLM 生成辩证推理(dialectical reasoning),即同时为两种对立的临床结局(如“病情恶化” vs. “病情稳定”)生成结果特定的理据。具体流程:

  1. 结果审视(Outcome inspection): LLM 分别以“若结局为 A”和“若结局为 B”为条件,审视数据,提取支持各自结局的线索。
  2. 风险估计(Risk estimation): 基于双方推理的强度对比,LLM 输出一个连续风险分数(而非二元标签),该分数反映相对风险程度,从而实现多粒度校准。

训练流水线

  • 阶段1:辩证推理监督: 使用专家标注或规则生成的对比推理数据,通过监督微调(SFT)教会 LLM 生成结构化辩证推理——先陈述支持正面结局的证据,再陈述支持负面结局的证据,最后综合权衡。
  • 阶段2:自我细化(RL): 引入强化学习,以校准误差和预测性能(如 AUPRC)为奖励信号,微调 LLM 进一步降低过度自信、提升概率校准质量。

输出

  • 校准风险分数: 连续值,适用于患者分诊排序。
  • 可解释理据: 展示模型如何权衡矛盾证据,供临床医生验证,其推理质量在 LLM-as-a-judge 评估中比基线的事后解释高出 20%。

与同类方法的差异

不同于现有 LLM 临床预测方法仅生成单边推理、导致风险极化,TRIAGE 通过结构化的辩证推理强制模型考虑对立信息,从根源上抑制过度自信,输出天生校准的连续风险,而无需依赖事后校准技术。

实验

实验设计

在三个公开的不规则采样医疗时间序列 (ISMTS) 基准数据集——P12P19MIMIC-III 上进行评估。对比基线包括专门的时序模型 (GRU-DmTANDSeFTRaindropSTraTSViTSTKEDGNHi-Patch) 以及直接使用 LLM 进行风险预测的方法。主要指标为 AUPRC 和校准误差,并以 LLM-as-a-judge 评估临床推理质量。额外包含消融实验(推理结构、RL 奖励设计)、低资源训练实验和推理方向分析。

关键发现

TRIAGE 在所有数据集上平均 AUPRC 提升 3.3%校准误差降低 81%,且生成的推理理由在临床合理性上超出基线后验解释 20%。这些提升源于辩证推理框架:通过要求 LLM 同时为阳性与阴性结局生成理由,并据此估算连续风险分数,有效缓解了单一理由导致的风险极化。即使训练数据有限,TRIAGE 仍保持鲁棒,且其推理质量能提供透明的临床决策支持。

与基线对比的深度解读

传统深度时序模型(如 GRU-D)仅输出标量概率,缺乏可解释性;直接微调 LLM 进行二元预测则会过度自信,导致校准崩溃。TRIAGE 的创新在于将风险估计重构为多角度临床论点权衡——不是直接输出“是/否”,而是通过正反理由的隐含概率计算连续分数。这使风险排序更精细,跨患者可比性更强,同时保留了 LLM 的语言推理能力。相比事后解释技术,其内生理由更贴合临床决策逻辑,因而在量化指标和人类评估中均显著占优。

行业影响

落地场景

TRIAGE 可直接嵌入临床早期预警系统电子健康记录(EHR)平台,为 ICU、急诊分诊、院内快速响应团队提供基于不规则采样医疗时间序列(ISMTS)的实时风险评分与可解释推理。它还可扩展至远程患者监护、慢性病管理、药物警戒等领域,将连续监测数据转化为可验证的临床建议。在医疗之外,该框架的辩证推理范式适用于金融反欺诈(交易序列)、工业预测维护(传感器日志)等需可解释连续风险评分的场景。

商业价值

  • 降低误报与决策失误:TRIAGE 将校准误差降低 81%,避免临床过度预警导致的“警报疲劳”,减少无效干预带来的医疗资源浪费。
  • 增强监管合规与信任:生成临床推理理由而非黑箱分数,帮助 AI 系统满足 FDA、CE 等对可解释性医疗器械的要求,加速审批上市。
  • 优化运营成本:更准确的患者风险分层可减少非必要入院和检查,在价值医疗模式下直接降低赔付支出;同时,可解释推理让低年资医生也能快速验证 AI 建议,提升团队整体效率。

与现有产品/工作流的接口

TRIAGE 以LLM 微调框架形式提供,可封装为 REST API 或 gRPC 服务,通过 HL7 FHIR 等医疗互操作性标准接入主流 EMR 系统(如 Epic、Cerner)。输入是时序 FHIR 观测 bundle,输出包含连续风险分数(0-1)和一段结构化的辩证理由。模型支持低资源训练(仅需百级样本),可与现有图形计算、时间序列编码器等结合,作为推理层叠加在Hi-PatchSTraTS等 ISMTS 编码模型之上,不推翻现有数据管道。企业可将其部署在企业级 GPU 集群或私有云 LLM 服务中,配合自我精炼的第二阶段训练持续优化。

具体落地 use case

  1. 跨国医疗设备商智能监护系统:某厂商(如 Philips IntelliVue)集成 TRIAGE,在患者生命体征异常时给出“脓毒症高风险:血清乳酸升高但无明确感染证据,需复查 PCT”的辩证理由,护士站直接显示有理有据的报警,降低误报率,缩短响应时间。
  2. 国际健康保险理赔自动化:一家全球再保险公司(Cigna 等)利用 TRIAGE 分析投保人历史医疗时序数据,为核保部门输出每位客户的风险评分及理由(“心血管风险中高:近期血压波动大,但血脂指标稳定,建议运动负荷试验确认”),使核保效率提升 30%,同时确保决策可审计、公平。

局限

  • **推理监督数据的获取成本**:TRIAGE 第一阶段需要为每位患者生成**辨证推理文本**作为监督信号,这通常依赖于从原始数据中自动提取或由临床专家人工标注。论文未量化该标注过程所需的时间与资源,也未讨论在新科室或新数据域中重新收集监督信号的可扩展性。对于大规模真实部署,这一数据制备瓶颈可能严重影响方法的实用性。
  • **LLM 推理的可靠性与幻觉风险**:尽管 TRIAGE 通过**辨证推理**结构增强了可解释性,但 LLM 仍可能生成包含事实性错误或医学上不合理的推理内容,特别是在数据稀疏或传感器噪声较大的场景下。自我精炼阶段虽能改善输出格式,却无法保证临床推理的医学正确性,这为直接应用于临床决策带来了安全隐患。
  • **评估场景的泛化不足**:实验局限于三个公开 ISMTS 数据集,未能覆盖真实医疗机构中常见的**分布漂移**、**数据延迟**及**计算资源受限**等挑战。此外,基线方法列表未包含最新的闭源大语言模型(如 GPT-4)或更先进的多模态时序 LLM,因此 TRIAGE 在实际动态环境中的性能优势以及与其他前沿 LLM 的横向对比仍有待验证。
论文Hyeongwon Jang2026-06-08原文

相关内容