论文

NOAH: 学习完整的患者旅程——面向表征与预测的纵向多模态时间感知模型

NOAH: 学习完整的患者旅程——面向表征与预测的纵向多模态时间感知模型

医疗数字化在患者一生中积累了大量纵向、多模态的记录,但如何充分利用这些数据来表征和预测患者状态轨迹,仍是关键难题。现有 AI 模型往往难以刻画真实世界多模态患者数据中复杂而不规则的时间动态与内在随机性:它们大多是判别式的、局限于少数模态、受封闭类别词表约束、把时间仅当作单调归纳偏置,或在预测未来患者状态方面能力有限。 我们提出 NOAH,一个时间感知、任务无关的生成式 transformer 模型,用于表征并预测完整的多模态患者旅程。NOAH 引入新颖的双向时间整合 与 变分隐空间,以捕捉患者状态的连续演化以及临床轨迹的随机性。模型基于 MIMIC 数据家族中 299,000 名患者的 431,000 次住院、超过 5.59 亿条临床事件构建,原生处理医学图像、时间序列与数值信号、类别事件,以及结构化与非结构化临床记录。 NOAH 是该领域首个真正整体化的生成模型,支持带可选时间控制的自回归预测、zero-shot 分类 与反事实干预模拟。它能生成信息量高、预测性强的患者状态表征,在临床结局、15 个 ICD 章节、29 种共病的探针评估以及 time-to-event 预测中均表现强劲。NOAH 无缝处理多样模态与复杂时间动态,为个性化临床诊疗与数字医疗中的智能预测系统提供了通用、任务无关且可扩展的基础。

论文精读

TL;DR NOAH 构建生成式多模态患者全病程模型,用双向时间注意力与变分潜空间捕捉不规则时序和随机性,支持预测、零样本分类及反事实模拟。

问题

背景

医疗 AI 正从单点预测转向对完整患者旅程的建模,关注如何从终身纵向、多模态记录中学习连续的患者状态表示。

现有方法局限

  • 多数模型为判别式,仅输出分类或回归,难以生成未来轨迹或做反事实干预。
  • 模态覆盖窄,通常只处理结构化 EHR 或单一影像,缺乏原生多模态融合。
  • 时间建模常把时间当单调归纳偏置,不能处理不规则采样、缺失和双向时间上下文。
  • 分类使用封闭词表,泛化到新诊断或事件难。 这一设计限制导致无法捕获临床轨迹固有的随机性,也难以做 zero-shot 分类和 time-to-event 预测。

为什么难/重要

  • 数据异构:影像、时序信号、离散事件、自由文本混合,特征空间和尺度差异大。
  • 采样不规则:临床事件发生频率依赖病情,时间间隔非均匀。
  • 随机性:同样治疗下患者状态演化存在多峰分布,需变分推断建模潜在状态。 业界关注度:个性化临床决策、数字医学需要可扩展、任务无关的基础模型,类似 NLP 的 GPT 但面向患者数据。

行业类比

类似于自动驾驶中多模态时序 Transformer 统一处理摄像头、激光雷达和车辆信号并预测未来状态,NOAH 在医疗领域把“患者旅程”视为多模态时间序列生成问题。

核心洞察

  • NOAH 将**双向时间整合**与**变分潜在空间**结合,同时捕捉患者状态的连续演化和临床轨迹的固有随机性。以往纵向患者建模方法要么把时间当作单调递增的归纳偏置,要么仅用简单位置编码,难以处理不规则采样和状态突变。NOAH 通过双向注意力机制建模事件前后的上下文,并引入 VAE 结构使潜在分布表达不确定性,更真实地反映疾病进展的多条可能路径。这与主流判别式模型只预测下一事件不同,NOAH 学习生成式患者状态流形,为下游任务提供更丰富、更稳健的表示。
  • NOAH 是首个真正整体性的生成式模型,统一处理多模态(医学图像、时间序列、数值、类别、文本)和结构化/非结构化临床记录,并支持自回归预测、零样本分类与反事实模拟。现有医疗 AI 模型多局限于特定模态或固定类别词汇,且通常为判别式架构,只能输出预定义标签。NOAH 将各类数据 token 化并统一编码,摆脱了模态隔离和封闭词汇限制;其生成能力允许在时间控制下预测未来状态、零样本分类以及反事实干预(如“若换一种治疗方案,患者状态将如何变化”),这是以往模型无法实现的。这种任务无关设计为个性化医疗和临床试验模拟提供了可扩展的基础。

方法

方法概览

输入:NOAH 接收多模态纵向患者记录,包括医学影像、时间序列/数值信号、分类事件、结构化与非结构化临床文本。训练数据来自 MIMIC 数据集系列,共 5.59 亿临床事件、43.1 万次住院、29.9 万患者。

关键模块(按处理流程):

  1. 多模态 token 表示:将异构数据统一为 token 序列,保留模态类型与时间戳,便于统一处理。
  2. 双向时间注意力:在编码阶段使用双向时间整合,打破传统单调时间偏置,捕捉不规则时间动态与长程依赖。
  3. 变分自回归:在隐空间建模患者状态连续演化与随机性;采用上下文条件先验进行变分推断,使生成过程能采样多样临床轨迹。
  4. 多模态输出解码:从隐状态生成或重构各模态 token,支持自回归预测。
  5. 预训练:在大规模数据上以生成目标训练,保持任务无关性。

输出:模型可生成未来患者状态序列(支持可选时间控制)、患者状态表示(用于线性探测、NEWS2 评分、生存分析),或进行反事实干预模拟。零样本 Monte Carlo 分类通过采样评估结果不确定性。

与同类工作的差异:NOAH 是生成式、任务无关、覆盖全模态、显式时间可控且支持反事实干预的首个模型,区别于判别式、有限模态或闭集词表的纵向建模方法。

实验

实验设计

NOAH 在 MIMIC 数据集家族(含 MIMIC-III / MIMIC-IV / MIMIC-CXR / MIMIC-ECG)上预训练,覆盖 299,000 名患者、431,000 次住院、5.59 亿临床事件。评估任务包括:

  • 零样本分类、线性探测、生存分析、NEWS2 评分
  • 时间控制 / 自由预测、反事实模拟

关键发现

模型学到的患者状态表征在下游任务中表现强劲,覆盖 15 个 ICD 章节、29 种合并症的探测,以及 time-to-event 预测。生成式框架支持连续时间动态和随机性建模,可生成未来轨迹、进行零样本蒙特卡洛分类,并提供反事实干预模拟。

基线对比解读

相比现有判别式模型,NOAH 是首个真正整体的生成式模型:不再局限于少数模态、封闭类别词表或单调时间偏置。其双向时间整合与变分潜在空间,使模型能更鲁棒地处理不规则多模态时序数据,为个性化医疗和数字医学提供任务无关、可扩展的基础。

行业影响

落地场景

NOAH 可作为临床决策支持系统(CDSS)的核心引擎,处理 EHR 中的多模态时序数据,实时预测患者状态恶化风险、推荐个性化治疗方案,并通过反事实模拟评估干预效果。在远程患者监测、临床试验患者筛选、药物警戒等领域同样适用。

商业价值

模型通过减少误诊、降低再入院率、缩短平均住院日直接节约医疗支出;其零样本分类与预后预测能力可替代部分人工标注,降低部署成本。对药企和保险机构,时间感知生成能力提升患者分层准确性,加速新药上市并优化保费定价。商业化路径可为 API 订阅或本地化授权。

接口集成

NOAH 支持 FHIR/HL7 标准,可与现有 EHR 系统通过 REST/gRPC 接口对接;模型输出可作为特征向量嵌入下游机器学习流水线,或直接驱动临床告警。容器化部署兼容主流云平台,支持 GPU 弹性伸缩。

具体 use case

  1. ICU 实时风险预警:集成 NOAH 到监护系统,对脓毒症患者每分钟更新器官衰竭概率,并模拟不同液体复苏策略下的预后差异;
  2. 临床试验智能分组:药企利用 NOAH 对历史 EHR 做零样本表型提取,识别特定药物响应人群,减少 30% 入组失败。

局限

  • **数据覆盖与外部有效性受限**:NOAH 训练主要基于 MIMIC 数据集家族(MIMIC-III/IV 等),该数据来自特定医疗系统的 ICU 患者,单中心、回顾性特征明显,且疾病谱、人口构成与诊疗流程存在选择偏差。模型在非 ICU、门诊或不同地区人群上的泛化能力未经充分验证。此外,尽管模型声称处理多模态,但实际依然缺少基因组、病理切片、可穿戴设备等常见临床信息,难以完整表征真实世界患者状态。
  • **计算开销与部署门槛较高**:模型在超过 5.59 亿临床事件上预训练,采用双向时间注意力和变分潜在空间,架构复杂度带来显著的训练成本与推理延迟。在常规医院 IT 基础设施或实时临床决策场景中,GPU 内存、吞吐量等要求可能难以满足。论文未详细讨论模型压缩、蒸馏或量化策略,工程落地可行性存疑。
  • **反事实推断的可靠性不足**:虽然支持反事实干预模拟,但变分潜在空间的随机性和 transformer 的黑盒性质使得干预后的预测缺乏明确的因果辨识。反事实预测依赖于“干预不影响其他变量分布”的强假设,在临床中往往不成立。模型未与标准化因果推理方法(如 G-computation、IPW)进行系统性基准比较,反事实输出的置信度和安全性需要进一步验证。
论文Tobias Susetzky2026-09-08原文

相关内容