论文

CardioState-JEPA: 延迟感知的跨模态学习共享心脏表征

CardioState-JEPA: 延迟感知的跨模态学习共享心脏表征

心电图 (ECG)、光电容积脉搏波 (PPG) 和心音图 (PCG) 提供同一心动周期的互补视图,然而现有心脏基础模型仅针对单一传感模态训练,未能利用跨传感器的共享生理信息。 我们提出 CardioState-JEPA,一种基于生理感知联合嵌入预测架构的心脏基础模型,联合学习 ECG、PPG 和 PCG 的共享表征。该模型将异构波形映射到公共 token 空间,通过单一 共享 Transformer 编码器 处理,并通过预测掩蔽的潜在心脏状态进行学习,将预训练目标置于共享生理而非传感器特定波形外观。为了处理电、机械和血流动力学事件之间的时间偏移,跨模态预测使用一个学习得到的 延迟对齐器 在对应心脏时间匹配信号。 由于同步多传感器记录稀缺,CardioState-JEPA 首先从大量单模态数据学习模态内结构,然后使用配对数据在潜在心脏时间上对齐模态。 作为冻结编码器在涵盖 ECG、PPG 和 PCG 的 25 个下游任务上评估,我们的编码器在平均 PPG 分类上提高了 8.2 AUROC 点,PCG 杂音检测提高了 18.8 AUROC 点,ECG 分类提高了 15.5 AUROC 点,超越最佳自监督信号基线,并在多个 ECG 基准上与使用特权临床文本或监督标签训练的心脏模型相当或更优。这些结果表明,异构心脏信号可以相互监督一个统一的心脏生理基础模型。

论文精读

TL;DR CardioState-JEPA 用延迟感知的跨模态 JEPA 联合学习 ECG、PPG、PCG 的共享心脏生理表征,在 25 个下游任务上大幅提升各模态分类性能。

问题

问题背景

当前心脏信号基础模型领域聚焦于从 ECG、PPG、PCG 等波形数据中学习通用表征,以支持心律失常分类、心音异常检测等下游任务。

现有方法局限

  • 单模态训练为主:多数模型仅针对单一传感器(如 ECG-only Transformer)训练,未利用 ECG 电活动、PPG 血流动力学、PCG 机械振动之间的共享生理周期。
  • 跨模态时间对齐缺失:直接拼接多模态输入时,电、机械、血流动力学事件之间存在固定但未知的延迟(如 QRS 波到 PPG 峰值约 100–200ms),现有模型缺乏显式的延迟对齐机制,导致潜在状态错位。
  • 同步配对数据稀缺:多传感器同步采集成本高、数据量少,难以直接支撑大规模跨模态预训练;而 SimCLR、MAE 等单模态自监督方法无法建模跨模态互补性。

为什么这个问题难/重要

异构波形在采样率、幅值尺度上差异显著,需要统一的 tokenization 策略;跨模态预测时若延迟不对齐,会破坏潜在心脏状态的一致性,影响表征质量。临床上,PCG 心音和 PPG 脉搏波常比 ECG 更易通过可穿戴设备获取,若能借助 ECG 的丰富标签知识提升低资源模态的诊断性能,将大幅降低远程心脏筛查的部署门槛。

行业类比

类似多模态视频理解中音视频跨模态预测,通过学到的延迟对齐让异质信号互相监督——这与 CLIP 式对比学习不同,更接近视频/音频领域的 JEPA 潜在状态预测。

核心洞察

  • 跨模态预测目标从传感器波形外观转向共享生理状态,使 ECG、PPG、PCG 能够互为监督信号。这一角度独特在于,现有心脏基础模型通常针对单一模态做重构或对比学习,难利用不同传感器之间的互补性;而 CardioState-JEPA 在潜在空间预测被 mask 的 cardiac state,让模型关注生理事件本身,而非波形细节,从而学到跨模态一致的表征。
  • 学习到的延迟对齐器在潜在心脏时间上对齐跨模态信号,解决了电、机械、血流事件之间的时序偏移问题。不同于简单的时间对齐预处理或固定滞后假设,该方法让模型自适应学习每对模态的延迟关系,使得跨模态预测目标在正确的生理时刻执行,显著提升跨模态表征的一致性和下游任务性能。
  • 两阶段训练策略先利用大量单模态数据学习各模态内部结构,再用少量配对数据做跨模态对齐,缓解同步多传感器数据稀缺的限制。与直接在大规模配对数据上进行多模态预训练相比,该策略更符合实际数据获取条件,且实验证明在稀缺配对数据下仍能取得显著提升,提升了方法的可部署性。

方法

输入为三类异构心脏信号:ECG(电活动)、PPG(血流动力学)、PCG(心音)。各模态首先通过独立的 modality tokenizer 映射到统一 token 空间,消除采样率与幅值差异,使后续处理共享一个 token 词汇表。

关键模块包括:

  • 共享 Transformer encoder:所有模态 token 经同一编码器提取上下文表示,使模型学习跨传感器一致的生理特征。
  • Joint-Embedding Predictive Architecture (JEPA):训练目标不是重建原始波形,而是在潜在空间预测被 mask 的 token 对应状态,迫使模型关注共享生理状态而非传感器特定外观。
  • Learned delay aligner:跨模态预测时,由于电、机械、血流事件存在时间偏移,该模块学习将不同模态信号对齐到同一心脏时相,再进行预测。
  • 两阶段训练:Stage I 利用大量单模态数据做 intra-modal JEPA,学习各模态内部结构;Stage II 使用少量同步配对数据做 cross-modal JEPA,通过延迟对齐实现跨模态监督。

输出是冻结后的共享表示,可直接用于 25 个下游分类任务,覆盖三类信号。

与现有单模态心脏基础模型相比,本方法通过跨模态延迟对齐与两阶段预训练,在同步数据稀缺条件下利用异质信号互为监督,学习到统一的生理表征。

实验

实验设计

CardioState-JEPA 采用两阶段预训练:第一阶段在大量单模态数据上学习模态内结构,第二阶段使用有限的同步多传感器配对数据,通过延迟感知跨模态 JEPA 对齐共享心脏表征。预训练后,冻结编码器在 25 个下游任务 上进行线性评估,覆盖 ECG、PPG、PCG 三类信号。

关键发现

  • 跨模态监督显著提升所有模态的分类性能:PPG 平均 AUROC 提升 8.2 点,PCG 杂音检测提升 18.8 点,ECG 分类提升 15.5 点,均超过最佳自监督信号基线。
  • 在若干 ECG 基准上,冻结编码器达到或超过使用临床文本或监督标签训练的专用模型。

与基线对比的深度解读

此前的心脏基础模型大多针对单一模态,无法利用跨传感器共享的生理先验。CardioState-JEPA 通过共享 Transformer 编码器和延迟对齐器,将预训练目标放在潜在心脏状态而非波形外观上,使模型能够学习到鲁棒的生理表示。这种设计对实际工程有两点启示:

  1. 数据稀缺场景:同步多传感器数据昂贵且稀少,两阶段策略让模型先从海量单模态数据中受益,再以小批量配对数据对齐,显著降低数据采集门槛。
  2. 跨模态泛化:统一表征让不同传感器上的下游任务可以复用同一编码器,避免为每种模态单独训练基础模型,减少部署与维护成本。

结论表明:异构心脏信号可以相互监督,共同构建一个生理学意义上的基础模型。

行业影响

落地场景

CardioState-JEPA 作为跨模态心脏基础模型,可直接用于可穿戴设备 / 远程患者监护 / 临床辅助诊断场景。例如,智能手表同时采集 PPG 与 ECG,模型可统一编码、提升房颤检测、心率变异性分析、血氧估计等任务精度;PCG 心音用于心脏杂音筛查,模型冻结编码器后少量标注即可适配新设备与人群。此外,医疗 SaaS 平台可将该编码器嵌入多参数患者监护系统,降低对单一传感器质量的依赖。

商业价值

  1. 降本:预训练编码器大幅减少各模态下游任务的标注数据需求,对于医院和穿戴设备厂商,可节省数据采集与专家标注成本。
  2. 增收:提升模型性能带来更准确的健康洞察,增强产品差异化竞争力;例如 PPG 分类 AUROC 提升 8.2 点,PCG 杂音检测提升 18.8 点,可直接改善用户付费意愿。
  3. 体验提升:跨模态共享表示使设备在单一传感器失效时仍可保持监测连续性,减少误报,提升用户信任。

接口集成

现有健康数据流水线通常为每模态独立模型。CardioState-JEPA 可作为特征提取器集成:

  • 在云或边缘部署时,将原始波形分帧 → 经过各自 tokenizer 映射到公共 token 空间 → 共享 Transformer 输出嵌入 → 下游任务头(线性 probe 或轻量 MLP)。
  • 对于仅有单模态数据的场景,可直接使用第一阶段训练好的单模态编码器;对于有多模态同步数据的场景,可启用延迟对齐模块获得更强表示。
  • 模型可导出为 ONNX / TensorRT 格式,嵌入医疗设备固件或健康 App 后端,与现有 MLOps 流程兼容。

具体落地 use case

  • 电商平台的健康硬件生态:某电商平台自营智能手表品牌,利用 CardioState-JEPA 编码器统一处理手表 PPG 与 ECG 信号,上线房颤筛查功能,无需重新训练各模态独立模型;由于模型冻结,推理成本低,可实时运行在手表端侧。
  • 企业健康管理 SaaS:为企业提供员工心脏健康监测服务,将 PCG 心音采集设备接入平台,用 CardioState-JEPA 做杂音检测初筛,阳性样本转人工复核,大幅降低人工听诊工作量。

局限

  • CardioState-JEPA 的第二阶段跨模态对齐依赖同步多传感器数据,这类数据在临床或可穿戴场景中较为稀缺且采集成本高,论文也指出“synchronized multi-sensor recordings are scarce”。这可能导致模型只能在有限的配对数据上对齐模态,不同传感器组合(如 ECG-PPG、ECG-PCG、PPG-PCG)之间的共享表示学习不充分,跨模态泛化能力受限。此外,配对数据中的信号质量差异(如 PCG 噪声、运动伪影)可能使延迟对齐过程不稳定,进一步影响最终表示的质量。
  • 下游评估集中在分类任务上,用 AUROC 作为主要指标,覆盖了不同模态的分类基准,但缺少对回归(如心率估计、血压预测)、生成、去噪或事件定位等常见心脏信号分析任务的验证。这限制了我们对共享表示通用性的理解:一个真正强大的心脏生理基础模型应能服务于多种任务类型,而不仅仅是判别式分类。因此,当前证据不足以证明该表示能有效迁移到需要连续输出的实际应用中。
  • 延迟对齐器假设跨模态时间偏移可以通过可学习的变换建模,但真实生理信号中的延迟可能因个体差异、病理状态或传感器位置而变化,且这种变化往往是非平稳的。论文未深入探讨对齐机制在心律失常、瓣膜疾病等病理条件下的鲁棒性,也未在更多样的人群、设备和采集协议上进行验证。此外,模型只在单一数据集或少数数据集上训练,其泛化到新传感器或新人群的能力仍待进一步检验。
论文Hamza Shafiq2026-08-13原文

相关内容