行业新闻

Databricks 开源 Funke:原生解析 HL7v2 消息

Databricks 用 Funke 替代 2021 年的 Smolder,让医院的 HL7v2 老消息无需转换就能在湖仓里直接查询。

Databricks 开源 Funke,一个能把原始 HL7v2 医疗消息直接解析为 Spark 原生类型的库与流水线。它不需要先转成 FHIR,也不依赖第三方工具做扁平化,保留完整嵌套结构,存进 Unity Catalog 后可随时用 SQL 或 DataFrame 查询。

正文摘录

介绍 Funke:Databricks 上的原生 HL7v2 解析 一个开源加速器,把原始 HL7v2 消息变成可查询的 Spark 原生数据,无需 FHIR 转换,也无需第三方扁平化工具。 作者:Sean Fischer、Chris Mantz 和 Andy Launchbury HL7v2 是那个悄悄支撑着医疗行业的消息标准。临床系统靠它告诉彼此:有患者入院了、有检验订单下了、有结果回来了。在它问世几十年后,它依然是业内部署最广泛的集成标准,绝大多数医疗机构在运营数据的日常流转上仍然依赖它。 它同时也很难伺候。一条 HL7v2 消息是一个嵌套的、用分隔符编码的结构:segment(段)由 field(字段)组成,field 由 component(组件)和 repetition(重复项)组成,component 由 subcomponent(子组件)组成,而它们全都由一小撮特殊字符分隔——这些特殊字符由消息自己在头部声明。规范留了灵活性空间,所以现实世界里的消息会因发送系统不同而各异。 当团队想把这些数据变成现代格式时,通常会用两种变通方案之一。要么先把所有东西转成 FHIR,这会增加一层翻译层,还可能丢掉那些从来就没有干净 FHIR 对应物的细节。要么把消息交给第三方引擎,让它把层级结构压平成宽表,这意味着要多付一家厂商的钱、把数据移出平台、并失去对底层细粒度结构的直接访问。两条路都会增加成本、增加延迟,并让你和自己的临床数据之间多了一层隔阂。 2021 年我们开源了 Smolder,一个把 HL7v2 消息加载进 DataFrame 的 Spark 库,让医疗团队不用手写解析器就能对实时 EHR 数据流做分析。Smolder 让 HL7 数据在 lakehouse 中的使用成为可能——在那个年代,解析消息本身还是采用的一大障碍。 自那以后,平台已经走了很远。

阅读原文(databricks.com)→

行业新闻2026-10-08原文

相关内容