达摩院等发布 ClinFusion:医疗多模态大模型与临床对齐评测框架
ClinFusion 用组合式视觉编码器和临床对齐评测,解决医疗大模型看不懂复杂影像、评测脱离实际的问题。
ClinFusion 是一款以视觉为核心的医疗多模态大模型,通过组合 2D 与 3D 视觉编码器(分别处理平面影像和立体扫描数据)提升对 X 光、CT 等多种影像的理解,同时提出贴近放射科医师读片方式的评测框架,可精确区分命中、漏诊与幻觉。
正文摘录
ClinFusion:视觉为核的医疗多模态大模型,与临床对齐的评测新范式 来源:机器之心 .jpg) 作者 | 论文团队 编辑丨ScienceAI 多模态大模型要真正进入临床,本质上是一个「视觉为核」的问题,而这个问题有两个彼此耦合的缺口:架构上,模型要能原生吸收从 X 光、病理切片到 CT、MRI 的高度异构的视觉知识;评测上,判定标准要贴合放射科医师真实的读片方式,而不是停留在文本表层匹配。 为了补上这两个缺口,达摩院联合浙江大学、清华大学等提出 ClinFusion:一个视觉为核的组合式多模态大模型,加一套临床对齐、以事实性为导向的评测框架。  论文地址:https://arxiv.org/abs/2607.24743 代码仓库:https://github.com/alibaba-damo-academy/ClinFusion 模型权重(8B / 32B):https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion 在线体验:https://huggingface.co/spaces/Alibaba-DAMO-Academy…