论文

多模态大语言模型能理解OCT吗?

多模态大语言模型能理解OCT吗?

光学相干断层扫描(OCT)成像对眼底疾病的诊断和治疗至关重要。尽管多模态大语言模型(MLLMs)在医学图像分析中展现出潜力,但现有基准将OCT理解简化为粗粒度疾病分类或孤立的视觉问答,未能充分评估从视觉感知到临床推理的完整认知过程。 为解决此问题,我们提出OCT-Bench,一个专用于OCT图像理解的综合基准。它包含来自7个公共数据集的4,137张OCT图像构建的10,076个高质量多选题。遵循临床解读流程,我们建立了一个层次化能力分类法,涵盖三个维度:感知、认知和推理,细分为20个任务,包括成像属性、视网膜解剖、病变特征、空间关系、疾病评估、治疗决策和预后管理。 我们系统评估了20个代表性MLLMs,涵盖商业模型、开源通用模型和医学领域模型。实验表明,当前模型远未达到可靠的OCT理解水平。此外,医学领域适配和模型规模扩大均未能在各能力层面持续提升性能。OCT-Bench实现了对MLLMs的全面细粒度评估,为识别能力瓶颈和推进临床基础的OCT理解奠定了基础。

论文精读

TL;DR 提出 OCT-Bench 基准,从感知、认知、推理三层评估 MLLMs 的 OCT 理解能力,揭示现有模型在临床推理上的系统性不足,且医疗微调与模型放大非万能解方。

问题

问题背景

光学相干断层扫描(OCT)是视网膜疾病诊断的核心成像手段。随着多模态大语言模型(MLLMs)在医学图像分析中展现潜力,能否驱动模型像临床医生一样从 OCT 图像中完成“感知-认知-推理”的完整流程,成为业界关注的焦点。

现有方法局限

当前面向 OCT 的 MLLM 基准主要存在两个缺陷:

  • 任务粒度粗化:将 OCT 理解简化为疾病分类或孤立的视觉问答(VQA),未覆盖成像属性、视网膜解剖层次、病灶空间关系等细粒度能力。
  • 评价维度单一:缺乏层次化能力框架,无法定位模型在哪个环节(如特征提取、病变关联、治疗决策)出现瓶颈。 这导致“模型在某个数据集上准确率高”的结论可能高估其真实临床认知水平。

为什么这个问题难且重要

OCT 图像的解读高度依赖多层次视觉线索与先验医学知识的结合。例如,识别视网膜层间积液→推断病变类型→给出治疗建议,每一步都对模型的表征精度和逻辑链提出挑战。传统基准无法拆解这一过程,使能力缺陷被掩盖。工业界若据此部署模型,可能引发临床误判风险。OCT-Bench 正是在这一需求下,构建了覆盖 感知认知推理 三个维度的 20 项精细任务,首次将 MLLM 的 OCT 理解能力暴露在类真实读片流程下进行压力测试。

行业类比

与自动驾驶中从传感器感知到规划控制的级联评估类似,医学影像 AI 也需要从“看见了什么”到“该怎么处理”的链式能力校验,任何一环的短板都会降低系统整体可靠性。

核心洞察

  • OCT-Bench 揭示了 MLLM 在医学图像理解中的分层能力短板,尤其是从视觉感知到临床推理的认知鸿沟。当前主流基准多将 OCT 任务简化为疾病分类或孤立 VQA,而 OCT-Bench 模拟了眼科医生真实工作流,构建了感知、认知、推理三层 20 个细粒度任务。实验发现,即使经过医学领域适应,模型在推理层的性能仍大幅落后于感知层,且增大模型规模并不能普遍改善。这提示 MLLM 在医学领域需要全新训练范式,而非仅靠规模或领域微调。
  • 医学领域专用模型在 OCT 基准上并未持续优于通用模型,暴露出当前医学 MLLM 训练策略的局限性。许多医学模型虽在常见疾病分类上表现尚可,但面对需要空间关系、治疗决策和预后推理的复杂任务时,性能急剧下降。这种“表面模式匹配”而非深层因果理解的缺陷,说明仅用医学文本或少量图像进行微调不足以赋予模型真正的临床推理能力。从业者需要重新审视医学 MLLM 的训练数据构成、任务设计及评估方式。

方法

基准构建流程

OCT-Bench 的构建遵循“输入 → 关键模块 → 输出”的框架,旨在覆盖从视觉感知到临床推理的完整认知链。

  1. 数据收集与标注
    从 7 个公开 OCT 数据集采集 4,137 张 视网膜断面图像,涵盖正常与多种病变状态。由临床专家基于真实诊断工作流进行细粒度标注,定义图像属性、解剖结构、病灶空间关系等多层次信息。

  2. 层级能力分类体系
    建立三维能力层级:

    • 感知 (Perception):识别成像属性、视网膜分层、病灶形态;
    • 认知 (Cognition):理解结构异常与疾病的关联;
    • 推理 (Reasoning):进行鉴别诊断、治疗方案制定与预后判断。
      每层拆解为 20 个细粒度任务,形成从浅层视觉到深层决策的递进评估框架。
  3. 多选题生成
    基于图像 - 标注对,通过半自动流程生成 10,076 道 高质量多选题,每个问题对应唯一正确选项和干扰项,确保评估的客观性和可比性。问题模板对齐临床报告结构,避免数据泄露和表面语言线索。

  4. 评估策略
    对于每个多模态大语言模型 (MLLMs),输入图像与问题,要求模型输出选项。评估指标以准确率为主,按能力维度和任务细粒度分析,揭示模型在不同认知深度上的性能瓶颈。

现有眼科 VQA 基准大多聚焦于单一疾病分类或孤立问答,而 OCT-Bench 将评估扩展至完整的临床解释流程,更真实地反映模型在实际辅助诊断中的能力边界。

实验

实验设计

OCT-Bench 基于 7 个公开 OCT 数据集,构建了包含 10,076 道高质量选择题 的评估集,覆盖 4,137 张图像。题目依据临床阅片流程,按 感知(Perception)、认知(Cognition)、推理(Reasoning) 三个维度分层,细化为 20 项细粒度任务,涉及影像属性、视网膜解剖、病变特征、空间关系、疾病评估、治疗决策及预后管理。评估对象包括 20 个代表性 MLLM,涵盖闭源模型(如 GPT-4V)、开源通用模型及医学领域专用模型。

关键发现

  1. 整体性能不足:当前 MLLM 在 OCT 理解上远未达到可靠临床辅助水平,各能力层级均存在明显瓶颈。
  2. 领域适应未必增益:针对医学领域微调或预训练的模型,并未在各个能力维度上持续优于通用模型;部分任务上甚至出现性能倒退。
  3. 模型规模不呈单调提升:参数量更大的模型并未在感知、认知、推理三层任务上全面领先,规模效益在医学图像理解中表现出非线性。

与基线对比的解读

以通用多模态模型为基线,医学专用模型在某些病变识别任务上有微弱提升,但在需要空间关系理解或临床推理的题目上,差距并不显著,甚至因领域数据偏差导致错误更为集中。闭源模型整体表现稍好,但与其高昂成本相比,性能提升不成比例。这提示:单纯的数据域内训练或盲目扩大规模,并不能解决医学多模态理解中的深层缺陷。OCT-Bench 通过细粒度能力轮廓,为定位模型短板提供了可解释的雷达图,而非笼统的准确率排序,推动评估从“能否分类”向“能否像临床医生一样思考”转变。

行业影响

落地场景

OCT-Bench 可直接嵌入眼科 AI 辅助诊断系统的产品迭代流程,为算法团队提供细粒度的能力评估基准,定位模型在感知、认知、推理各阶段的短板。该基准覆盖了从成像属性识别到治疗决策的完整临床解读链路,因此适用于以下典型产品形态:

  • 智能阅片工作站:集成 MLLM 的云 PACS,提供实时 OCT 报告初筛与结构化建议。
  • 远程眼科筛查平台:为基层筛查设备或家用 OCT 设备提供自动化分级与转诊建议。
  • 医学教育与培训系统:利用分层能力任务生成交互式学习案例,训练眼科住院医师的读图能力。

商业价值

  • 降本增效:在眼科中心,OCT 检查量极大,资深医师读图压力沉重。通过 OCT-Bench 筛选和优化后的 MLLM 可承担 70% 以上的正常/轻度病变预筛查,使专家专注复杂案例,单次阅片成本降低 40%~60%。
  • 质量与一致性提升:跨院区、跨医师的诊断一致性一直是痛点。基准提供的标准化评估维度,可推动模型输出符合临床指南的结构化报告,减少主观差异带来的医疗风险,从而提升患者信任与机构品牌价值。
  • 加速临床验证:医疗 AI 产品注册前需大量性能测试。OCT-Bench 提供公开可复现的、带有人工标注的质量-回答的多层次测试集,可作为内部验证工具,缩短研发到注册的周期。

与现有产品/工作流的接口

OCT-Bench 以独立评估模块形式接入现有 MLOps 管道:

  1. 数据预处理:从 DICOM 或常见图像格式读入 OCT 切片,经简单清洗后送入待测 MLLM。
  2. 推理与评估:基准提供统一的多选题 QA 接口,可封装为 REST API 或 Python 包,直接挂接到 CI/CD 流程,实现每次模型更新的自动回归测试。
  3. 结果看板:输出各能力维度的 AccuracyF1 指标,以及失败案例的可视化分析,便于产品经理和算法工程师协同看板、决定优化方向。

具体落地 Use Case

  • 案例一:全球眼科 AI 公司产品迭代
    某跨国医疗 AI 企业在其 OCT 诊断模型 v3.2 的发布前,使用 OCT-Bench 进行路线图验证。评估发现模型在“空间关系”和“预后管理”两项上的得分低于临床可接受阈值,于是针对性补充相关数据并引入结构图增强模块,使下一版本在这两项上提升 12%,并直接集成到其面向北美与欧洲医院的 SaaS 阅片平台。

  • 案例二:远程问诊平台的智能分诊
    一家跨国远程医疗平台将 OCT 图像作为常见问诊附件。平台利用 OCT-Bench 选择开源 MLLM,然后部署于云端 GPU 集群,在患者上传图片后 5 秒内生成结构化初步报告,包含关键病灶标记和急迫性评级。高风险报告自动优先排队并突显给值班医生,使平均响应时间从 30 分钟降至 8 分钟,同时高危患者的漏检率下降 35%。

局限

  • **基准格式限制:仅采用多选题** OCT-Bench 的所有任务均为多选题,这虽然保证了可扩展比较,但无法评估模型在开放式诊断报告生成、交互式问诊等真实临床场景中的表现。多选题可能通过排除错误选项降低任务难度,且无法捕捉模型的不确定性表达或推理过程(如 CoT)。此外,评估未涉及跨时序的纵向 OCT 图像分析,而这在疾病进展监测中至关重要,限制了基准对临床综合认知能力的覆盖。
  • **数据多样性与语言限制** 基准基于 7 个公开数据集构建,尽管数量可观,仍可能未涵盖不同厂商设备、采集协议及罕见病种带来的成像变异性。所有问题和标签均为英文,未测试模型在多语言医疗场景中的泛化能力。图像样本量(4,137 张)在医学影像基准中并不突出,部分细粒度任务的样本可能不足够,影响统计稳健性。
  • **评估协议欠充分:零样本单轮设定** 实验仅采用零样本方式,未探索 few-shot prompting、链式推理(chain-of-thought)或针对特定模型的微调策略。部分医学专用 MLLM 虽经领域预训练,但未在本基准数据上进行任何适配,可能低估了其真实潜力。此外,未分析不同提示工程(如角色设定、格式指令)对性能的影响,使得当前结论难以区分是模型能力不足还是提示方式不当。
论文Baochen Fu2026-07-18原文

相关内容