论文

冻结的模型,演进的专长:面向多模态医学 AI 的模型无关部署经验学习

冻结的模型,演进的专长:面向多模态医学 AI 的模型无关部署经验学习

LLM 与 VLM 部署后通常被冻结,无法从已处理的病例中继续学习。医学领域尤为棘手:新临床证据、更新指南与新型疗法会不断改变既有诊疗实践。微调虽可更新模型,却需访问模型权重并额外训练;无参数方法虽免去训练,却容易过拟合固定验证集、缺乏可靠领域知识,或因仅以文本保存经验而丢失视觉细节。 为此,我们提出一个 模型无关 框架,让冻结的 LLM 与 VLM 通过三种外部专家知识学习:Skill 引导推理与工具调用,Knowledge Memory 存储由既往病例或可信外部证据支持的事实,Multimodal Knowledge Base 保存视觉示例并引导模型将检索到的病例与当前图像关联。我们不再依赖固定验证集,而采用一种验证策略:更新只有在有助于新病例且不损害早期病例表现时才会被保留。 在覆盖临床诊断、临床工作流、医学推理及医学与非医学视觉推理的 6 个 benchmark 上,使用 4 个 开源与闭源 base model,该框架在在线部署中将医学任务表现最高提升 34.2%,并可泛化到未见病例、无需进一步优化即可迁移到其他模型,在非医学领域同样有效。

论文精读

TL;DR 让冻结的多模态医学 AI 通过 Skill、Knowledge Memory、Multimodal Knowledge Base 三种外部经验在部署中持续学习,无需微调权重,跨模型迁移,医疗任务最高提升 34.2%。

问题

问题背景

当前 LLM 和 VLM 部署后通常被冻结,无法从实际解决的案例中持续学习。在医学领域,临床证据、指南和疗法更新频繁,模型若不能适应新知识,性能会随时间下降,这成为 AI 落地医疗的关键痛点。

现有方法局限

  • 微调(Fine-tuning) 虽然能更新模型,但要求开放权重并重新训练,在模型即服务或 API 场景下不可行,且计算开销大。
  • 无参数方法 避开训练,但存在三类具体限制:一是容易在固定验证集上过拟合,无法泛化到新案例;二是缺乏结构化领域知识,仅靠文本检索可能引入错误事实;三是只以文本形式保存经验会丢失视觉细节,难以支持多模态推理。

为什么这个问题难/重要

技术挑战在于:模型处于冻结状态,所有更新必须通过外部机制实现,同时要保证新知识与旧知识不冲突、更新后在新案例上有效且不退化。医学场景对可靠性和可审计性要求极高,任何错误更新都可能带来风险。业界普遍关注“持续学习”“模型即服务”和“多模态记忆”,本工作直接回应了在不可重训条件下如何让模型持续进化的核心难题。

行业类比

类似 在线推荐系统 通过用户反馈实时更新用户画像,但医学 AI 更需要多模态证据和高可靠性;本框架相当于给冻结模型外挂一个可生长的“专家经验库”。

核心洞察

  • 该框架把部署期学习完全外部化为可组合的三种专业知识:`Skill`(引导推理与工具调用)、`Knowledge Memory`(存储有证据支持的事实)和 `Multimodal KB`(保存视觉案例并引导模型关联当前图像),因此冻结的 LLM/VLM 无需权重访问或训练即可从真实案例中持续进化。与 fine-tuning 需要权重权限、纯文本记忆丢失视觉细节等方案相比,这一设计同时保留视觉证据和结构化推理路径,且模型无关,可直接套用于不同基座模型。
  • 在线滚动验证协议把“更新是否保留”绑定到“在新案例上提升且不损害旧案例”,而非在固定验证集上选择最优更新,从而抑制过拟合并支持长期稳定累积。这一协议在四个基座模型、六个基准上的稳定提升(医学任务最高 +34.2%)以及零步跨模型迁移中起关键作用;它说明部署期学习不必为每个模型单独调参,经验可以像模块一样插拔复用。

方法

输入

模型在部署中遇到的新病例(多模态图像/文本)及其反馈信号。

关键模块

框架从部署经验中沉淀三类外部专业知识,注入冻结模型的上下文:

  • Skill(可复用技能):从已解决的新病例中归纳推理步骤与工具调用策略,以自然语言程序的形式引导模型后续行为。
  • Knowledge Memory(知识记忆):存储由已解决病例或可信外部证据支持的确定性事实,通过检索作为上下文事实,避免模型幻觉。
  • Multimodal Knowledge Base(多模态知识库):保留视觉参考示例,并生成关系提示,引导模型将检索到的历史图像与当前输入对照,补充纯文本记忆丢失的视觉细节。

采用在线验证策略:只有当某个更新在新病例上提升性能、且不降低更早病例上的表现时,才保留该更新,防止过拟合固定验证集。

输出

更新后的三类外部专业知识(Skill / Knowledge Memory / Multimodal Knowledge Base)作为上下文注入,使冻结 LLM/VLM 在部署中持续提升。

与同类方法差异:相比微调无需访问权重与训练;相比参数自由方法,不依赖固定验证集、保留视觉信息,且专业知识模型无关,可跨模型迁移。

实验

实验设计

在 六个 benchmark 上评估,覆盖 临床诊断、临床工作流、医学推理 以及 医学与非医学视觉推理 四类任务。使用 四个基础模型(开源与闭源),遵循在线部署协议:模型持续接收案例,框架通过 Skill(引导推理与工具使用)、Knowledge Memory(存储可靠事实)和 Multimodal Knowledge Base(保存视觉示例)三种外部专业知识从经验中学习,并通过动态验证策略保留有效更新。

关键发现

  • 在所有基准上,每个基础模型均有提升;医学任务最高提升达 +34.2%。
  • 提升幅度在可复用的专业知识场景最大,对案例顺序鲁棒。
  • 消融显示三种组件各贡献不同增益;验证步骤对增益必要。
  • MMKB 优于标准多模态检索,增益源于对引用案例与当前图像关系的引导。
  • 学习到的专业知识可泛化到未见案例,并可 零步跨模型迁移(无需进一步优化)。

与基线对比

相较于 微调,本框架无需访问模型权重、无需额外训练,适合部署后持续学习;相较于 参数自由方法,本框架避免过拟合固定验证集、缺乏可靠领域知识、丢失视觉细节等问题。其核心差异在于以多种互补外部知识形态(技能、事实记忆、视觉库)配合在线验证实现稳定且可迁移的部署期学习。

行业影响

落地场景

该框架适用于需要长期在线学习的多模态 AI 产品,尤其适合医疗辅助诊断、医学影像报告生成、临床决策支持等场景。也可迁移到其他垂直领域,如工业质检、电商多模态商品识别、内容平台违规图片审核。例如,在医学影像诊断系统中,模型可不断从新病例中学习新的病变模式与诊疗指南变化,而无需重新训练底层模型。

商业价值

  • 降本:避免频繁全量微调,节省 GPU 训练与数据标注成本;冻结模型只需维护外部知识库,推理成本基本不变。
  • 增收/体验提升:在部署后持续吸收新知识,提高对罕见病、新疗法的识别准确率,减少漏诊误诊风险;在电商场景下,动态更新商品属性与视觉特征,提升搜索匹配与推荐转化率。
  • 风险控制:通过验证策略(仅保留对新案例有效且不降低旧案例性能的更新)防止灾难性遗忘,保证线上稳定性。

与现有产品/工作流的接口

该框架模型无关,可包装为现有推理服务的一个侧车(sidecar)模块:

  1. 在推理入口处,将用户输入与外部 Skill / Knowledge Memory / MMKB 拼接后发送给冻结的 LLM/VLM;
  2. 后台异步从已处理案例中提取可靠知识并写入外部存储;
  3. 使用独立的验证队列(新案例 + 历史案例)决定是否发布更新;
  4. 由于不修改模型权重,可以随时热切换知识版本,也便于在不同模型(如 GPT-4V 与 Qwen-VL)之间零成本迁移。

相比需要访问权重的参数高效微调(如 LoRA),该方案无需任何训练过程;相比纯文本外部记忆,保留了视觉样例,更适合多模态任务。

具体 use case:

  • 医疗影像辅助诊断:部署于医院 PACS 系统旁的 AI 诊断服务,持续学习本院新病例和最新临床指南,自动更新诊断 Skill 与典型影像参考,降低误诊率。
  • 电商多模态商品审核:平台商品图片与描述合规审核模型,利用部署期间的新违规模式更新知识库,提高对新型违禁品图像的识别能力。

局限

  • 该框架依赖部署过程中案例反馈的质量与时效性。实际医疗场景中诊断结果确认常有延迟,且反馈可能存在标注噪声;验证策略要求有足够的新案例来评估每次更新是否带来增益,冷启动阶段或罕见病案例不足时,更新频率会变低,导致模型应对新证据的能力滞后。此外,初始外部专业知识(如可信证据库)的质量会直接影响后续学习,若初始知识有偏或过时,框架可能固化错误。论文未讨论这些反馈环节中的异常处理与纠错机制。
  • 随着部署时间增长,Knowledge Memory 与 Multimodal Knowledge Base 会累积大量条目,存储与检索成本线性增加,可能影响在线推理延迟。方法本身依赖检索质量,检索失败或检索到弱相关案例会误导模型,但论文未给出检索模块的延迟、内存占用及检索失败率等工程指标。与参数更新方法相比,外部存储方式不能改变基座模型内部表征,性能提升受限于原始模型能力,尤其在需要深度语义整合的复杂视觉推理任务上,可能不如对模型权重做定向更新。
  • 实验验证主要基于六个医学与非医学基准和四个基座模型,虽然展示了跨模型迁移与泛化能力,但均为离线模拟部署协议,与真实临床生产环境仍存在 gap:真实场景涉及持续分布漂移、多机构数据异构、隐私限制及反馈稀疏。论文未在真实长期部署中测试框架,也未说明在计算资源受限的边缘设备上的可行性。与端到端持续学习(如 rehearsal、EWC 等)相比,该方法的更新策略较为保守,可能牺牲对显著分布变化的快速适应能力。
论文Yexiao He2026-10-06原文

相关内容