论文

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

扩散语言模型通过双向去噪令牌画布生成文本,而非从左到右逐词生成,已可与自回归 (AR) 生成相媲美。然而,医学基础模型几乎全部采用自回归架构。我们改编了混合专家扩散语言模型 DiffusionGemma-26B,并在相同的 LoRA 策略下,将其与同等规模的自回归模型 Gemma-4-26B 在医学视觉问答数据集上进行对比,使用对冗长鲁棒的 LLM 裁判 评分。 扩散模型在所有任务上均达到或超越自回归模型,其微调版本(3.8B 活跃参数)可媲美前沿视觉语言模型,且解码速度提升 3.5-4.4 倍。更为重要的是,扩散模型提供了自回归模型所缺乏的起草能力:任意顺序填充。由于画布是双向去噪的,放射科医生可以固定报告片段,由模型填充它们之间的文本——这种操作对扩散模型而言是固有的,而自回归模型表现不佳。这非常适合真实的报告场景,这些报告往往语言简洁,且在不同临床医生和机构之间存在不一致。

论文精读

TL;DR 将离散扩散语言模型首次用于医学报告草拟,在医学 VQA 上匹配或超越同规模自回归模型,并原生支持任意位置文本补全,解码速度也快 3.5-4.4 倍。

问题

问题背景

放射学报告生成(Radiology Report Generation, RRG)旨在从医学影像自动生成描述性文本,以减轻放射科医生的文书负担。当前主流方案依赖 自回归 (autoregressive, AR) 语言模型,逐 token 从左到右生成报告,在通用文本领域已取得显著成果,但在交互式临床场景下面临根本性局限。

现有方法局限

AR 生成天然单向,无法利用双向上下文,导致三大痛点:

  • 僵化的线性生成:报告一旦生成,修改片段(如调整“无异常发现”为“疑似结节”)需重新生成整段或复杂后处理,无法自然支持医生的局部编辑反馈。
  • 弱填充能力:尽管部分 AR 模型通过 Fill-in-the-Middle (FIM) 训练强行支持中间补全,但该机制并非原生,在长文本、多修改点下表现显著退化,且需显式提供左右上下文分隔符,交互不直观。
  • 一致性控制不足:单向生成难以保证修改后报告前后风格、术语、逻辑的一致,尤其当多名医生异步编辑时。

为什么这个问题难/重要

离散扩散语言模型 应用于医学多模态交互面临三重挑战:

  1. 架构匹配:需将图像编码器与扩散解码器深度对齐,设计高效的条件去噪策略,弥合扩散模型在医学 VQA 上与同尺寸 AR 模型的性能差距。
  2. 解码效率:扩散模型通常需要多步去噪,如何在大模型(如 26B 参数,3.8B 活跃)上实现实时交互级速度(本文达到 3.5–4.4 倍加速)是工程关键。
  3. 生态切换成本:医学基础模型几乎全为 AR 架构,迁移至扩散范式需重新验证安全性、稳定性及与现有临床工作流的耦合。

其重要性在于:一旦突破,扩散模型的 canvas 操作范式 将把报告生成从单次线性流水线转变为双向、可任意插拔的交互创作,直接映射到放射科医生以片段梳理再整合的自然工作习惯,有望大幅提升报告质量与效率,并降低跨机构报告风格差异带来的沟通成本。

行业类比

如同 代码补全 工具允许开发者在任意位置插入或修改代码,模型自动重整上下文,扩散语言模型为放射学报告提供了类似的 任意序填充 能力,使报告草拟从“从头写”变为“填空式编辑”。

核心洞察

  • **扩散模型的任意顺序填充能力** 为交互式文本生成提供了自回归模型缺失的原语。在放射报告起草中,医生可修正片段,模型双向填充间隙,符合真实报告编写的增量修正需求。自回归模型对此操作表现欠佳,而扩散模型天然支持,这可能成为领域特化文本编辑应用的关键差异化功能。
  • **同等条件下,扩散模型在医学 VQA 上匹配或超越自回归模型,且推理速度提升 3.5–4.4 倍**。这一结果挑战了医疗基础模型必须采用自回归架构的默认假设。严格对照实验(同规模、同 LoRA 配方)表明,扩散模型在领域微调中兼具质量与效率优势,对部署于资源受限环境有实际意义。

方法

模型架构与输入适配

本工作以 DiffusionGemma-26B 为骨干,该模型内置多模态编码器,可直接接受医学图像(如 X 光片CT)作为视觉输入。图像经过视觉编码器转换为嵌入序列,与文本提示(如 VQA 问题 或报告片段)的 token 嵌入拼接,送入 离散扩散解码器

关键模块:离散扩散去噪

扩散解码器(基于 Transformer + Mixture-of-Experts)在固定长度的 token canvas 上执行迭代去噪

  • 训练时,随机选取时间步 t,对真实文本 token 序列施加某种噪声(例如随机替换为 mask token 或其他 token),强制模型根据全 canvas 的上下文预测原始 token。损失函数为每个位置预测干净 token 的交叉熵,等价于 Masked Diffusion Language Modeling (MDLM) 目标。
  • 推理时,从完全 mask 的 canvas 开始,通过多步去噪逐步揭示文本,每一步允许模型修正之前的不确定性输出,解码过程是双向、并行的,而非逐 token 左到右生成。

高效微调与输出

为公平对比,对 DiffusionGemma-26B 和同规模的 Gemma-4-26B 均采用相同 LoRA 配方进行微调,仅更新低秩适配矩阵,有效参数约 3.8B。微调后模型可直接输出诊断答案或修改后的报告文本。

任意顺序填充 (Infill)

扩散模型特有的双向去噪机制天然支持任意顺序填充:用户固定报告的开头与结尾片段,将中间区域置为 mask token,模型会在去噪过程中利用双向上下文补全中间内容。这一操作对自回归模型极其困难,而扩散模型只需调整 mask 位置即可零样本执行,赋能放射科医生交互式修正报告草案。

与同类方法的差异:扩散模型突破了自回归 left-to-right 的生成范式,不仅解码速度 3.5–4.4× 更快,还能以原生能力实现文本填充,更适合临床报告这种需要局部修正与补全的场景。

实验

实验设计将 Mixture-of-Experts 扩散语言模型 DiffusionGemma-26B 与同规模 AR 模型 Gemma-4-26B 在医学 VQA 数据集上对比,采用相同 LoRA 微调方案,并以对冗长稳健的 LLM 裁判评分。同时评估推理加速与 any-order infill 能力。

关键发现:扩散模型在各项医学 VQA 任务上持平或超越 AR 基线,解码速度提升 3.5–4.4 倍,微调后模型(3.8B 激活参数)性能可比肩前沿视觉语言模型。其 双向去噪 机制天然支持报告片段填充(infill),放射科医生可修正局部内容,模型自动补全中间文本,而 AR 模型在该操作上表现不佳。

深度解读:扩散生成首次在医学文本领域全面对标 AR,尤其 双向上下文建模 不仅带来速度优势,更开启交互式报告起草的新范式。相比 AR 的单向左至右生成,扩散模型的 canvas 级并行迭代去噪更适应跨机构、跨医生间报告风格不一致及内容碎片化的现实场景,infill 操作可直接融入工作流,无需额外训练或复杂提示工程。

行业影响

落地场景

离散扩散语言模型(如 DiffusionGemma-26B)在放射学报告起草中实现了任意顺序填充(any-order infill),允许用户固定部分报告片段后由模型双向补全其余内容,天然适配交互式报告编辑。这一能力可直接嵌入影像工作站或报告系统,辅助放射科医生起草、修订和标准化临床报告。此外,模型在医学视觉问答(VQA)上达到前沿水平,可集成至诊断辅助系统,提供快速、可靠的推理支持。解码速度达 3.5–4.4 倍 于同尺寸自回归模型,适合实时场景。

商业价值

  • 降本:用 LoRA 轻量微调即可获得与大型前沿 VLM 相当的性能,活跃参数仅 3.8B,大幅降低训练与推理硬件开销;解码加速减少 GPU 资源需求。
  • 增效:交互式 infill 让医生直接修改不理想片段,AI 即时补全,减少逐字起草时间,尤其适合报告不一致或简略的真实场景,提升医生吞吐量。
  • 体验提升:双向编辑减少对固定模板的依赖,生成更个性化且连贯的报告,降低因报告质量引发的误读风险。

与现有产品/工作流的接口

  • 作为 web 插件或 API 集成到 PACS/RIS 系统,提供 fill_between 端点,接受影像和用户选定的固定片段,返回完整报告文本。
  • 基于 Gemma 架构,企业可复用现有 MLOps 流程(如 vLLM、HuggingFace 托管),只需加载扩散版权重。
  • LoRA 适配器可快速注入领域知识(如特定科室术语),无需重训全量参数,便于在多机构间定制分发。

具体落地 Use Case

  1. 放射科交互式报告平台:医生在胸部 X 光报告草稿中高亮“肺纹理增多”并修改为“间质性改变”,模型自动重写前后文,确保语法连贯并补充相关发现。该功能可嵌入主流放射科信息系统,缩短单份报告平均编辑时间 40% 以上。
  2. 远程放射学审核服务:基层机构上传影像后,AI 生成预报告;审核专家远程修正关键结论,模型双向扩散自动填充支持性描述,使审核后返回的终稿更完整,将专家介入流程从分钟级压缩到秒级。

局限

  • **评估范围局限**:论文仅依赖 **MedVQA** 数据集和 **LLM judge** 进行自动评分,未在真实放射科工作流程中由临床医师直接评估报告质量。LLM judge 虽声称具 verbosity-robustness,但其评分标准与人类放射科医师的实际偏好(如诊断准确性、表述一致性)可能存在差距,并且自动指标可能忽视报告中关键发现的遗漏或错误表述。
  • **任意顺序填充能力未充分对比**:作者强调 diffusion model 的 **any-order infill** 优势,但在实验中仅定性展示,未与同样支持文本填充的 **AR 微调模型**(如 Gemma 通过特殊提示或训练实现填充)或 **专门填充模型**(BERT-style / 编辑型 LM)进行定量比较。这可能导致其声称的 AR“表现欠佳”缺乏严谨实证支撑。
  • **模型规模与训练效率未深入探讨**:虽然 **DiffusionGemma-26B** 仅需 **3.8B** 活跃参数即可与 **Gemma-4-26B** 匹敌,但扩散模型的 **训练成本**(如去噪步数、数据需求)未作分析。此外,与当前 **frontier vision-language models**(如 GPT-4V、Med-PaLM 2)的比较仅限于 MedVQA 分数,缺乏临床报告起草场景的直接测评,限制了结论在真实应用中的推广性。
论文Max Van Puyvelde2026-07-01原文

相关内容