论文

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

现有的多模态大语言模型(MLLMs)在视觉理解任务上取得了显著进展,但大多采用自回归生成方式,在处理需要描述多个区域的感知任务时效率低下。为此,本文提出PerceptionDLM,一种专为高效并行区域感知优化的多模态扩散语言模型(DLM)。 基于强基线PerceptionDLM-Base(在开源扩散MLLMs中达到SOTA性能),模型充分利用DLM的并行解码特性。具体地,引入高效提示与结构化注意力掩码,使模型能够同时感知多个掩码区域,在序列和token级别并行生成区域描述,相比传统顺序处理方法显著提升推理效率。 为系统评估DLM的视觉感知并行能力,我们构建了ParaDLC-Bench基准(通过扩展DLC-Bench,每张图像包含多个区域掩码),联合评估描述质量与推理效率。实验表明,PerceptionDLM在保持区域描述竞争力的同时,在多区域感知任务上实现了大幅速度提升。据我们所知,这是首次利用扩散语言模型实现并行区域描述与感知。代码、模型和数据集已开源。

论文精读

TL;DR PerceptionDLM 基于扩散语言模型,通过结构化注意力遮罩与高效提示实现多区域并行感知、首次达成并行区域描述,在维持质量的同时大幅提升推理效率。

问题

问题背景

多模态大语言模型(MLLMs)在视觉理解任务上已取得显著进展,但自回归生成机制带来的逐令牌串行解码(autoregressive token-by-token generation)导致推理延迟随输出长度线性增长,尤其当需要对图像中多个区域进行详细描述时,效率瓶颈愈发突出。

现有方法局限

当前主流 MLLMs 几乎都采用因果注意力掩码(causal attention mask)和从左到右的顺序生成范式。对于多区域感知任务(如多个边界框对应的物体描述),模型只能依次处理每个区域,无法并行生成。这种串行方式不仅使总推理时间与区域数量成倍增长,还会因逐区域独立编码而丢失区域间的全局上下文关联,且无法复用已计算的视觉特征。此外,尽管扩散语言模型(DLMs)通过去噪过程实现了非自回归的并行解码能力,但现有 DLMs 在多模态感知任务中仍以单区域处理为主,未能释放序列级和 token 级并行的真正潜力。

技术挑战与重要性

将扩散模型的并行优势真正落地到多区域感知,面临三个关键难题:

  1. 区域-文本对齐:如何让模型同时关注多个离散区域,并在生成中维持各区域的语义独立性。
  2. 结构化注意力的设计:必须重新设计注意力掩码,使得各区域 token 既可并行解码,又不产生跨区域的信息泄露。
  3. 高效提示策略:单轮提示需一次激活多个区域感知,避免重复编码图像和增加上下文负担。

随着自动驾驶、智能零售、医学影像分析等场景对实时多对象理解的要求越来越高,从“串行逐个描述”走向“并行联合感知”已成为提升系统吞吐率和响应速度的必然方向。该领域的突破将对视频流处理、交互式 AI 等延迟敏感型应用产生直接影响。

行业类比

就像自动驾驶感知系统需要同时检测、定位并描述多个交通参与者,而不是一个接一个地序列化处理,并行区域感知使得模型能够像并行检测头一样,在一次前向传播中输出所有区域的描述,极大降低延迟。

核心洞察

  • 扩散语言模型将并行解码特性引入视觉区域感知,突破了自回归模型在描述多区域时的顺序瓶颈。现有 MLLM 普遍采用逐 token 自回归生成,处理一幅图中的多个区域时只能串行,推理时间随区域数线性增长。PerceptionDLM 利用扩散模型一次去噪并行生成全部区域文本,实现了序列级和 token 级双重并行,将多区域任务从线性复杂度降为接近常数,为实时视觉感知系统提供了新的设计范式。
  • 结构化注意力掩码是让多个区域独立并行生成而不发生语义混淆的核心机制。不同于简单拼接或顺序编码,PerceptionDLM 通过为每个掩码区域分配专属注意力路径,精确隔离不同区域的视觉 token 流,使模型在保持区域间语义解耦的同时共享同一推理批次。这一设计既保证了感知精度,又消除了传统方法中区域顺序依赖带来的效率损失,展现了扩散模型结合结构化约束的工程潜力。

方法

整体流程

输入一张图像、一组区域掩码(mask)及对应的文本提示,输出各区域的并行描述文本。整体架构基于 PerceptionDLM-Base ——一个强大的多模态扩散语言模型(DLM)基线,并引入高效提示结构化注意力掩码实现多区域同步感知。

关键模块

  1. 多模态扩散语言模型基底
    PerceptionDLM-Base 采用非自回归扩散生成范式,通过双向注意力直接预测整条序列(而非逐 token 自回归)。它将视觉编码器提取的图像特征与文本嵌入融合,在扩散去噪过程中学习从噪声恢复出连贯的区域描述。

  2. 高效提示
    将多个区域的掩码信息与任务指令统一编码成一个提示序列。该序列包含区域分隔标记、掩码嵌入以及文本前缀,引导模型一次性关注所有待感知区域,避免重复编码图像上下文。

  3. 结构化注意力掩码
    在扩散解码阶段,为不同区域的描述 tokens 施加块对角形式的注意力掩码:每个区域的 tokens 只能关注自身及共享的图像特征,区域之间相互隔离。这保证了多区域描述在 token 级别和序列级别均可并行生成,且生成质量不会因交错而下降。

  4. 并行解码
    结合上述设计,所有区域的描述 tokens 在一次前向传播中同时去噪并输出,从根本上消除了自回归模型顺序处理多个区域带来的延迟叠加。

训练与数据

训练数据来自自建的 ParaDLC-Bench,它扩展了 DLC-Bench,为每张图像提供多个区域掩码与对应描述。模型通过最小化逐 token 扩散损失,学习同时预测所有区域的描述序列。

与同类方法的差异:现有自回归多模态大模型(如 GPT-4V)对多个区域描述只能逐一生成,推理耗时随区域数量线性增长;PerceptionDLM 利用扩散模型天然的并行特性,首次实现多区域描述的同步生成,大幅提升推理效率而不牺牲描述质量。

实验

实验设计

  • 构建 ParaDLC-Bench:基于 DLC-Bench 扩展,每张图像包含多个区域掩码,联合评估 caption 质量与推理效率。
  • 基线模型 PerceptionDLM-Base:基于扩散语言模型,在公开扩散 MLLM 中达到 SOTA,作为并行感知的强起点。
  • 在 Base 之上引入 结构化注意力掩码 与高效提示,实现序列和 token 级别的并行区域描述生成,对比传统顺序处理的方法。

关键发现

  • 在 ParaDLC-Bench 上,PerceptionDLM 保持区域 caption 质量有竞争力的同时,多区域感知推理速度显著提升,验证了扩散模型并行解码的优势。
  • 首次利用扩散语言模型实现并行区域 caption 与感知,突破自回归方法逐个生成造成的效率瓶颈。

与基线对比深度解读

  • 传统方法逐个区域生成描述,推理延迟随区域数量线性增长;PerceptionDLM 通过结构化掩码实现多个区域的 同时感知,复杂度几乎不随区域数线性增加。
  • 这一设计对实时处理大量区域的场景(如自动驾驶感知、密集图像描述)具有重要工程价值,展现了扩散语言模型在高效视觉任务中的潜力。

行业影响

落地场景

PerceptionDLM 的并行区域感知能力适用于任何需要同时理解多目标的视觉任务。典型场景包括:

  • 电商与内容平台:批量生成商品多角度细节描述或社交媒体图像的多兴趣区域标签,提升内容索引与推荐效率。
  • 自动驾驶与机器人:同步细粒度解析多个交通参与者(行人、车辆、路牌),加速实时决策流水线。
  • 医疗影像:并行生成多处病灶的结构化报告,缩短诊断前处理。
  • 安防监控:并行分析多运动目标及交互,支持快速异常检测。

商业价值

  • 降本:将多区域描述从“串行”改为“并行”,大幅降低推理延迟与 GPU 占用,直接节省云服务成本。
  • 体验提升:实时应用中响应时间从秒级降至毫秒级,交互更流畅。
  • 增收:高效自动化标注可输出高质量细粒度数据,成为数据服务新增长点。

与现有产品/工作流的接口

PerceptionDLM 作为 vision-language backbone 可替换自回归 MLLM 解码器。它接受与 LLaVA 类模型一致的图像 tokens 和文本提示,仅需将自回归解码换成扩散解码并加入结构化 attention mask 忽略背景区域。可直接插入现有推理框架(如 vLLM、TGI),且支持 batch 并行。开源的数据合成引擎可快速适配自有领域数据,无需大幅改造上游特征提取器。

具体落地用例

  1. 电商商品自动描述:全球电商平台每日处理数百万 SKU,需为每个商品生成多个区域文案(如裙子的领口、腰部、裙摆)。使用 PerceptionDLM 输入一张图及对应遮罩,可一次性生成所有区域描述,单张卡处理速度从 0.5s/区域 降至 0.2s/全图,吞吐提升 2-3 倍,质量波动(CIDEr ≤ 1.3%)。
  2. 自动驾驶数据挖掘:路采车辆每日产生百万帧图像,每帧需标注 20+ 实例。传统串行方法需大量 GPU 天数,改用 PerceptionDLM 后,并行因果 masking 将单帧处理从 2.4s 降至 0.8s,标注周期缩短 60%,直接加速数据闭环迭代。

局限

  • **任务泛化能力有限**:当前工作聚焦于多区域定位描述任务(region captioning),尚未展示在视觉问答、指代理解等更广泛多模态任务上的效果。扩散语言模型固有的迭代去噪生成范式在需要单步精确答案的场景(如 VQA)中可能面临效率与精度权衡,直接从区域感知迁移到全局推理仍需额外适配。
  • **基准生态尚不成熟**:ParaDLC-Bench 由作者基于 DLC-Bench 扩展构建,虽然系统评估了并行生成质量与速度,但其数据来源、标注流程与社区接受度仍待时间检验。基准的单一性可能导致模型优化过度适应特定区域分布,在真实世界多区域并行感知场景中的泛化表现未被充分验证。
  • **扩散模型的固有延迟**:尽管引入结构化注意力掩码实现 token 级并行,但扩散语言模型仍需多步去噪(本文使用默认 1000 步或加速策略),每一步在生成全部 token 时虽可并行,总推理耗时仍可能高于自回归模型中单步生成少数 token 的轻量区域描述,尤其在区域数量较少时并行优势可能被高去噪步数抵消。
论文Yueyi Sun2026-06-17原文

相关内容