论文

Multimodal Flow: 嵌入空间中语言与视觉的统一流建模

Multimodal Flow: 嵌入空间中语言与视觉的统一流建模

现有统一多模态模型多走两条路线:一是把语言与量化图像都当作离散 token 建模,二是以离散语言预测搭配连续图像生成。前者引入视觉量化瓶颈,后者需模态相关的目标函数与采样流程。全连续建模 虽能规避这些取舍、共享同一生成过程,但在多模态预训练中仍少有探索。 Multimodal Flow 提出统一的连续架构,把多模态连续表示与共享的 chunk-causal flow 主干结合:文本块与图像被组织为有序的连续 hyperchunk,既保留文本 token 顺序,也保留视觉空间结构。主干通过 Flow Matching 在这些 hyperchunk 上学习单一向量场,联合注意力负责跨模态交互,模态专属前馈网络分别处理各模态。训练时并行预测多个目标 chunk,推理时按序生成 hyperchunk。 研究团队实例化 MF-1 并在多模态数据上预训练:在 0.6B、1.2B、1.6B 三个规模上,继续预训练均稳定提升多模态建模能力。仅用 150B 预训练 token,MF-1 在 GenEval 与 DPG-Bench 上平均得分 82.8,在 VQAv2、MMBench 与 POPE 上平均 75.3,与用数据量远超的统一模型相比仍具竞争力;在数据、优化与参数预算匹配时,还优于代表性的混合与离散模型。 这些结果确立了连续 chunk 嵌入流建模,作为统一多模态建模的全新全连续范式。相关代码与模型已开源于 https://github.com/hustvl/Multimodal-Flow 。

论文精读

TL;DR Multimodal Flow 用流匹配在连续嵌入空间对文本和图像块统一建模,消除了视觉离散量化瓶颈,使语言和视觉共享同一生成过程。

问题

问题背景

统一多模态生成模型的核心目标是:用单一架构与单一训练目标同时处理语言和视觉,避免为每个模态单独维护推理管线。

现有方法的局限

  • 离散 token 统一建模:将图像量化为离散 token 与文本联合预测,但视觉量化会损失连续细节,码本容量也限制表达能力,形成明显的视觉瓶颈。
  • 混合离散-连续模型:语言采用离散交叉熵,图像采用扩散或流匹配连续目标,导致训练需要模态依赖的 loss 与采样过程,推理时也要维护两套逻辑,无法共享同一个生成范式。

这些方案要么牺牲视觉质量,要么破坏统一目标函数,在工程实现与模型扩展性上引入额外复杂度。

为什么这个问题难且重要

连续空间中的统一多模态建模需要同时满足:

  1. 保留文本 token 顺序与图像 2D 空间结构,不能简单展平;
  2. 让同一 backbone 学习跨模态交互,同时允许模态特定的计算;
  3. 用一个连续目标(如 Flow Matching)训练,并能在推理中一致地生成两种模态。

业界高度关注统一范式的数据效率与可扩展性——如果连续建模能在匹配数据与参数预算下超越混合/离散方案,就有机会成为新一代多模态基座模型的默认选择。

行业类比

类似视频生成中把文本 prompt 与视频 latent 都放进同一个连续 diffusion/flow 框架,而不是文本编码器 + 图像解码器分离,能显著降低特征不对齐与管线维护成本。

核心洞察

  • 完全连续的统一生成目标消除了多模态模型中的离散-连续割裂,使得语言和图像共享同一个 Flow Matching 向量场。与 Transfusion 等混合目标模型不同,Multimodal Flow 不需要分别设计图像扩散损失和语言交叉熵损失,也不需要维护文本解码器和图像解码器两套采样过程。这显著简化了训练和推理框架,同时避免了视觉 token 量化带来的信息损失。
  • 将多模态序列组织为有序的连续 hyperchunks,并通过 chunk-causal flow 实现统一顺序建模,在保留文本 token 顺序与图像空间结构的同时支持训练并行。相比因果 Transformer 逐 token 自回归,该方法以 chunk 为粒度进行因果遮蔽和并行预测,降低了训练复杂度,且推理时可顺序生成 chunk。这种设计与视觉 patch 的自然局部性相契合,可能带来更稳定的生成质量。

方法

输入表示

Multimodal Flow 将文本与图像统一表示为有序连续 hyperchunk 序列。文本按 token 顺序切分为 block,图像按空间结构切分为 patch block,每个 block 编码为连续嵌入向量,不再使用离散 token。文本与视觉编码器分别输出连续表示,并加入位置信息以保持顺序和空间结构。

关键模块

核心是共享的 chunk-causal flow backbone。所有 hyperchunk 进入同一骨干网络,通过 Joint attention 实现跨模态交互,而 modality-specific feed-forward network(FFN)在每层内处理各自模态。训练采用 Flow Matching 目标:在连续嵌入空间中学习从噪声到真实 hyperchunk 的单一向量场,无需为文本/图像分别设计 loss。训练时利用 parallel flow matching 同时预测多个目标 chunk,提升效率;序列并行时保持 chunk-causal 掩码,限制每个 chunk 只能看到之前 chunk。

推理采用 Sequential chunk inference:从起始噪声出发,按 chunk 顺序逐步生成连续嵌入,最终由模态特定解码器还原为文本或图像。

输出与差异

模型输出为连续嵌入,经解码得到文本序列或图像。与离散 token 模型(如 VQ-VAE 量化图像)和混合模型(离散文本 + 连续图像)相比,Multimodal Flow 完全在连续空间内建模两种模态,共享同一个流匹配过程和生成范式,避免了视觉量化瓶颈和模态依赖的多目标训练。

实验

实验设计

Multimodal Flow 在 0.6B/1.2B/1.6B 三个规模上进行持续预训练,使用 150B tokens 多模态数据。评估覆盖多模态理解(VQAv2, MMBench, POPE)与图像生成(GenEval, DPG-Bench)。对比了离散 token、混合离散-连续、以及本文的全连续 chunk-based flow 三类范式,并在匹配数据、优化与参数预算下进行控制实验。

关键发现

全连续的 chunk-causal flow 能统一语言视觉生成,消除了视觉量化瓶颈与模态特定目标。随着容量增加,多模态性能稳步提升。150B tokens 预训练下,MF-1 取得 82.8(GenEval/DPG-Bench)与 75.3(VQAv2/MMBench/POPE)的平均分,表现与用更多数据训练的统一模型竞争。在严格预算匹配下,Multimodal Flow 优于代表性混合模型和离散模型,验证了连续范式的有效性。

基线对比解读

离散模型受视觉 tokenization 限制,混合模型需处理双目标与采样流程;Multimodal Flow 通过单一流匹配目标消除差异,并借助共享 chunk-causal backbone 提升数据效率。尽管预训练数据量大幅减少,性能仍接近更大型统一模型,表明 embedding space flow modeling 是一种高效的统一多模态路径。

行业影响

落地场景

Multimodal Flow 的全连续生成范式可应用于需要同时产出文本与图像的业务,如电商商品描述与视觉素材生成、内容平台的图文自动创作、教育领域的互动教材生成等。它统一了语言和视觉的生成过程,避免了离散 token 的量化损失和混合模型的双目标复杂度,能直接生成更连贯的多模态内容。

商业价值

  • 降本:单一连续目标与共享 backbone 简化了训练和推理流程,减少模态特定模块的开发和维护成本;
  • 增收:更高质量的图文生成能力可提升广告创意、商品展示的点击转化率,带来直接营收增长;
  • 体验提升:顺畅的多模态交互(如文本引导图像生成、图像自动描述)改善用户满意度,尤其是在 AR/VR 或实时内容生成场景。

与现有产品/工作流的接口

该模型可作为预训练 backbone 嵌入现有多模态 stack,替换离散 token 的 VQ-VAE 或混合架构中的语言模型部分。通过 flow matching 训练,它能与 diffusion 类图像生成管线自然衔接;其 chunk-causal 结构支持对文本和图像块进行统一的序列化推理,便于集成到自回归生成框架或作为 encoder-decoder 的中间表示。项目已公开代码和模型(GitHub),便于快速微调。

具体落地 use case

  1. 电商产品发布自动化:输入商品属性(材质、尺寸、颜色),模型同时生成产品描述和逼真展示图,替代人工美工和文案,缩短上架周期。
  2. 医疗报告生成:根据 CT 或 MRI 影像,生成结构化的诊断描述和可视化标注,辅助医生快速撰写报告,减少重复劳动。与现有医疗影像分析系统集成时,可直接使用其连续 embedding,避免离散令牌的信息损失。

局限

  • **推理效率瓶颈**:Flow Matching 需要多步 ODE 求解来生成连续 hyperchunk,相比离散自回归模型的单步 next-token 预测,推理延迟显著更高。论文未报告生成速度或与离散模型的延迟对比,但连续变量积分(如 Euler 100 步)在相同硬件下通常慢 1-2 个数量级。这对实时交互场景(如对话式多模态助手)不友好,工程落地需依赖蒸馏或更高效的采样器,而这类优化在连续流模型上尚不成熟。
  • **连续表示与离散操作不兼容**:视觉采用 VAE 连续 latent 虽避免了量化误差,但丢失了离散 token 的拓扑结构,导致无法直接应用 temperature 调节、top-k/top-p 采样等成熟的离散生成控制手段,多样性控制更困难。同时,下游任务(如 VQA)需要额外的解码器将连续表示映射为答案,增加了适配成本。与 Chameleon 等离散模型相比,在纯文本生成和指令跟随任务上可能缺乏优势,论文也未深入探讨连续空间中文本生成的退化问题。
  • **规模扩展性未充分验证**:实验仅覆盖 0.6B–1.6B 参数和 150B pretraining tokens,虽然结果 competitive,但相比 Chameleon 的 4T tokens、Transfusion 的 2T tokens 仍有数量级差距。连续 chunk 序列长度远大于离散 token 序列,导致注意力计算复杂度更高,可能限制更大规模的训练效率。此外,共享向量场对文本和图像的统一建模是否会在某一模态上产生负迁移,论文未做消融分析。
论文Hongyuan Tao2026-09-30原文

相关内容