走向 Native Multimodal Modeling:路线图
多模态建模是从模态无关推理走向世界建模的关键一步。早期方法主要依赖晚期融合,将编码器和冻结的语言骨干与输出头组装起来;近期工作则转向原生多模态建模(Native Multimodal Modeling, NMM),通过内在的模态集成实现更优的多模态性能。然而,原生架构的设计空间仍缺乏明确定义。 本文为社区形式化地提出了这一转型的路线图。首先,我们正式定义了架构原生性,区分了中期融合和早期融合与非原生范式。进而通过输入-输出对偶性将现有原生模型组织为三类: 1. 多到文本(Multi-to-Text):跨模态理解,仅输出文本; 2. 多到目标(Multi-to-Target):面向场景的生成(如图像、音频、视频生成); 3. 多到多(Multi-to-Multi):对称输入-输出下的统一建模。 我们从工业视角系统剖析了端到端管线,涵盖架构协调、大规模数据整理、全栈训练方案、推理与部署,以及面向真正原生模型的综合评估,最终指向理解与生成在统一Transformer范式中无缝共存的NMM框架。
论文精读
TL;DR 该路线图形式化定义了原生多模态建模的“架构原生性”,按输入-输出对偶性分类并深入剖析现有模型,提供从架构、数据、训练到推理部署的全栈工业级路线图,指明理解与生成统一的终极范式。
问题
问题背景
多模态建模正从晚期融合 (late-fusion) 向原生多模态 (native multimodal) 范式演进,旨在将理解与生成集成于统一 Transformer 骨架中,支撑更自然的人机交互与通用智能。
现有方法局限
- 晚期融合 独立预训练各模态编码器,通过轻量桥接模块与冻结语言模型连接,模态间交互浅层化,难以胜任复杂跨模态推理与对齐。
- 非原生架构 缺乏对融合深度的形式化定义,设计空间碎片化;早期融合虽能提升协同性,但面临模态异构 (heterogeneity) 导致的优化不稳定与计算爆炸。
- 工业落地缺乏全栈最佳实践:从多模态数据混合 (data mixture)、联合训练 (joint pretraining/SFT/RL) 到推理时 token 压缩 (visual resampling) 与实时流式部署 (real-time streaming),缺少系统化指南。
技术挑战与重要性
- 架构对称性:如何通过输入输出对偶性 (input-output duality) 统一 Multi-to-Text、Multi-to-Target 与 Multi-to-Multi 三类任务,是原生模型收敛的核心难题。
- 优化困境:跨模态梯度冲突、序列长度爆炸(如视频生成)、生成-理解权衡 (comprehension-generation dilemma) 需在训练目标与策略上协同突破。
- 业界迫切性:原生模型可消除多阶段流水线,减少组件冗余,若成功将显著降低维护成本并提升性能上限,因而吸引密集研发投入。
行业类比
如同 Transformer 将 NLP 任务统一为序列到序列范式,原生多模态模型正试图成为视觉、语音、文本的统一骨干,为下一代世界模型与通用助理提供基础设施。
核心洞察
- 1. 首次为多模态融合提出了清晰的原生性(nativity)谱系,将 mid-fusion 和 early-fusion 与 late-fusion 等非原生范式明确区分。以往研究多聚焦在 late-fusion 或零散尝试 early-fusion,缺乏统一标尺来衡量融合深度,而本论文的形式化定义填补了这一空白,使工程团队能根据任务需求系统性地选择架构融合策略,而非盲目跟随基准。
- 2. 通过输入-输出对偶性将现有模型分为 M2T、M2G 和 M2M 三类,不仅勾勒出从理解到生成再到统一建模的演进路径,更揭示了 M2M 必须解决的根本冲突:离散化所有模态的同时保持其特异性。这解释了为何当前统一模型普遍面临理解与生成能力相互制衡的困境,为未来设计全模态架构提供了明确的攻关方向,具有工业级指导价值。
方法
该方法提出原生多模态建模路线图,核心是按融合层级与输入-输出对称性递进设计。
输入:多模态数据(文本、图像、音频、视频)以 token 序列或隐表示形式流入,支持任意组合。
关键模块:
- 架构分类:根据输入-输出对偶性分为三类——
- Multi-to-Text (M2T):编码器将多模态输入压缩为文本输出,用于跨模态理解;
- Multi-to-Target (M2G):针对图像、音频、视频等场景化生成,输入可为多模态,输出特定模态;
- Multi-to-Multi (M2M):对称统一模型,保持模态特性同时以统一 Transformer 完成理解与生成。
- 融合层级:定义 mid-fusion(在中间层交叉模态)与 early-fusion(从输入层即混合模态)的原生性,区别于仅输出头拼接的 late-fusion。
- 训练流程:预训练(PT)→ 监督微调(SFT)→ 强化学习(RL)→ 在线策略蒸馏(OPD),每个阶段针对不同融合深度调整数据混合与损失函数。例如 early-fusion PT 需联合优化跨模态对齐,RL 阶段处理生成模态的奖励建模。
- 推理优化:通过 token 压缩、动态分辨率、MoE 路由、增量解码、全双工状态管理等解决长序列、异构计算和实时流式挑战。
输出:M2T 产生文本,M2G 产生目标模态,M2M 可对称输出任意模态,最终实现一个统一 Transformer 范式内理解与生成共存。
差异点:与传统的 late-fusion 组装式模型不同,该路线图主张通过 early/mid-fusion 实现模态的内在整合,并以 M2M 对称架构为目标,突破理解与生成分离的局限。
实验
本文作为路线图,未进行独立实验,而是系统梳理了原生多模态建模领域的关键实验设计与结果。从模型架构角度,对比了late-fusion、mid-fusion和early-fusion三种融合策略在不同任务上的表现,并详细分析了M2T(多模态理解)、M2G(场景生成)和M2M(对称统一建模)三类模型的各自挑战与优化方向。训练流程方面,综述了从预训练到SFT、RL、OPD的多阶段实验方案。推理部署部分探讨了序列爆炸、异构性应对等实际工程问题。评估体系覆盖图像、音频、视频的理解与生成基准。
关键发现:现有实验表明,mid-fusion和early-fusion显著优于传统late-fusion,尤其在跨模态细粒度对齐任务上;但原生融合带来了序列长度暴增和计算开销,需借助token压缩和MoE等工程手段缓解。M2M统一模型虽理想,但在完全离散化与模态特性保留间存在妥协,常面临理解-生成权衡问题。数据质量与配比、多阶段训练策略对最终性能影响巨大。
相较于早期依赖冻结语言骨架和独立编码器的非原生模型,原生模型在架构对称性和模态间信息流通度上具备本质优势。Mid-fusion通过部分共享权重,在效率与性能间取得平衡;Early-fusion则追求极致统一,但计算代价高。综述指出,当前尚无一种范式全面胜出,未来需在架构收敛、数据自生成和训练联合优化上持续突破。
行业影响
落地场景
原生多模态建模 (NMM) 可直接赋能对理解与生成一体化要求高的产品。M2T 能力用于智能视频分析、跨模态检索;M2G 支撑 AI 驱动的图像/音频/视频内容生产;M2M 的对称统一架构是构建下一代全双工虚拟助手、跨模态搜索引擎的核心。典型应用包括:
- 内容平台:视频理解 + 实时互动问答 + 智能剪辑生成
- 电商:商品多模态描述、基于草图+语音的个性化内容生成
- 企业服务:多模态文档解析、会议纪要生成与后续动作触发
- 自动驾驶:多传感器融合的场景理解与预测
商业价值
NMM 的核心价值在于降低多模态系统的工程复杂度与成本,同时提升交互体验。
- 降本:统一 Transformer 架构替代传统的编码器-解码器分离方案,减少模型数量与维护成本;早期融合与离散 token 化可显著降低推理延迟(通过 token 压缩、动态分辨率等),节省算力。
- 增收:更流畅、拟人的全双工交互可直接提高用户停留时长与转化率;内容生产自动化为营销、运营提供规模化素材。
- 体验突破:理解与生成能力在单一模型中协同,使系统能边听边想边回应,逼近人类交流的自然感。
与现有工作流的集成
NMM 可以渐进式嵌入现有技术栈:
- 对于已有基于 LLM 的应用,可先以 mid-fusion 方式插入 NMM 视觉/音频编码器,逐步替换拼接式 late-fusion 管线。
- 推理部署兼容现有服务框架,论文提及的离散 token 化、MoE 路由、动态 bitrate 控制可直接与 Hugging Face TGI、vLLM 等推理引擎结合。
- 训练数据方面,可利用现有数据集混合新生成的交互式数据,通过分阶段预训练、SFT 与 RL 平滑迁移。
具体用例
电商直播智能助手
用户通过实时语音或文字询问商品细节,模型同步理解直播视频流和音频,直接生成自然的语音回答,并叠加 AR 试穿效果。这需要 M2M 的全双工能力和 M2G 的画面生成,降低人工客服压力,提升转化。在线教育个性化内容生成
学生上传手绘草图或题目照片,模型立即理解并生成解题动画视频(包含语音讲解)。利用 M2G 的物理世界理解和可控生成,实现从静态图片到动态多模态教程的实时转换,提升教学互动性。
局限
- **缺乏定量实验与基准验证**。本文定位为路线图综述,系统梳理了原生多模态建模的定义、分类和技术栈,但未提出新模型或进行实验对比。所有架构分析、训练方案和部署建议均基于已有工作的归纳,缺少端到端的量化验证,无法直接证明所倡导的早期融合或对称 M2M 架构在规模化下的实际收益。
- **定义与分类存在争议**。文中将**原生性 (nativity)** 按融合阶段划分为 late/mid/early fusion,并沿用多到文本 (M2T)、多到目标 (M2G)、多到多 (M2M) 的分类,但这些界线在实际模型中往往模糊,部分模型(如多模态 LLM 的中间融合)难以严格归类。此外,“统一的理解与生成共生体”这一愿景在现有技术下仍面临表征冲突和推理延迟等根本挑战,路线图中未充分讨论这些理论障碍。
- **工程视角深度不均**。虽覆盖从数据到部署的全链条,但对各环节的工程挑战(如大规模预训练中的模态平衡、流式推理的时延约束、混合量化对融合精度的折损)仅点到为止,未能给出可操作的调优准则或伪代码级指引,对一线工程师的直接参考价值有限。同时,大量引用工作集中在 2023-2024 年,未能充分囊括同期新兴的基于状态空间模型的融合方案,时效性正在快速衰减。