Scaling Native Multimodal Pre-Training From Scratch
尽管大型语言模型(LLMs)展现出显著的推理能力,但其依赖纯文本预训练限制了其对多模态物理世界的感知。原生多模态预训练 通过在多模态输入上从头训练模型来规避这一限制,从而实现深度跨模态整合,并缓解传统晚期融合架构固有的优化不对称性。尽管有这些优势,该范式的缩放特性尚未得到系统刻画。为弥补这一空白,我们在固定计算预算下研究了训练基于Transformer的视觉-语言模型的最佳模型大小和令牌数量。 我们证明了最小目标损失遵循可预测的计算律,而计算最优的模型大小和令牌数量呈幂律缩放。值得注意的是,语言和多模态目标表现出不同的缩放行为:语言分配律 在很大程度上与数据组成无关,表明无论多模态数据比例如何,语言学习保持稳定;而多模态分配律 对数据组成高度敏感。具体而言,文本密集型混合在更大的模型规模下才变得计算高效,从而将最优资源分配转向更大的模型容量。此外,通过对数据组成对计算律和分配指数的影响进行建模,我们推导出一个效率边界,指定了模型大小、令牌数量和数据混合的精确配置。 下游评估进一步揭示,原生多模态预训练诱导出正跨模态迁移,从而增强了纯文本空间推理能力,并实现了稳健的多模态上下文学习。总之,这项实证研究为可预测地缩放多模态基础模型奠定了必要基础。
论文精读
TL;DR 首次系统刻画原生多模态预训练的扩展律,揭示语言与多模态目标分配差异,并给出数据混合下的三维效率前沿,为高效训练多模态基础模型提供定量指南。
问题
问题背景
随着 GPT、Claude 等纯文本大语言模型(LLM)在推理和生成上取得突破,业界正积极将其感知能力扩展至视觉、语音等多模态世界,以支撑 视觉问答、具身交互 等真实物理场景的应用。
现有方法局限
主流方案采用 后期融合架构(late-fusion):先分别预训练视觉编码器(如 ViT)和语言模型,再通过轻量跨模态适配器(如 Q-Former)进行对齐微调。该范式存在两大根本局限:
- 优化不对称:视觉模块常冻结或采用较小学习率,语言模块主导训练,导致视觉语义无法被充分提取和深化;
- 跨模态整合浅层化:预训练阶段缺乏联合建模,知识存储于分离的参数空间中,难以在深层推理中实现真正的多模态协同。 现有扩展定律(如 Chinchilla 定律)仅刻画纯文本训练,无法指导计算预算下模型规模、数据量及多模态混合比例的联合优化,原生多模态训练的资源配置仍凭经验盲试。
为什么这个问题难且重要
原生多模态预训练从随机初始化开始联合优化视觉与语言目标,输入为混合图文数据。其挑战在于:
- 多目标博弈:语言建模损失(LM loss)与多模态损失(如对比损失)随数据混合比例动态竞争,导致最优分配点呈高维非凸;
- 数据组合灵敏度:文本占比变化会剧烈改变最优模型大小与训练 token 数的幂律指数,例如 文本-heavy 混合在模型较小时可能低效,但突破某个规模后突然成为计算最优,造成“相变”现象。 这使得寻找 模型大小 – 训练 token – 数据混合 的帕累托前沿成为昂贵且必要的系统工程。掌握可预测的扩展律,意味着能用少量小规模实验外推千亿参数模型的配置,极大降低试错成本,对构建下一代多模态基础模型具有基石意义。
行业类比
类似于自动驾驶领域从单独优化感知、规划模块转向端到端一体化训练,需要一套全新的扩展理论来平衡多传感器数据流与联合损失函数,避免资源浪费并保证安全边界。
核心洞察
- 原生多模态预训练的语言目标和多模态目标具有截然不同的缩放行为:语言分配律几乎不受数据组成影响,而多模态分配律对数据组成高度敏感。这一发现挑战了以往 Scaling Law 研究中假设所有目标共享相同缩放模式的简化观点。通过分别对固定计算预算下的损失最小值和最优配置进行幂律拟合,该工作首次量化了两种目标在资源分配上的差异,为多模态模型的训练策略提供了可解释、可预测的差异化准则。
- 数据组成会显著改变多模态目标的计算最优分配指数:在文本占比较高的混合数据中,只有当模型规模达到一定阈值时才能实现计算高效,导致最优配置偏向更大的模型容量。与单纯考虑模型大小或总 token 数的单项缩放研究不同,该工作通过建模数据组成对分配律指数的调制效应,推导出包含模型大小、token 数和数据配比的帕累托效率前沿(efficiency frontier),直接为实际训练中的资源分配提供了精确、可量化的三参数最优配置。
- 原生多模态预训练产生了正向的跨模态迁移:即使在下游纯文本空间推理任务上,联合预训练模型的性能也得到提升,同时多模态上下文学习能力(multimodal in-context learning)显著增强。这打破了“多模态训练会损害纯语言能力”的担忧,表明早期融合视觉信号能实质性地改善模型对空间关系的理解,为设计更通用、跨模态协同的基础模型提供了新的信号融合范例和训练思路。
方法
实验框架设计
研究以 固定计算预算(FLOPs)为前提,训练基于 Transformer 的视觉-语言模型,从零开始进行原生多模态预训练(native multimodal pre-training)。核心目标是寻找给定算力下损失最小的模型规模(参数量)与训练 token 数的配置。
搜索空间与损失函数
扫描变量包括:模型大小、训练 token 量、以及多模态数据混合比例(图文对 vs. 纯文本)。同时跟踪两个损失:
- 语言建模损失(language objective),衡量纯文本预测能力;
- 多模态损失(multimodal objective),可能为图文对比或跨模态生成损失。
通过大量不同配置的训练运行,收集损失-CPU-FLOPs 数据点,拟合幂律缩放定律(power law),并利用 IsoFLOP 估计器(IsoFLOP estimator)等方法解析出计算最优前沿面。
关键发现与效益前沿
实验揭示语言损失对数据组成几乎不变(invariant),而多模态损失高度敏感:文本占比高的混合数据只在模型足够大时才表现出计算效率,迫使资源分配向更大模型容量倾斜。基于此,作者将数据组成作为额外变量纳入缩放方程,推导出包含模型大小、token 数、数据配比三维参数的效率前沿(efficiency frontier),为资源分配提供精确指导。
与同类工作的差异
不同于以往仅针对纯文本 LLM 或后期融合多模态模型的缩放分析,本研究首次量化了原生多模态预训练中计算最优分配的幂律特性,并系统揭示了数据组成对多模态目标缩放轨迹的调控作用,为可预测地扩展多模态基础模型奠定了基础。
实验
实验设计
本工作在固定的总计算预算下,训练基于 Transformer 的视觉-语言模型,系统性地改变模型参数量、训练 token 数以及数据混合比例(图文对与纯文本的比例)。通过分别观测语言损失(如自回归预测)和多模态损失(如图文匹配或描述生成)随计算量的变化,拟合缩放定律 $L = a + b \cdot C^{-c}$,进而推导出计算最优分配策略,并绘制效率前沿,明确模型规模、数据量与数据配比的最优组合。
关键发现
- 可分目标的缩放行为:语言损失遵循稳定可预测的计算律,且其对数据组成的不敏感性意味着无论图文比例如何,语言学习是稳健的;而多模态损失对数据组成高度敏感。
- 数据组成驱动分配偏移:文本占比高的混合数据在更大模型规模下才凸显计算效率,导致最优资源分配向更大模型容量倾斜。相比之下,图文均衡或视觉占优的混合则使多模态损失的最优 token 数增长更快。
- 联合 Pareto 前沿:综合考虑两类损失,模型大小、token 数和数据配比之间存在非线性权衡,论文导出了可指导实际资源配置的效率前沿。
- 正向跨模态迁移:下游评估表明,native 多模态预训练增强了纯文本空间推理能力(例如空间关系问答),并赋予模型鲁棒的多模态 few-shot 上下文学习能力,验证了从零开始联合训练的独特优势。
基线对比解读
传统方法(如 late-fusion)常先训练单模态大模型再拼接,容易引入优化不对称和模态对齐不足。本研究的 native 预训练范式通过共享早期层和端到端联合优化,实现了更深的跨模态融合。与仅靠适配器的方案相比,实验揭示了计算效率的分配定律,并首次量化了数据组成对缩放行为的调节效应。尤其值得关注的是,纯文本语言能力并未因多模态训练而退化,反而获得了正向迁移,这挑战了“多模态训练损害文本性能”的直观假设,为多模态基础模型的规模化训练提供了可靠的理论和工程指导。
行业影响
落地场景
原生多模态预训练(Native Multimodal Pre-Training)从零开始联合训练视觉与语言,避免了传统“先文本后拼接”的优化不对称,可直接应用于需要深度跨模态理解的产品中:
- 智能搜索与推荐:在电商、内容平台中,模型能同时理解商品图片、描述文本与用户评论,提升搜索相关性、多模态相似品推荐。
- 多模态对话与助手:客服系统、虚拟助手能直接分析用户上传的图片+文字问题,给出精准回答,无需分离式图像识别通道。
- 自动驾驶与具身智能:激光雷达、摄像头等传感器数据与自然语言指令的融合训练,可提升复杂场景下的导航决策。
商业价值
论文揭示了计算预算固定下,最优模型规模、训练 token 数与数据配比之间的可预测幂律关系,直接指导资源分配,带来显著商业回报:
- 降本增效:通过计算最优分配法则,可在同等算力下训练出更优模型,或达到目标性能所需算力减少,降低推理延迟与硬件成本。
- 体验提升:纯文本空间推理能力增强(跨模态正迁移),使单纯文本交互产品也能附带更好的空间理解,提升用户体验与粘性。
- 差异化竞争:支持多模态上下文学习(multimodal in-context learning),使模型快速适配新场景,无需微调,降低定制成本。
与现有工作流的接口
原生多模态预训练模型可作为“通用多模态编码器”即插即用到现有基础设施:
- 模型架构:基于 Transformer 的架构与主流 LLM 一致,可直接接入 Hugging Face 生态、vLLM 等推理框架,支持 GPU/TPU 部署。
- 数据管线:要求图文配对数据,但数据配比的动态调整法则(如文本占比高时需更大模型才有效)可直接嵌入已有数据工程流程,指导混合比例设置。
- 下游微调:可输出统一表示接 LoRA/Adapter 层进行任务适配,不影响主线 LLM 服务的更新节奏。
具体落地用例
电商多模态搜索:用户上传“米色亚麻沙发”图片并附文字“带贵妃位”,模型联合理解图片材质、形状与文本约束,返回最匹配商品,转化率提升预计可达 15%+。推荐系统中,多模态相似度计算可直接用该模型的表示层,无需手工特征拼接。
金融文档智能审核:合同、财报等扫描件中的图表、文字及批注常需交叉验证。原生多模态模型可端到端识别“图表数据与文字结论是否矛盾”,自动标注风险点,减少人工审核 70% 时间。其计算最优法则帮助金融机构在限定的推理预算下选择最佳模型规模与数据配比。
局限
- **架构与计算预算的泛化性受限**:论文仅在 Transformer 架构上验证了缩放定律,未覆盖其他主流架构(如卷积网络、混合专家模型)是否遵循相同规律。实验的计算预算范围有限(文中未给出具体上限,但从实验设计推断为中等规模),无法保证在极大(如千亿参数)或极小(如移动端模型)尺度下幂律关系依然成立。此外,固定 FLOPs 约束与真实分布式训练环境(如带宽限制、动态批处理)存在差异,可能影响实用指导价值。
- **数据组成的简化假设**:论文将多模态数据组成建模为有限的几种离散比例(如文本与图像的混合比),未探索更加复杂和动态的数据分布(例如不同模态质量不均、类别不平衡、时序多模态等)。实际预训练中数据组成常根据 Curriculum Learning 动态调整,静态假设可能高估了分配定律的稳定性。另外,合成数据或跨模态数据增强等策略的影响未被纳入考量。
- **下游任务与跨模态迁移的测量有限**:主要结论基于预训练损失函数的缩放,虽然展示了跨模态正迁移现象(提升纯文本空间推理),但没有系统建模下游性能的缩放规律。下游评估任务的选择可能偏向于视觉-语言联合任务,对更广泛的纯文本或纯视觉基准的普适性未充分验证。此外,多模态上下文学习能力的稳健性仅在有限设定下展示,尚需更多任务和更大规模下的验证。