我们离移除视觉编码器还有多远?无编码器多模态预训练的 Scaling Laws
当前大多数 multimodal large language models(MLLMs)都建立在预训练视觉编码器之上,以获取强视觉先验;encoder-free MLLMs 则直接从原始像素学习视觉表示,架构简单统一,但其 scaling 行为尚未被系统刻画。为填补这一空白,本文对比了 encoder-free 与 encoder-based MLLMs 的 scaling laws。 主要发现有三点: 1. 移除视觉编码器后,多模态目标的计算最优分配会转向更大的模型,而文本目标的分配几乎不变。 2. 两种架构在文本目标上的 loss-compute frontier 几乎重合,但在多模态目标上出现分化:encoder-free 模型在小规模下表现更差,但预计在约 10^{22} FLOPs 处追平,这仍在实际预训练预算范围内。 3. 没有视觉编码器时,语言模型会通过视觉特化的适配 接管其角色:视觉 token 间的双向交互随训练算力增长而愈发有益,视觉处理前移至更早的层,视觉 token 的 expert routing 也更集中。 总体而言,预训练编码器所提供的视觉先验优势随规模增大而减弱,使 encoder-free 架构成为多模态预训练的一个有前景的方向。
论文精读
TL;DR encoder-free 多模态预训练 scaling laws 显示:视觉编码器优势随规模递减,10^22 FLOPs 时追平 encoder-based。
问题
当前多模态大模型(MLLM)普遍依赖预训练视觉编码器(如 CLIP、SigLIP)提供视觉先验,但编码器-解码器混合架构的扩展规律仍不清晰。
现有方法局限
- 编码器依赖型 MLLM 需单独预训练视觉骨干,再与 LLM 对齐,引入额外参数与训练阶段;视觉编码器在纯视觉任务上预训练,可能与多模态指令跟随目标存在偏差,且视觉前向计算开销常被低估。
- 无编码器 架构虽统一、简洁,但小规模下多模态损失明显落后于编码器方案,此前缺乏系统 scaling law 证据,使从业者难以判断是否值得投入。
为什么难/重要
多模态 pretraining 同时优化文本与多模态目标,视觉先验的收益随计算量变化并非单调;无编码器架构需要语言模型内部重新组织视觉计算(双向 token 交互、层级前移、专家路由集中),这要求大规模实验与精细计算 accounting。该工作揭示无编码器模型在约 1e22 FLOPs 处追平编码器方案,处于实际预训练预算内,直接影响架构选型。
行业类比
类似 LLM 从 encoder-decoder 收敛到 decoder-only:简化架构在超大规模下才充分释放潜力,但需要 scaling law 来提前定位拐点。
核心洞察
- - 首次将 scaling laws 系统扩展到 encoder-free MLLMs,并预测其在约 10^22 FLOPs 的实用预算内追平 encoder-based 架构。与以往仅在小规模或特定任务上评估 encoder-free 模型的工作不同,本文通过 compute-optimal allocation 和 loss-compute 前沿分析,给出了量化的交叉点,为架构选择提供了数据驱动的决策依据。
- - 揭示了没有视觉编码器时,语言模型会通过 vision-specific adaptation 内生地接管视觉编码功能,包括视觉 token 双向交互增强、视觉处理前移、专家路由集中。这一发现从机制层面解释了 encoder-free 架构可行的原因,挑战了“必须依赖预训练视觉编码器提供强视觉先验”的假设,并为后续设计更高效的统一多模态架构提供了洞察。
方法
方法概览
论文通过大规模 scaling law 分析,系统比较 encoder-free 与 encoder-based 多模态大模型的训练效率与架构差异。
输入:同一套图文预训练数据集,两种模型架构。
关键模块:
- 模型阶梯 (model ladder):训练一系列不同参数量(从数千万到数十亿)的模型,覆盖多个数量级的计算预算。encoder-free 模型直接将图像切分为视觉 token 输入 decoder-only LLM;encoder-based 模型使用预训练视觉编码器(如 ViT)提取特征后再投影到 LLM。
- 计算账本 (compute accounting):统一记录训练消耗的总 FLOPs,包括视觉编码器、投影层和 LLM 的全部计算,确保两种架构在同一计算尺度下比较。
- scaling law 拟合:对每个模型,用幂律函数拟合验证损失与总计算量的关系,估计不可约损失与缩放指数。采用 IsoFLOP 曲线或参数化方法估计 compute-optimal 配置。
- 效率增益 (efficiency gain):在相同计算预算下,比较两种架构的最小可能损失,计算相对效率差异,并外推至更大规模。
- 探针分析:在 decoder 各层插入线性探针,观察视觉表示的形成与迁移,分析视觉处理在无编码器时如何转移到 LLM 内部。
输出:损失-计算前沿曲线、compute-optimal 参数分配、架构效率交叉点(约 10^{22} FLOPs),以及 decoder 内部视觉处理机制的演变规律。
与同类方法的差异:不同于以往只比较特定规模模型的性能,本文首次为 encoder-free 与 encoder-based 多模态预训练建立完整的 scaling laws,从计算最优视角量化架构差距随规模缩小的趋势。
实验
实验设计
作者构建了 encoder-free 与 encoder-based 多模态大语言模型的模型阶梯,在相同计算预算下拟合 scaling laws,比较两种架构在纯文本与多模态目标上的计算最优分配和 loss–compute 前沿。通过 FLOPs 精确计账与 IsoFLOP 曲线分析,系统评估移除视觉编码器的影响。
关键发现
- 移除视觉编码器使多模态目标的计算最优分配明显偏向更大的语言模型,而纯文本目标几乎不变。
- 两种架构在纯文本目标上的 loss–compute 前沿几乎重叠,但在多模态目标上,encoder-free 模型在小尺度差距明显,预测在约 10^22 FLOPs 时追上 encoder-based 模型,该算力在当前预训练预算内。
- 无视觉编码器时,语言模型自发地承担视觉编码职能:视觉 token 间的双向交互随算力增长变得更重要,视觉处理迁移至更早层,视觉 token 的专家路由更集中。
与基线对比解读
encoder-free 架构在文本能力上不输 encoder-based,说明视觉编码器提供的先验主要影响多模态表征学习,且其优势随规模递减。这一发现提示在大规模预训练场景下,可以省略独立的视觉编码器,从而简化架构、减少工程复杂度并降低推理延迟。对于实际工程,这为统一的多模态模型设计提供了 scaling law 依据,但需要注意小规模实验可能低估 encoder-free 方案的潜力。
行业影响
落地场景
Encoder-free 多模态大模型 取消独立视觉编码器后,可直接用于低延迟、高吞吐的多模态理解场景,例如:
- 电商产品搜索与推荐:从商品图片和文本描述中直接抽取细粒度属性,无需额外视觉 Tower,降低端到端推理延迟。
- 内容平台视频审核与标签生成:统一 Transformer 处理帧序列和语言,简化多模态 pipeline,适合大规模实时内容理解。
- 教育 / 医疗多模态问答:在图像 + 文本混合输入下,模型原生支持跨模态注意力,减少对领域特定视觉骨干的依赖。
商业价值
论文指出 encoder-free 与 encoder-based 的 loss–compute 前沿在 10^22 FLOPs 量级相交,即在大规模预训练预算下,去除视觉编码器不再损害性能。这带来:
- 降本:去掉独立视觉编码器可减少参数量和显存占用,训练与推理成本随之下降,尤其适合端侧或边缘部署。
- 架构简化:单一 Transformer 统一处理视觉和文本 token,降低工程复杂度与维护成本。
- 迭代提速:不再依赖外部视觉预训练模型,可更快适配新数据分布,缩短多模态模型研发周期。
与现有产品 / 工作流的接口
集成方式与主流 MLLM 训练栈兼容:
- 替换视觉前端:将原 CLIP ViT 等视觉编码器替换为轻量 patch embedding 层,直接输入原始像素 token 到 decoder-only LLM。
- 复用预训练 LLM 权重:论文说明视觉处理会逐渐迁移到 LLM 的早期层,因此现有 LLM 底座仍可复用,只需调整输入层和训练目标。
- 计算预算规划:工程团队可参考 scaling laws 曲线,在 <10^22 FLOPs 的小规模实验阶段保留 encoder-based 基线,而在大规模预训练时切换到 encoder-free 方案,避免重复造轮子。
关键判断:视觉先验的收益随规模递减——当总计算预算充足时,encoder-free 架构是更具性价比的演进方向。
局限
- 论文的 catch-up 结论高度依赖 scaling law 的外推。作者在小规模模型(估计 model ladder 有限)上拟合 loss-compute 曲线,并将趋势外推到 10^22 FLOPs 量级。然而,跨多个数量级的外推存在固有风险,数据分布偏移、训练不稳定、优化器选择、混合精度等因素都可能导致实际表现偏离预测。论文虽然提供了 bootstrap uncertainty 等分析,但并未实际运行 10^22 FLOPs 的 encoder-free 模型来验证,因此“追上”的结论只能视为有依据的预期,而非确定性结论。
- 评估指标主要围绕预训练 loss 和 layerwise probing,对真实下游任务的表现覆盖不足。虽然附录包含一些 benchmark 结果,但正文的 scaling law 分析以 loss 为核心。多模态任务中,loss 与 zero-shot/few-shot 能力的 scaling 关系可能不同于纯文本,且 encoder-free 模型可能在下游任务中表现出不同的偏差。因此,结论在指导实际产品选型时,还需更全面的下游评估。
- 研究使用的 encoder-free 视觉前端较为基础(如 patch embedding + MLP),没有纳入该领域最新的改进,例如 token merging、perceiver resampler、多尺度特征等。这些设计已被证明能提升小模型效率,可能改变 scaling 曲线,从而影响 encoder-free 与 encoder-based 的交点位置。此外,与一些同时期的工作相比,本文未提出新的架构组件或训练技巧,novelty 主要体现在 scaling law 的系统表征上。