NeoMME: 用于高效微调与推理的单塔多模态原生多语言基础编码器
多模态模型通常构建于生成式视觉-语言建模架构之上,典型做法是将预训练的视觉编码器与因果语言模型结合。诸如 ColPali 一类的视觉文档检索器将这些模型重用作编码器,从而继承了大参数与计算开销,而任务本身并非生成式。 为此,我们提出 NeoMME,一个参数规模为 260M 与 800M 的多模态多语言双向编码器家族。该模型在一个统一的双向 Transformer 编码器中同时处理多语言文本与原始图像块。两种规模均以掩码离散扩散文本目标从零开始预训练,对于多模态样本则以其可见图像块作为条件。模型支持 16,384 token 的上下文,足以编码多达两幅标准 4K UHD 图像。 为展示下游能力,我们以联合训练的稠密与延迟交互头对 NeoMME 进行微调。在 ViDoRe v3 基准上,所得到的 NeoMME-Retriever 260M 以 0.523 nDCG@10 的得分超越了所有严格低于 800M 参数的评估模型,而 NeoMME-Retriever 800M 达到 0.556。在 NVIDIA L40S 上,以匹配的 2048×2048 图像输入尺寸运行时,NeoMME-260M 编码页面的吞吐量约为 ColModernVBERT 的 2 倍。此外,分层令牌池化与非对称量化将延迟交互多模态文档嵌入压缩了 255 倍,同时保留基线 nDCG@10 的 95% 以上。 我们将 NeoMME 贡献给 Hugging Face Transformers,并以 Apache 2.0 许可证在 https://hf.co/collections/Hcompany/neomme 发布预训练骨干与检索兼容检查点。
论文精读
TL;DR NeoMME 用单塔双向 Transformer 直接编码多语言文本与图像 patch,以掩码离散扩散预训练,300M 级模型在 ViDoRe v3 上超越基于 VLM 的检索器,且吞吐翻倍、嵌入压缩 255 倍仅损失 <5% 精度。
问题
问题背景
多模态视觉文档检索(Visual Document Retrieval)正成为智能知识管理、RAG 等场景的关键能力,业界关注统一编码器能否同时处理文本与图像并支持多语言。
现有方法局限
主流方案如 ColPali 直接复用生成式视觉语言模型(VLM)作为编码器,这类架构通常由独立预训练的视觉编码器与因果语言模型拼接而成,参数与计算开销显著偏高,但检索任务并不需要生成能力。此外,因果注意力掩码限制了双向上下文建模,导致文档编码质量下降;上下文窗口普遍较短(如 4096 token),无法容纳高分辨率多页文档;多语言与多模态从头联合训练数据稀缺,通常依赖后期对齐,语言覆盖有限。微调时还需要加载完整 VLM 权重,训练与推理成本陡增,且嵌入存储占用大。
为什么这个问题难/重要
多模态文档页面通常包含混合排版、表格、图形与多语言文字,要求编码器同时具备细粒度视觉理解和跨语言语义对齐。双向注意力与长上下文支持能更好地捕获页面全局结构,但小模型从头预训练容易欠拟合,且缺乏大规模高质量的多模态预训练语料。工业界对低延迟、高吞吐的文档索引有刚性需求,减少参数和压缩嵌入而不损失检索精度是落地关键。NeoMME 提出用掩码离散扩散目标从头训练一个单塔双向 Transformer,为高效多模态表示学习提供新路径。
行业类比
该问题与智能文档助手或企业搜索产品中“每页文档编码成本”直接相关,降低单页编码耗时和索引体积即可扩大可处理文档规模。
核心洞察
- 用 masked discrete-diffusion 作为预训练目标,构建原生双向多模态编码器,绕过了从生成式 VLM 改造的冗余。与 ColPali 等将预训练视觉编码器与因果语言模型拼接的方法不同,NeoMME 在单个双向 Transformer 中同时建模文本与图像 patch,参数仅 260M/800M 却在 ViDoRe v3 上超越同规模模型,证明非生成任务无需继承 VLM 的生成式架构开销。
- 层级 token pooling 与非对称量化实现了 late-interaction 嵌入的 255x 压缩,同时保留超过 95% 的 nDCG@10,直接回应了视觉文档检索中多向量索引存储爆炸的工程难题。相比 ColBERT 风格的逐 token 存储,该方法在精度损失极小的情况下大幅降低索引体积,使小模型在 L40S 上以约 2 倍吞吐量处理 2048x2048 页面,兼具检索质量和实际部署可行性。
- 支持 16,384 token 上下文,足以编码两张标准 4K UHD 图像,且文本与图像共享统一的 2D rotary position embeddings,增强了多语言长文档的表示能力。这一设计不同于多数多模态模型仅处理单图或裁剪区域的做法,为跨页文档检索和复杂版面理解提供了原生支持,且在预训练阶段通过 image-conditioned generation 验证了跨模态条件建模的有效性。
方法
输入与表示
- 文本 token 化后与原始图像 patch 线性投影嵌入拼接为统一序列,上下文长度 16,384 token,足够编码两张标准 4K UHD 图像。
- 位置编码采用 2D rotary position embeddings,保留图像二维空间结构。
关键模块
- 单一双向 Transformer 编码器:同时处理多语言文本与图像 token,摒弃独立视觉编码器 + 因果语言模型的分体设计。
- 预训练目标:使用 masked discrete-diffusion 文本目标,对文本 token 进行离散扩散去噪,并以可见图像 patch 作为条件,实现多模态对齐。
- 检索微调:在基础编码器上联合训练 dense head 与 late-interaction heads,dense 输出单向量,late-interaction 保留 token 级多向量用于细粒度匹配。
- 压缩与量化:层次化 token pooling 减少 token 数量,非对称量化压缩表示,实现 255× 压缩同时保留 95% 以上 nDCG@10。
输出
- 基础编码器输出多模态双向表示;微调后输出可检索的 dense 向量和 late-interaction 多向量,直接服务于视觉文档检索。
与同类方法差异
- 区别于 ColPali 等复用生成式 VLM 作为编码器的路线,NeoMME 是专为非生成式检索任务设计的原生多模态双向编码器,参数量更小、编码吞吐更高。
实验
实验设计
NeoMME 从零预训练,采用 masked discrete-diffusion 文本目标;多模态样本中,文本 token 被掩码后利用可见图像 patch 作为条件进行预测。微调阶段联合训练 dense head 与 late-interaction head,在 ViDoRe v3 上评估 nDCG@10。同时测试 2048×2048 输入下的编码吞吐与压缩方案。
关键发现
- NeoMME-Retriever 260M 在 ViDoRe v3 上
nDCG@10= 0.523,超过所有 <800M 参数基线。 - NeoMME-Retriever 800M 达 0.556。
- L40S 上 2048×2048 输入下,260M 编码吞吐约为 ColModernVBERT 的 2 倍。
- hierarchical token pooling + asymmetric quantization 将 late-interaction 文档嵌入压缩 255 倍,仍保留 >95% 基线
nDCG@10。
与基线对比的深度解读
不同于 ColPali 直接复用生成式 VLM 作为编码器,NeoMME 采用单塔双向 Transformer 直接处理 raw image patches,避免了视觉编码器 + 因果 LM 的冗余。260M 体量即可超过所有 <800M 基线,说明 masked discrete-diffusion 预训练对表征质量有效;但 800M 相对 260M 仅 +0.033 nDCG@10,边际收益需权衡。压缩率 255x 表明 late-interaction 多向量索引能在几乎不损失精度的情况下大幅降低存储与检索开销,对大规模文档检索工程具备实际价值。
行业影响
落地场景
NeoMME 可作为 视觉文档检索 的轻量编码器,适用于需要从图像 / PDF 中检索信息的系统。典型 use case:
- 电商平台:商品详情图、宣传海报、截图等多模态文档索引与语义搜索,支持根据自然语言查询找到对应图片页面。
- 企业知识管理:扫描合同、发票、技术手册等非结构化视觉文档,构建可检索的知识库。
- 内容平台:对图文混排的帖子、文章截图、信息图进行多语言语义检索。
商业价值
核心优势是 参数效率与推理吞吐:260M / 800M 级别单塔双向编码器,无需独立视觉编码器 + 因果语言模型,显著降低 GPU 内存和延迟。在 L40S 上 NeoMME-260M 编码页面吞吐率约为 ColModernVBERT 的 2 倍;255x 压缩 下保留 >95% nDCG@10,可将 late-interaction 索引存储成本降至可接受范围,适合大规模生产环境。检索质量方面,260M 在 ViDoRe v3 上 nDCG@10 0.523 超越同参数量级模型,800M 达 0.556,为中小团队提供有竞争力的开源选择。
与现有产品 / 工作流的接口
模型已集成到 Hugging Face Transformers,Apache 2.0 许可,可直接通过标准 AutoModel,进行加载。推理流程简单:单个 NeoMMEProcessor,处理图像和文本,输出 token 后接 dense 或 late-interaction 检索头。可与主流向量数据库(如 FAISS、Qdrant)集成,dense 向量直接索引;late-interaction 嵌入经层级 pooling 和非对称量化后,可改造现有 ColBERT 类检索后端。微调只需在预训练 backbone 上添加检索头,无需修改基础架构。
局限
- **模型规模与复杂任务泛化限制**:NeoMME 参数为 260M 和 800M,虽然在小参数范围内视觉文档检索取得领先,但受限于编码器架构和参数规模,在复杂多模态推理、生成式任务上可能无法匹敌大型 VLM。论文仅验证了检索和有限的迁移任务,尚未在更广泛的视觉问答、图像描述等 benchmark 上展示竞争力,泛化边界不清晰。
- **多语言覆盖与数据配比未知**:NeoMME 宣称多语言,但预训练数据混合细节仅在附录给出简单比例,未明确各语言实际 token 占比。检索评估也集中于 ViDoRe v3 的少数语言,缺乏对低资源语言(如阿拉伯语、印地语等)的专项测评,可能导致实际多语言检索性能与英文差距较大。
- **压缩方法评估指标单一**:压缩实验采用 `nDCG@10` 作为主要衡量,虽保持 95% 以上,但该指标对排序靠前结果敏感,其他如 recall@100、mAP 可能受影响更大。此外,非对称量化与分层池化的组合对 embedding 分布变化的鲁棒性未在分布外文档上测试,实际存储与检索系统可能面临额外精度损失。