WeMM-Embedding: 微信多模态嵌入技术报告
通用多模态嵌入正成为现代 AI 系统的核心组件,用于检索、推荐、分类及智能体等场景。本文提出 WeMM-Embedding,一个支持文本、图像、视频、视觉文档及任意交错多模态输入的 通用多模态嵌入模型 系列,提供灵活的输出维度,包含 2B、4B、9B 三个规模版本。 训练分为两阶段:先进行大规模多模态对齐,再利用精选数据、细粒度相关性监督 和 跨尺度知识迁移 进行精调。在多项公开基准上,WeMM-Embedding 取得领先性能。尤其在 MMEB-v2 上,2B 变体已超越此前领先的 8B 开源基线;9B 变体以 80.6 总分刷新纪录。 实际部署中,该模型在微信推荐与搜索场景表现突出:在 26 项内测任务 上提升显著,在 14 项线上 A/B 测试 中均获一致增益,并已应用于视频号、公众号、朋友圈及电商服务。模型权重与代码已开源(https://github.com/Tencent/WeMM-Embedding)。
论文精读
TL;DR WeMM-Embedding 统一多模态嵌入模型家族,2B 版在 MMEB-v2 超越 8B 基线,9B 版以 80.6 分登顶 SOTA,已部署微信搜索推荐。
问题
问题背景
多模态嵌入模型正在成为现代 AI 系统的基础组件,将文本、图像、视频等异构内容映射到统一语义空间,支撑检索、推荐、分类及智能体任务。业界关注通用性、细粒度对齐与部署效率。
现有方法局限
早期多模态嵌入多采用双塔结构分别编码文本与图像,但面临以下技术瓶颈:
- 模态割裂:文本、图像、视频、文档分别训练独立编码器,融合依赖简单拼接或后期交互,难以建模任意交错输入。
- 粗粒度对齐:仅用对比学习优化整体相似度,缺乏对局部区域、语义层级和排序关系的细粒度监督,导致检索结果语义漂移。
- 维度固定:输出向量维度不可变,无法在不重新训练的情况下适配不同存储和延迟预算。
- 规模瓶颈:大规模开源模型(如 8B 参数)性能优异但推理成本高,小模型泛化能力不足。
为什么这个问题难/重要
多模态嵌入需要同时解决跨模态语义鸿沟、细粒度相关性建模和可扩展性三者权衡:
- 交错输入(如文本+图片+视频片段)的组合空间爆炸,难以穷举标注。
- 实际业务中相关性层级复杂(如“部分相关” vs “高度相关”),需要超越二值正负样本的监督信号。
- 工业部署要求输出维度弹性(如 128 到 1024 维)而不牺牲精度,这需要训练时引入特殊约束。
- 业界关注度极高:通用嵌入模型被用于微信视频号、公众号、电商搜索等亿级流量场景,模型质量直接决定用户体验与转化效率。
行业类比
类似于 RAG 系统中的检索器:需要同时处理用户查询(文本)与知识库中的图表、表格、代码片段等多种模态,嵌入模型必须精准匹配意图并控制索引存储开销。
核心洞察
- 两阶段训练加跨尺度知识迁移是 WeMM-Embedding 以 2B 规模超越 8B 开源模型的关键。该方法先进行大规模多模态对齐,再用 curated 数据、分级相关性监督和 reranker 蒸馏进行精炼,使小模型获得细粒度排序能力,而非仅依赖二元对比标签;这解释了 2B 变体在 MMEB-v2 上能超过之前领先的 8B baseline 并逼近 SOTA 的原因。
- 统一支持文本、图像、视频、文档及任意交错输入,并配合 Matryoshka 表示学习实现灵活输出维度,是 WeMM-Embedding 的另一独特设计。实际部署中不同业务对向量维度和计算资源需求差异大,单一固定维度难以兼顾效率与精度;通过一个模型提供多尺度表示,可避免维护多个子模型,降低工程复杂度,并在 14 个在线 A/B 测试中持续获得提升,体现了工业级通用 embedding 的实用价值。
方法
方法概述
WeMM-Embedding 系列(2B / 4B / 9B)采用两阶段训练,支持文本、图像、视频、视觉文档及任意交错多模态输入,输出维度可配置(通过 Matryoshka Representation Learning)。
输入与数据构建
- Stage 1 大规模对齐:从海量多模态数据组织成统一 pair-based 格式,覆盖文本-图像、文本-视频、图文交错等。使用 对比学习 拉近正样本、推远负样本,并引入 分级相关性学习 对相关性程度建模,而非简单二分类。
- Stage 2 精调与蒸馏:通过 Semantic-ID-Guided Resampling 重采样高质量数据,结合 数据质量精炼、困难负样本构造;利用 reranker 监督 提供细粒度相关性标签,并通过 embedding distillation 实现跨尺度知识迁移。
建模与训练策略
- 模型采用 Transformer 类编码器,多模态输入处理为 token 序列,经编码后投影得到 embedding。
- Stage 1 组合三个损失:对比损失、分级相关性损失、MRL 损失(嵌套维度优化,任意前缀维度均可单独使用)。
- Stage 2 使用筛选后的高质量数据,引入 reranker 生成的相关性分数作为软标签,蒸馏到 embedding 空间,提升排序精度。
输出与应用
模型输出固定或可变维度的 embedding,用于检索、推荐、分类等下游任务。已部署至微信视频号、公众号、朋友圈、电商等场景。
差异点:与先前开源多模态 embedding 模型相比,WeMM-Embedding 强调 统一 pair 格式 与 跨尺度知识迁移,使 2B 小模型即可超过 8B 基线,并在 MMEB-v2 上达到 SOTA 80.6。
实验
实验设计
WeMM-Embedding 在多个公开基准与内部任务上验证。主要采用 MMEB-v2 作为通用多模态表示基准,覆盖文本、图像、视频等模态。同时构建 26-task in-house benchmark 反映微信真实场景,并开展 14 项在线 A/B 测试。模型分两阶段训练:先大规模多模态对齐,再用精选数据与细粒度相关性监督进行 refinement。
关键发现
- 9B 模型 在 MMEB-v2 上取得 80.6 的总分,刷新 SOTA。
- 2B 模型 即超越了此前领先的 8B 开源基线,体现效率优势。
- 在内部 26 项任务上获得显著提升,14 项在线 A/B 测试全部正向。
基线对比解读
相比此前 8B 开源基线,WeMM-Embedding 用更小参数(2B)取得更好效果,说明 跨尺度知识迁移 与两阶段训练策略有效。9B 的 80.6 分进一步验证模型规模带来收益,但没有单纯依赖扩大参数,而是通过 细粒度相关性监督 和 精选数据 提升质量。与同类多模态嵌入模型相比,其同时支持任意交错输入和灵活输出维度,在工程部署上更具适应性。
行业影响
落地场景
WeMM-Embedding 提供 2B/4B/9B 三个规格的通用多模态 embedding,可直接用于 电商搜索与推荐、内容平台 视频/图文召回、企业 多模态知识库问答、以及 Agent 系统的多模态记忆与检索。模型支持文本、图像、视频、文档和任意交织输入,输出维度灵活(MRL),适合不同延迟与算力约束的在线服务。
商业价值
- 降本:2B 模型在 MMEB-v2 超过此前的 8B 开源基线,9B 达到 80.6 的 SOTA,允许在线系统用更小模型获得同等召回效果,降低 GPU 推理成本。
- 增收:报告指出在微信 14 个在线 A/B 测试中带来一致提升,涉及视频号、公众号、朋友圈、电商等场景;多模态 embedding 改善点击率和转化率,直接贡献广告与电商收入。
- 体验:统一向量空间消除异构内容割裂,用户跨模态搜索(如以图搜视频)体验更连贯。
跟现有产品/工作流的接口
- 可作为 召回/排序双塔模型 替换现有单模态 embedding,通过统一 API 输出多模态向量,接入已有向量数据库(Milvus/Qdrant/Faiss)。
- 支持 Matryoshka 表示学习,可输出不同维度向量,无需重新训练即可适配不同存储/检索成本预算。
- 项目已开源权重和代码,可基于 vLLM 或自定义服务框架部署,与主流 RAG 框架(LangChain/LlamaIndex)对接。
典型 use case:电商平台使用 WeMM-Embedding 对商品主图、详情短视频、标题和用户评论进行联合 embedding,在推荐召回阶段融合多模态信号,替代原先独立的文本召回和图像召回通道,提升候选集丰富度与 CTR;企业知识库 RAG 应用则用它索引包含图表、截图的 PDF 和 Office 文档,支持自然语言查询定位到具体图表或段落。
局限
- - **训练与推理开销**:模型规模达到 2B/4B/9B,虽然通过 Matryoshka Representation Learning 支持灵活输出维度,但实际部署仍需要较大的 GPU 显存与计算资源。报告未给出端到端延迟、吞吐或量化后的性能对比,对于低延迟检索/推荐场景难以判断性价比,也无法与轻量级 Embedding 模型在同等硬件约束下直接比较。
- - **评测范围与泛化性**:公开基准以 MMEB-v2 为主,虽覆盖多模态检索,但缺少对低资源语言、长尾类别、复杂推理型多模态输入(如多图推理、长篇视频)的系统评估。跨数据集分布偏移仅通过内部 26 任务体现,未给出域外泛化误差分析,难以评估模型在未见领域或数据漂移下的鲁棒性。
- - **数据与训练细节披露不足**:论文使用大规模多模态对齐与精调数据,但未完全公开数据来源、规模、清洗流程及精确配比。蒸馏阶段使用的 reranker 与教师模型结构、训练超参也未充分说明,开源代码虽可复现推理,但完整训练复现难度高,限制了学术验证与合规审计。