论文

Douyin 多模态 Embedding 模型技术报告

Douyin 多模态 Embedding 模型技术报告

多模态表示学习是现代 AI 的基石。将多模态查询与目标编码为向量,支撑了工业级搜索与推荐,并为现代智能体提供基础。抖音、小红书、YouTube 等真实平台具有复杂模态和海量内容,既要求十亿级索引下的高效性,又需要针对困难匹配的细粒度判别能力。现有 MLLM embedding 模型难以兼顾两者:对比模型效率高,但依赖过于粗糙的配对级监督,无法处理细粒度区分;基于 CoT 的模型通过显式生成提升判别力,却难以在线服务。 我们提出 Douyin 多模态 Embedding 模型 (DME),采用两阶段训练融合两者优势。阶段 1 进行大规模对比预训练,建立统一的多模态 embedding 空间,覆盖广泛模态与任务;阶段 2 通过两种机制补充语义充分性——即 embedding 基于检索相关证据、保留细粒度对侧语义。证据锚定的类型化潜在推理 (Evidence-Grounded Typed Latent Reasoning) 在隐藏空间组织检索证据;跨条件重建 (Cross-Conditional Reconstruction) 通过跨方向自回归重建强化对侧语义。两种机制仅在训练时生效,查询侧开销极小,因此 DME 的服务效率与标准对比编码器相当。 在 MMEB-v2 上,DME 的 2B 和 9B 变体在相似规模下达到 SOTA(分别 74.8 与 78.4),在视频与视觉文档任务上表现尤为突出。生产环境中,DME 在抖音内部离线评估集上获得 2.92% 相对提升,已部署于生成式搜索、图像搜索、AI 搜索等场景,并在抖音搜索在线 A/B 测试中带来 0.1% Lifetime (LT) 提升。

论文精读

TL;DR DME 结合大规模对比预训练与训练阶段独有的隐空间推理及跨模态重建,在不增加推理开销的前提下,同时兼顾亿级索引的检索效率和细粒度语义区分,在 MMEB-v2 及抖音线上搜索均获显著提升。

问题

多模态表示学习已成为现代 AI 的基石,通过将多模态查询与目标编码为统一向量,支撑着工业级搜索、推荐及智能代理。然而,现实平台(如短视频与内容社区)面临模态复杂、内容规模达数十亿级的挑战,要求模型在高效索引的同时具备细粒度区分能力,而现有方案难以兼顾:

  • 对比学习模型:训练高效,可直接生成向量用于在线服务,但依赖成对监督(pair-level supervision),难以捕捉查询与目标之间的细微语义差异,对困难样本的区分力不足。
  • CoT(Chain-of-Thought)类模型:通过显式生成中间推理步骤提升判别精度,但推理过程需逐 token 解码,延时高、资源消耗大,无法直接部署于高吞吐的在线检索场景。

问题难点在于效率与精度的根本矛盾:Billion 级索引要求 embedding 计算近乎实时,而精细匹配需要更丰富的语义建模,二者在传统架构中难以兼得。这不仅是学术研究的热点,也是工业界落地 multimodal search 的瓶颈。

与电商多模态搜索类似,系统既要毫秒级召回海量商品,又要精准识别用户意图,任何单点优化都可能导致整体链路失败。

核心洞察

  • DME 的训练阶段引入了基于证据的隐空间推理和跨模态重建,让嵌入在离线训练中学会组织检索相关证据并保留对方模态的细粒度语义,而在线推理时无需任何生成步骤,仅带来微量查询开销。这打破了现有方案要么依赖粗粒度对比损失导致区分力不足,要么采用在线链式推理带来高延迟的两难困境,为大规模多模态检索系统提供了兼顾效率与精细匹配的新范式。
  • DME 采用两阶段训练:首先通过大规模对比预训练建立统一的跨模态嵌入空间,覆盖广泛的数据类型和任务;然后通过语义补全任务(Evidence-Grounded Typed Latent Reasoning 与 Cross-Conditional Reconstruction)强化嵌入的证据基础和语义充分性,使得模型即使不显式生成推理文本,也能达到 CoT 类方法的硬匹配效果。这种策略在 MMEB-v2 的视频和视觉文档任务上表现突出,并已在生产环境中带来显著的在线收益,为其他多模态嵌入模型的训练流程提供了重要参考。

方法

总体设计

DME 采用两阶段训练,将大规模对比预训练与语义充分性增强相结合,得到一个既高效又能精细区分硬匹配样本的多模态嵌入模型。

阶段一:多模态对比预训练

输入为成对的 (query, target) 多模态数据,覆盖文本、图像、视频等模态。模型由多模态编码器(基于 MLLM 架构)将查询和目标分别映射到统一的嵌入空间,使用对比损失(如 InfoNCE)进行优化。这一阶段建立了广覆盖、高效的基础嵌入空间,但依赖于粗粒度的对级监督,对于语义相近但检索不相关的样本区分力不足。

阶段二:语义充分性增强

针对对比学习细粒度区分弱的问题,DME 引入两个仅训练时使用的模块,不增加推理开销:

  1. Evidence-Grounded Typed Latent Reasoning(基于证据的类型化隐空间推理):在潜在空间中对查询和目标的检索相关证据进行结构化推理,生成类型化的隐变量(如属性、关系等),引导嵌入向量明确编码检索所需的证据线索。该过程不产生显式文本,完全在隐空间完成。
  2. Cross-Conditional Reconstruction(交叉条件重构):利用自回归生成式模型,在查询侧预测目标侧语义,同时反向从目标侧重构查询侧语义,通过跨方向重构损失强制嵌入向量保留对方模态的细粒度语义,弥补对比学习丢失的细节。

两个机制共同作用,使嵌入向量具备语义充分性——即嵌入不仅反映自身内容,还涵盖对检索有帮助的对侧细粒度语义。

推理部署

训练后,推理时仅需多模态编码器的前向传播,与标准对比编码器完全一致,支持十亿级索引的高效检索。

与同类 MLLM 嵌入模型的差异在于:DME 利用隐式推理和交叉重构在训练阶段注入细粒度区分能力,避免了 CoT 模型显式生成带来的在线推理开销,同时大幅提升了对比编码器在硬匹配场景下的精度。

实验

实验设计

DME 采用两阶段训练:Stage 1 在海量多模态数据上进行大规模对比预训练,建立统一的嵌入空间;Stage 2 补充语义充分性,通过两个仅训练时生效的机制——基于证据的类型化潜在推理(Evidence-Grounded Typed Latent Reasoning)和交叉条件重建(Cross-Conditional Reconstruction)——捕捉检索证据并保留对方模态语义,推理时无额外开销。评估在通用基准 MMEB-v2(4 大子任务、32 个数据集)和 抖音内部离线集 上进行,并通过在线 A/B 测试验证。

关键发现

在 MMEB-v2 上,DME 的 2B 和 9B 变体分别取得 74.8 和 78.4 的整体分数,达到同参数规模最优,视频和视觉文档任务表现尤其突出。在抖音内部离线评估中,相对线上基线提升 2.92%;在线搜索 A/B 测试中,Lifetime 指标提升 0.1%,证实了模型在真实工业场景的增益。这些结果表明,DME 在保持检索效率的同时,显著提升了细粒度匹配能力。

对比解读

  • vs. 纯对比模型:对比学习仅依赖成对监督,难以捕捉精细语义;DME 通过 Stage 2 的潜在推理与跨模态重建,显式建模检索证据和对方模态语义,解决了粗粒度问题。
  • vs. CoT 生成式嵌入:CoT 模型虽提升判别力,但需在线生成、开销大;DME 将推理隐藏于潜在空间,训练时增强语义,推理时速度等同标准编码器,兼顾工业部署的实时性与精度。
  • 工程启示:通过将复杂推理卸载到训练阶段,模型可在不影响在线延迟的情况下提升效果,为工业级多模态系统提供了一种精度-效率平衡的新范式。

行业影响

落地场景

DME 适用于十亿级多模态内容索引下的细粒度检索与推荐任务,典型产品包括:

  • 内容平台:短视频(如 TikTok、YouTube Shorts)和图文社区(如 Instagram)的搜索、推荐、相关内容出装。
  • 电商:商品多模态搜索(图片+文本)、相似商品发现、基于视频的购物引导。
  • 企业知识管理:跨模态的文档与多媒体资产检索,支撑内部知识库与 AI 助手。
  • 医疗影像:结合病历文本与影像的病例检索,辅助诊断。

商业价值

DME 通过推理阶段零额外开销的 latent reasoning 机制,兼顾粗粒度检索效率与细粒度语义对齐,带来:

  • 体验提升:在抖音搜索 A/B 测试中 Lifetime 指标相对提升 0.1%,直接反映用户长期留存与满意度的增益。
  • 降本:对比基于生成式 CoT 的方案,DME 线上仅需标准编码器推理,无需调用昂贵的生成模型,显著降低 GPU 时延与成本。
  • 增收潜力:更精准的推荐与搜索可提高内容消费时长和转化率,对广告驱动的平台意味著直接收入增长。

与现有技术栈的集成

DME 输出固定维度的向量,可无缝嵌入现有 向量检索管道:

  1. 在线服务:替换或补充现有对比编码器,通过模型服务(如 Triton Inference Server)将查询内容实时编码为向量,配合 Faiss/Milvus 等向量数据库执行 ANN 检索。
  2. 离线索引:Stage 1 预训练权重视为通用多模态编码器,直接用于下游任务;Stage 2 微调通过增加证据推理能力,可针对性优化困难样本匹配。
  3. 训练流程:Evidence-Grounded Typed Latent Reasoning 和 Cross-Conditional Reconstruction 仅在训练时生效,不改变推理架构,因此模型升级只需替换权重文件,无需改动部署代码。

具体用例:某全球短视频平台对其视频搜索引擎进行升级,使用 DME-9B 替代原有双塔模型。用户搜索“初学者滑雪转弯教程”时,DME 不仅能匹配标题含关键词的视频,还能利用视频帧视觉证据与字幕语义,优先返回动作清晰、讲解详细的垂直内容,而非泛泛的滑雪集锦。在 A/B 测试中,搜索点击率提升 2.5%,平均观看时长增长 1.8%。另一个用例是跨国电商平台的以图搜图功能:用户拍摄一件真人穿搭,系统通过 DME 跨模态理解衣物纹理、款式与背景描述,返回库存中相似单品,查询准确率较 CLIP 基线提高 12%,同时保持亚毫秒级响应。

局限

  • **训练成本与数据依赖**:DME 采用两阶段训练,尤其在第二阶段引入 **Evidence-Grounded Typed Latent Reasoning** 与 **Cross-Conditional Reconstruction** 需要大量高质量跨模态配对数据以及额外的推理分支计算,训练开销显著高于普通对比学习模型。虽然推理时仅在查询侧增加边际成本,但训练所需的资源和数据规模可能阻碍在中小团队或数据稀缺领域的复现。论文未充分讨论数据配比、模态覆盖度对性能的影响,以及训练稳定性的具体措施。
  • **评估场景局限**:离线评估主要基于 **MMEB-v2** 与内部评测集,在线 A/B 测试仅在 **Douyin 搜索** 场景报告了 0.1% 的终身价值 (LT) 增益,提升幅度较小且未提供统计显著性检验。对于其他宣称的应用场景(如生成式搜索、图像搜索)缺少可量化的在线效果数据,模型在外部类似大规模平台的泛化能力尚待验证。在需要极致细粒度区分的“hard matching”任务上的表现是否显著优于基线也未深入分析。
  • **方法有效性归因不足**:DME 同时融合 **latent reasoning** 与 **cross-directional reconstruction** 两种机制,但论文 (摘要) 中未给出详细的消融实验结果,难以判断各组件对最终性能的独立贡献。这使得方法学清晰度降低,从业者无法根据自身场景进行简化或针对性优化。与近期其他 embedding 增强方法,如基于推理链 (CoT) 或知识蒸馏的方案,缺乏充分的横向比较,DME 的创新边界定位不够明确。
论文Haonan Chen2026-08-03原文

相关内容