Gemini Embedding 2:来自 Gemini 的原生多模态嵌入模型
本文介绍了 Gemini Embedding 2,一个原生多模态嵌入模型,能够将视频、音频、图像和文本模态嵌入到统一的表示空间中。利用 Gemini 的多模态能力,该模型可为跨所有模态的交错输入生成嵌入,并在多种任务上表现良好。 通过大规模对比学习和多任务多阶段训练,模型在关键嵌入基准上取得了领先性能,包括单模态、跨模态和多模态检索。具体而言,在 MSCOCO 上达到 62.9 R@1,在 Vatex 上达到 68.8 NDCG@10,在 MTEB 多语言上为 69.9,在 MTEB 代码上为 84.0,超越了专门模型的性能。 这些统一能力使 Gemini Embedding 2 成为下游应用(如 RAG、推荐和搜索)的有力候选。此外,其在从天文学、生物科学到美术和烹饪艺术等不同领域的强零样本性能,使其成为专业领域的即用型可靠表示。
论文精读
TL;DR Gemini Embedding 2 是原生支持视频、音频、图像和文本的统一多模态嵌入模型,通过多任务多阶段对比学习在检索基准上全面领先,零样本泛化能力突出。
问题
问题背景
在多模态数据爆发式增长的时代,下游应用(如 RAG、推荐系统、跨模态搜索)亟需能够将文本、图像、音频、视频 统一映射到同一表示空间的嵌入模型,以实现灵活的检索与理解。
现有方法局限
当前多模态嵌入方案通常存在三类局限:
- 非原生多模态处理:模型多为 单模态编码器拼接 或 后融合对齐,无法直接理解交错输入(如图文混排、带字幕的视频流),导致语义割裂。
- 泛化能力受限:多数模型仅针对 图像-文本对 训练,难以扩展到 视频、音频 或任意模态组合,零样本跨域性能差。
- 任务割裂:不同检索任务(如纯文本检索、跨模态检索)需依赖专用模型,缺乏统一架构,维护成本高。
为什么这个问题难/重要
- 技术挑战:实现统一的表示空间需解决模态间语义对齐、时间同步(视频帧与音频)以及数据异质性,同时大规模对比学习需要精心设计多任务多阶段训练 策略来平衡各模态学习。
- 业界关注度:在企业级 RAG、多媒体搜索引擎中,高效精准地同时检索图文、音视频内容成为刚需,而零样本泛化到天文、生物科学、烹饪艺术等专业领域的能力更是决定模型是否“开箱即用”的关键。
行业类比
如同 Neural Search 需要统一索引文本、图片、视频,Gemini Embedding 2 提供的原生多模态表示,让复杂查询(如“找一段视频,其中有人在讲解量子计算并用图表辅助”)成为可能,这正是下一代 多模态检索增强生成 的基础设施。
核心洞察
- **原生多模态统一表征**:与主流的多模态嵌入方案(如 CLIP 系列仅对齐图像与文本,或 AudioCLIP 分别编码再投影)不同,Gemini Embedding 2 在单一 Transformer 架构内原生处理视频、音频、图像和文本的任意交错组合,直接输出统一嵌入。这避免了事后对齐带来的信息损失,能建模复杂的跨模态细粒度交互,尤其适用于长视频中的多模态事件理解或图文混排文档检索。该设计真正实现了“一次编码,多模态共享”,大幅降低了多模态系统集成的工程复杂度。
- **多阶段训练与模型汤策略**:该模型采用 Pre-Fine-Tuning (PFT)、Fine-Tuning (FT) 与 Model Soup 组合的训练范式,并充分挖掘合成数据的价值。先利用大规模弱标注或合成数据注入通用多模态知识,再于高质量数据集上精调,最后通过权重平均整合多个局部最优解,显著提升零样本泛化。这一流程可操作性强,为业界提供了一条低成本构建通用多模态嵌入服务的路径,在 MSCOCO(62.9 R@1)、MTEB Code(84.0)等多个基准上一举超越专用模型,验证了统一训练框架的竞争力。
方法
支持任意交错的视频、音频、图像和文本序列作为输入,无需模态预分离,模型直接接收原始多模态 token 流。核心架构基于 Gemini 原生多模态能力,并引入双向注意力改造 (Adaptations for Bidirectional Attention),使原本自回归的解码器更适合生成全局上下文嵌入。训练分为三个阶段:Pre-Fine-Tuning (PFT) 在大规模弱监督数据上初始化对比学习;Fine-Tuning (FT) 在高质量任务数据上使用多任务对比损失(如 InfoNCE)区分正负例对;Model Soup 平滑平均多个 checkpoint 以提升泛化性。嵌入头部将最后一层隐藏状态映射为固定维度向量,输出统一表示空间中的嵌入,直接支持跨模态检索、相似度计算等下游任务。与以往拼接多个单模态编码器的“伪多模态”方案不同,Gemini Embedding 2 从预训练阶段起即端到端处理所有模态,无需额外的模态对齐损失,在零样本领域迁移上表现出更稳健的统一表示能力。
实验
实验设计覆盖多模态检索、文本嵌入与跨模态任务。在 MSCOCO 和 Vatex 上评估图文/视频检索;在 MTEB 多语言与代码子集测试纯文本嵌入质量;同时报告 MMTEB 和 MSEB 等多模态综合基准。模型采用多任务多阶段对比学习,从通用预训练后经预微调(PFT)和微调(FT),再使用模型汤(model soup)集成。
关键发现:Gemini Embedding 2 在统一嵌入空间下达成全面领先。MSCOCO 图像到文本 R@1 达 62.9,Vatex 视频到文本 NDCG@10 达 68.8,MTEB 多语言平均 69.9,代码子集 84.0,均超越以往专用模型。消融实验表明合成数据与视频域数据显著提升跨模态泛化;零样本能力突出,在天文、生物科学、艺术等专业领域表现鲁棒。
与基线对比:此前最佳性能多由针对特定模态或任务优化的模型取得,而 Gemini Embedding 2 以原生多模态架构,用单一模型同时在图文、视频、文本、代码等多维检索上胜出,验证了统一多模态嵌入取代分立模型的可行性,为检索增强生成(RAG)、搜索和推荐提供了高效且可扩展的基础。
行业影响
落地场景
Gemini Embedding 2 可支撑多种多模态业务场景:
- 多模态搜索引擎:允许用户以文、图、音、视任意组合查询,返回最具相关性的跨模态结果。
- 个性化推荐:在内容平台和电商中,基于多模态内容相似度提升推荐精准度。
- 企业级 RAG 与知识管理:对包含图文混排、会议录音、演示视频的企业资料建立统一向量库,增强问答和检索体验。
- 内容审核与标注:自动分类、打标、过滤海量 UGC 内容。
商业价值
- 降低总拥有成本 (TCO) :单一模型覆盖所有模态,免去为不同模态训练部署专用模型,显著减少维护与硬件开销。
- 提升转化与用户粘性:更准确的跨模态检索(如“以图搜图”)直接改善购物和消费体验,带动关键商业指标。
- 零样本泛化加速业务拓展:在医学影像、天文观测、艺术典藏等专业领域无需大量标注即可获得可靠嵌入,实现快速冷启动。
与现有产品/工作流的接口
模型以 API 形式交付,允许交错输入多种模态并输出统一向量。可轻松替换现有文本嵌入组件,接入主流生态:
- 向量数据库:
Pinecone、Weaviate、Milvus等。 - RAG 框架:
LangChain、LlamaIndex。 - 数据处理管线:作为特征提取模块,与对象存储、消息队列直接集成。
具体落地 Use Case
- 时尚电商商品搜索:用户上传一张衣物图片或一段走秀视频,系统将其转化为向量并在商品库中检索相似款式,实现“即看即买”的跨模态搜款。
- 在线教育视频智能索引:对于超长课程录播,模型自动对齐文本描述与视频片段,学生可通过自然语言快速定位“讲师演示某个实验”的时刻,大幅提高内容利用率与学习效率。
局限
- **模型封闭与复现门槛高** 论文未公开权重、训练数据及详细超参数,仅通过 Gemini API 提供服务。这导致社区无法独立验证性能或进行公平对比,也限制了进一步研究。尽管 API 简化了工业集成,但研究者和开发者难以深入分析模型行为、微调或适配低资源场景,其学术透明度不足。
- **多模态基准覆盖不均衡** 重点评估了文本-图像检索和 MTEB 等文本基准,但对视频、音频嵌入的质量验证较少,且未在跨模态推理、问答等更复杂的下游任务中系统测试。对长视频、高噪声音频的鲁棒性也缺乏分析,可能高估实际部署时的可靠性。
- **零样本泛化的公平性与偏差未充分检视** 虽然声称在多个专业领域具备强零样本能力,但没有提供跨文化、跨语言或低资源内容的公平性评估。多模态模型易继承训练数据的偏见,可能导致嵌入空间对某些人口群体或内容类型产生系统性偏差,影响推荐与搜索的公平性。