论文

UEmbed: 统一稀疏与稠密多模态嵌入

UEmbed: 统一稀疏与稠密多模态嵌入

稀疏检索支撑着现代搜索引擎乃至检索增强生成系统。已有工作引入学习式稀疏检索(Learned Sparse Retrieval, LSR),以突破词汇精确匹配、迈向更丰富的语义理解。然而,LSR 至今仍依赖编码器风格的双向架构,且其向多模态场景的扩展仍需要辅助的跨模态模块。 为突破上述局限,我们提出 UEmbed(Unified Embedding)——一个仅解码器的多模态嵌入模型,可在单次因果前向传播中同时产出稀疏词元表示和稠密表示。UEmbed 在输入中附加 N 个可学习的特殊 token,并将词表划分为 N 个互不相交的子集;每个 token 的因果隐状态对其所属子集预测稀疏权重,再将 N 个子集拼接为完整的稀疏向量。基于公开数据训练,UEmbed 提供 2B、4B、9B 三种规模。UEmbed-9B 在 MMEB-v2 上取得 71.8(稠密)和 71.0(稀疏)的成绩,超越仅用公开数据训练的多模态嵌入模型(如 RzenEmbed)。在 BEIR 上,UEmbed 也能与强稠密和稀疏基线保持竞争力。 此外,我们从有效性、效率与智能体应用三个维度展示了 UEmbed 的实用价值。总体而言,UEmbed 提供了一种新范式:在单一模型中统一稠密与稀疏嵌入,同时将稀疏检索进一步扩展至文本与多模态输入的统一处理。

论文精读

TL;DR UEmbed 用 decoder-only 架构通过词汇分区和可学习 token 在单次前向中同时生成稀疏与密集表示,首次将稀疏检索统一到多模态,性能在公开数据上达到 SOTA。

问题

问题背景

现代搜索系统(从网页搜索到检索增强生成 (RAG))依赖稀疏检索实现高效初筛。学习型稀疏检索 (LSR) 通过模型学习词项权重,突破传统词法匹配的局限,正逐渐成为研究热点。

现有方法局限

当前 LSR 主要存在两个技术瓶颈:

  • 架构绑定:几乎所有 LSR 模型都基于双向编码器(如 BERT),无法利用解码器仅 (decoder-only) 架构在大规模预训练中展现的语义建模潜力,也难以统一对待文本和多模态输入。
  • 跨模态割裂:多模态检索中,LSR 往往需要额外的跨模态对齐模块(如独立的视觉编码器或交叉注意力层),导致系统复杂、训练和推理成本高,且稀疏与稠密向量通常由不同模型产生,一致性难以保证。

为什么这个问题难/重要

统一稀疏和稠密表示、并原生支持多模态,面临三个核心挑战:

  1. 因果注意力机制:解码器仅的因果掩码限制了 token 间信息流,难以直接产生类似 TF-IDF 的全局词项权重。
  2. 词汇表压缩:全词表稀疏投影会带来巨大计算开销,如何高效划分词表并保证检索质量是关键难点。
  3. 工程实现:单一模型同时输出稀疏与稠密向量,需设计无损的联合训练目标,才能在公开数据集上达到 SOTA 并平衡效率。

行业关注度极高:若能用一种模型范式替代当前“稀疏+稠密+多模态三套系统”的碎片化方案,将大幅简化检索系统架构,降低维护成本。

行业类比

如同多模态大语言模型将理解与生成统一为 next-token prediction,UEmbed 试图将检索中的稀疏与稠密范式统一到一个因果解码器的单次前向中,为下一代搜索系统提供更简洁的基座。

核心洞察

  • **统一稀疏与稠密的多模态解码器模型**:UEmbed 采用因果解码器架构,在单次前向传播中同时生成稀疏词袋和稠密向量,消除了以往多模态检索系统中对不同编码器或辅助跨模态模块的依赖。这种设计打破了稀疏检索长期与双向编码器绑定的局面,并将多模态下的稀疏检索从“外挂插件”提升为模型内生能力,显著简化训练与部署流程。
  • **基于词汇表分区的可扩展稀疏头设计**:UEmbed 将整个词汇表划分为 N 个不相交子集,每个可学习特殊 token 通过因果隐藏状态仅预测其子集上的稀疏权重,最后拼接为完整稀疏向量。该策略在不违反因果性的前提下,避免了计算整个词汇表 softmax 的昂贵开销,并且通过灵活调整分区数 N 来平衡粒度与参数效率,为在解码器中实现高效稀疏检索提供了切实可行的工程方案。

方法

输入:多模态序列(图像 tokens + 文本 tokens)末尾拼接 (N) 个可学习 [LEX] 特殊 token,每个 ([LEX]) 负责词汇表的一个不相交子集。

关键模块

  • 词汇压缩与分区稀疏头:将完整词汇表均匀划分为 (N) 个子集,每个 ([LEX]) token 的隐藏状态经线性投影映射到其对应子集的 logits,再通过稀疏化激活(如 α‑entmax)生成 非负、稀疏的词汇权重。拼接所有子集即得完整稀疏向量。分区显著降低每个头的维度,减少计算与内存开销,同时保留词级可解释性。
  • 稠密表示:取最后一个 ([LEX]) 或序列特殊 token 的隐藏状态作为 稠密嵌入,固定维度,用于语义相似度匹配。
  • 统一训练目标:联合优化 InfoNCE 损失。稀疏通路对正样本词汇权重向量与困难负样本形成对比;稠密通路直接在嵌入空间拉近正样本、推远负样本。损失通过加权相加协同训练。
  • 数据与难负样本挖掘:基于公开图文对与纯文本语料,利用检索模型离线挖掘 困难负样本,增强判别性。

输出:一次因果前向同时产出稀疏词汇向量(可解释的 lexical 匹配)与稠密向量(深层语义),支持稀疏检索、稠密检索或混合策略。

与先前 Learned Sparse Retrieval (LSR) 方法不同,UEmbed 是首个在 单一 decoder‑only 多模态模型 中统一稀疏/稠密嵌入的框架,彻底摆脱了双向编码器与辅助跨模态对齐模块的依赖。

实验

实验设计

  • 模型架构:解码器仅 (decoder-only) 多模态模型,附加 N 个可学习特殊 token,将词表划分为 N 个不相交子集,每个 token 的隐藏状态预测对应子集上的稀疏权重,拼接得到完整稀疏向量;同时利用最后一个 token 的隐藏状态经线性投影得到密集表示。
  • 训练数据:全部基于公开数据,包括文本和图文对,并通过难负例挖掘增强。
  • 评估基准:多模态检索使用 MMEB-v2,文本检索使用 BEIR;在 2B、4B、9B 三个规模上评测。

关键发现

  • UEmbed-9B 在 MMEB-v2 上密集检索得分 71.8,稀疏检索得分 71.0,两者均达到领先水平。
  • 稀疏检索在多模态场景下保持与密集检索竞争力,验证了统一稀疏-密集表示的有效性。
  • 在 BEIR 文本基准上,UEmbed 也与强基线模型保持相当的性能,显示出跨模态泛化能力。
  • 模型通过一次前向传播同时输出稀疏和密集嵌入,兼具效率优势。

与基线对比解读

  • 相较于以往依赖编码器双向架构或辅助跨模态模块的**Learned Sparse Retrieval (LSR)**方法,UEmbed 首次在解码器仅架构上实现稀疏检索,避免了额外模块的开销。
  • 在公开数据训练的多模态嵌入模型中,UEmbed 显著优于 RzenEmbed 等同类工作,并在稀疏检索任务上设立了新的 state-of-the-art。
  • 这一结果说明解码器架构通过合理的词表划分和因果注意力机制,同样能学习到高质量的稀疏词项权重,为后续多模态检索系统的设计提供了新范式。

行业影响

落地场景

UEmbed 统一了稀疏与密集双路表示,直接面向现代搜索与检索增强生成(RAG)系统。其多模态能力让产品可直接应用于:

  • 电商/内容平台的多模态搜索:用户上传图片 + 文字描述,系统一次推理同时输出可用于稀疏倒排索引和密集向量检索的嵌入,实现兼顾词法匹配与语义理解的跨模态搜索。
  • 企业级知识库 RAG:统一模型既支持精确的、可解释的关键字匹配,又具备语义泛化能力,适合需要审计、合规的金融/法律文档检索。
  • 智能体(Agent)应用:在自动化客服、数据分析助手等场景,单一模型提供双路检索信号,可显著降低延迟并简化工作流。

商业价值

  • 降本:一个 decoder-only 模型替代以往“双塔 + 稀疏模块”的复杂方案,减少模型训练、部署和运维成本;分区稀疏头设计使稀疏向量长度远小于词典大小,内存和存储开销极低。
  • 增收/体验提升:更准确的检索可直接提升电商的点击率与转化率;在内容推荐中,多模态稀疏检索可捕捉细粒度属性(如风格、材质),提升用户粘性。
  • 效率变现:一次前向传播即可得到两类向量,省去传统多階段流水线的时间开销,使实时搜索系统更容易应对高并发,资源利用率更高。

与现有工作流的接口

UEmbed 的设计便于嵌入主流搜索栈:

  • 密集部分:输出标准向量,可直接写入 FAISS、Milvus、Pinecone 等向量数据库。
  • 稀疏部分:输出词权重,天然兼容 Elasticsearch、Vespa 等基于倒排索引的搜索引擎,甚至可与传统的 BM25 分数线性组合。
  • 服务化:模型可封装为轻量推理 API,替换现有文本/多模态嵌入模型,无需改动上游请求解析和下游精排模块。

具体用例

  1. 跨境电商多语言商品搜索:卖家上传一张“复古皮质手提包”图片,并附西班牙语描述。UEmbed 同时生成密集语义向量(跨语言匹配英文库存)和稀疏词法向量(精确匹配“vintage”“leather”等词),搜索系统融合两路结果,大幅提高小语种场景的召回率与精度。
  2. 医疗文献 RAG 助手:临床研究者提问“关于儿童哮喘的最新吸入性糖皮质激素试验”,模型输出的稀疏表示可确保命中“inhaled corticosteroids”等专业术语,密集表示则捕获“asthma control”等语义相近的概念,避免漏掉重要临床试验证据。

局限

  • 词汇表分区方法引入了超参数 N,需要根据模型规模和词汇表大小仔细调节。论文对 N 的敏感性进行了初步实验,但在实际部署中,不同任务或数据分布可能要求不同的分区策略,增加了工程调优负担。分区后的子集可能导致长尾词汇的稀疏权重学习不充分,影响低频但重要术语的召回。
  • 解码器架构的因果注意力限制了模型对上下文的全局建模能力,与双向编码器相比,在处理需要前后文理解的精确匹配任务时可能存在劣势。论文未深入对比解码器与编码器在稀疏表示质量上的根本差异,也未探索如何缓解单向注意力导致的表示偏差。
  • 评估主要局限于检索基准(MMEB-v2、BEIR),缺少在语义相似度、聚类、分类等通用嵌入任务上的泛化性验证。多模态部分仅覆盖图像-文本对,未涉及视频、音频等更广泛模态,限制了 UEmbed 作为通用多模态嵌入模型的适用范围。
论文Tingyu Song2026-08-03原文

相关内容