DREAM: 基于自回归建模的密集检索嵌入
密集检索是现代检索型AI系统的核心组件。现有模型通常依赖对比学习目标,需要大量标注的正负文档对,获取成本高且困难。本文探究能否利用大语言模型的自回归下一个词预测目标为密集检索提供监督信号。直觉是:若文档包含与查询相关信息,则基于该文档的LLM预测会更准确。但挑战在于预测损失在LLM内部计算,而检索器是独立嵌入模型。 为此,我们提出DREAM方法,将检索器生成的查询-文档相似度分数注入冻结LLM的选定注意力头。训练时,这些分数决定候选文档在LLM预测目标输出时获得的注意力权重。预测损失通过注意力机制为检索器提供梯度。 我们在BEIR和RTEB基准上,使用0.5B至3B参数的嵌入骨干评估DREAM。结果表明,DREAM在不同规模模型上均一致超越现有基线,验证了通过自回归建模训练密集检索器的有效性。
论文精读
TL;DR DREAM 将检索器生成的查询-文档相似度注入冻结 LLM 的注意力,以自回归预测损失训练密集检索嵌入,无需对比标签,在 BEIR/RTEB 上全面超越基线。
问题
问题背景
密集检索模型已成为 RAG 与智能搜索系统的基础组件,其核心是将查询和文档映射到高维向量空间,通过相似度匹配实现高效检索。当前研究聚焦于如何以更低成本、更高信号质量训练出泛化能力强的检索嵌入模型。
现有方法局限
主流训练范式采用对比学习,需精心构造正负文档对:
- 标注依赖:正例通常来自人工标注或启发式关联,跨域冷启动时成本极高;负例常用批内负采样或难负挖掘,但高质量难负例的获取仍依赖额外挖掘策略。
- 信号粗糙:对比目标仅区分“相关/不相关”,无法建模细粒度语义关联,例如部分相关、段落级匹配等信息被丢弃。
- 分布偏差:训练时构造的负例分布难以覆盖真实检索场景的多样噪声,导致模型在域外数据上 nDCG 下降明显。
- 扩展受限:对比损失对负样本数量和质量敏感,大模型训练常需配合复杂的多阶段负采样,工程复杂度高。
为什么这个问题难/重要
利用 LLM 的自回归下一个 token 预测损失为检索器提供监督,可摆脱对显式标注的依赖,同时捕捉更丰富的语义匹配信号。但技术挑战在于:检索器是独立的嵌入模型,而 LLM 的预测损失在模型内部计算,两者之间存在梯度隔离。如何设计一种接口,将检索器输出的查询-文档相似度分数注入 LLM 的注意力机制,使检索器可通过 LLM 的生成损失端到端训练,是亟需解决的关键。一旦突破,就能以无监督或弱监督方式大规模训练检索器,显著降低数据工程成本,并提升开放域检索的泛化能力,这对构建下一代自适应检索系统至关重要。
行业类比
类似 CLIP 通过大规模图文对对比学习实现通用视觉表示,DREAM 将 LLM 的自回归文本信号作为检索监督源,有望在低资源场景下训练出强大的跨任务检索器。
核心洞察
- 利用自回归语言模型的 next-token 预测损失作为检索器训练的监督信号,完全避开了对比学习对标注正负例的依赖。与传统基于 query-document 相似度的方法不同,DREAM 将检索质量转化为“文档是否让目标输出更容易预测”的隐式信号,从 LLM 内部注意力机制直接提取相关性反馈,为缺乏标注数据的场景提供了新的训练范式。
- 通过将检索器输出的相似度分数注入冻结 LLM 的特定注意力头,DREAM 实现了梯度从预测损失到检索器的端到端传递,而无需微调 LLM 本身。这种接口设计使得检索器能直接利用 LLM 强大的语言理解能力作为裁判,同时保持检索模型的独立性,为构建可插拔的检索增强生成(RAG)组件提供了高效且可扩展的方案。
方法
方法概述
DREAM 将检索器训练转化为一个端到端过程,核心是利用**冻结大语言模型(LLM)**的自回归预测损失作为监督信号,无需人工标注的正负样本。
输入
- 查询
q - 一组建模的候选文档
D = {d1, ..., dk} - LLM 的目标输出文本片段
t(例如问题的答案)
关键模块
- 检索器(Embedding Model):独立于 LLM 的双塔模型,分别编码
q和每个d为向量,计算余弦相似度得到分数s(q, d)。 - 查询聚焦注意力头选择(Query-Focused Head Selection):通过分析 LLM 注意力分布,预先识别出对查询内容敏感的注意力头。这些头在文档处理中起到“门控”作用。
- 相似度分数注入:在选定的注意力头中,将检索器产生的
s(q, d)直接作为附加的注意力偏置(或替换部分注意力权重)融入 LLM 的前向计算。具体地,对于文档的 token,注意力 logits 加上该文档对应的相似度分数,然后 softmax,从而让高相关度的文档 token 获得更多注意力。 - 冻结 LLM 的前向与反向传播:文档 token 的表示与查询 token 一同送入 LLM,LLM 执行自回归生成,计算对目标输出
t的 next-token prediction loss。该损失通过注意力操作反向传播到检索器,更新其参数;LLM 参数始终保持冻结。
输出
优化后的检索器能够对查询-文档对产生更准确的相似度评分,在推理时可直接用于稠密检索,无需 LLM 参与。
训练目标
最小化 LLM 的 next-token 预测负对数似然,等价于最大化相关文档对目标输出的预测增益。这与对比学习不同,无需构造负例,且监督信号来自 LLM 内部的知识,更贴合下游生成任务。
与同类方法的差异
与 REPLUG 等使用 LLM 评估文档相关性不同,DREAM 不直接使用 LLM 的生成概率作为奖励,而是通过注意力注入让检索器直接影响 LLM 的生成过程,梯度传递更直接,且避免了昂贵的前向采样。
实验
实验设计
DREAM 在 BEIR 和 RTEB 两个多领域检索基准上进行了评估,覆盖从 0.5B 到 3B 参数的多种嵌入骨干模型(如 GTE、BGE 等)。训练过程中,冻结的 LLM 作为“裁判”,利用其自回归下一 token 预测损失,通过注意力头注入查询-文档相似度分数,从而为检索器提供梯度。基线包括对比学习、无监督方法及其他基于 LLM 监督的检索训练方式。
关键发现
- 一致的优势:DREAM 在所有模型规模下均优于现有基线,且性能提升随模型规模增大而更加显著。
- 注意力头选择的敏感性:选择与查询相关的注意力头对最终效果至关重要,少量精选头即可提供有效信号。
- 无需标注:DREAM 不再依赖正负例对,仅通过文档与目标输出的条件依赖即可学习区分性表示。
基线对比解读
传统稠密检索器依赖对比损失,需要昂贵的人工标注。DREAM 创新地将 LLM 的语言建模能力转化为监督信号:文档若能降低目标预测困惑度,则被视为相关。这种范式转换不仅消除了数据标注瓶颈,还使检索训练与 LLM 内部知识对齐,从而在下游任务中表现出更好的泛化性。消融实验表明,即便只使用少量候选文档,DREAM 仍能保持竞争力,验证了信号的有效性。
行业影响
落地场景
DREAM 为需要密集检索的 AI 产品提供了无需人工标注的训练范式,尤其适合 RAG 系统、企业搜索、电商推荐、客服知识库等场景。例如,在电商平台的商品搜索中,可直接利用冻结 LLM 对查询-商品描述的匹配度进行隐式监督,训练出更精准的嵌入模型,提升搜索结果的相关性与转化率。在法律科技或医疗信息检索中,由于正负例标注昂贵且专业,DREAM 能大幅降低构建高质量检索模型的成本。
商业价值
- 降本:省去传统对比学习中大量的人工正负例标注,尤其适用于长尾领域与多语言场景。
- 增效:可通过 LLM 的强先验知识提升检索精度,直接改善下游任务(如问答、摘要)的效果,提升用户满意度与留存。
- 可扩展性:方法随 LLM 规模扩展而持续带来增益,支持 0.5B–3B 嵌入骨干,覆盖从轻量端侧到服务端的多种部署需求。
与现有产品/工作流的接口
DREAM 可无缝嵌入现有检索栈:
- 将现有的对比式检索器替换为 DREAM 框架,仅需引入一个预训练冻结 LLM 作为裁判。
- 通过选择 LLM 中少量关键注意力头并注入相似度分数,无需改动 LLM 内部结构,训练时仅更新检索器。
- 最终输出的检索嵌入可用于标准的 FAISS 或 Milvus 向量库,下游 RAG 管道无需改动。
具体用例:在全球内容推荐平台(如 Medium、Substack)中,用 DREAM 训练文章检索器,根据用户当前阅读内容实时检索相关文章,可提高阅读时长与订阅转化,且无需人工定义相关度标准。
局限
- **注意力头选择依赖预设策略**:方法需要从冻结 LLM 中预先识别对查询敏感的注意力头(query-focused heads),这一步骤依赖启发式指标(如交叉注意力对查询 token 的响应强度),引入额外超参数设定。论文在控制实验中展示了选择不同头的影响,但并未证明该策略在不同模型架构(如非 decoder-only LLM)或跨领域任务上的泛化性。实际应用时,可能需要针对每个 LLM 和任务重新执行头选择流程,降低了方法的即插即用性。
- **训练与推理效率瓶颈**:训练期间需要将多个候选文档的前向表示注入冻结 LLM,并在其注意力层中混合相似度分数,这导致计算图极大扩展。论文的消融实验表明,候选文档数量需达到一定规模(如 16)才能获得有效梯度信号,但增大候选数将线性增加 LLM 前向的显存和时间开销。此外,推理时仍需维护一个高参数量 LLM 作为评分器,与仅需轻量双编码器的经典对比学习方案相比,部署成本显著偏高。
- **评估范围与基线比较有限**:实验集中在英文检索基准 BEIR 和 RTEB,未涉及多语言、跨模态或对话式检索场景。比较对象主要为传统对比学习训练的双编码器,缺少与近期利用 LLM 生成伪查询进行蒸馏或直接使用 LLM 编码器(如 E5、BGE)的强基线对比。在部分 BEIR 子任务上性能提升幅度较小,尚无法断言该方法能全面超越现有范式,且论文未分析方法在不同领域分布漂移下的鲁棒性。