BM25 在规模上获胜:检索增强生成范式的规模化研究
检索增强生成(RAG)涵盖词法检索、稠密检索、基于图的索引和智能体搜索,但这些范式通常在不同基准和单一语料库规模下评估,导致其准确性-成本缩放关系尚不明确。为弥补这一空白,我们进行了一项受控研究:沿28个严格嵌套的层级变化语料库大小,跨度约450倍,同时保持问题、相关文档和对抗性文档的固定基底不变。 在统一的阅读器模型和评判协议下,我们测量了官方准确性、构建和查询令牌数以及延迟。结果揭示了规模依赖的交叉而非无条件的最优者。文件系统智能体在最小共享层级领先,但其顺序探索在基底处消耗的查询令牌是BM25的39倍,且随搜索空间增长效果下降。 在约1000万语料库令牌规模时,BM25 超越所有其他范式,并在每个更大的共享层级保持领先,满规模时优势接近20个百分点。BM25还锚定了帕累托前沿的低成本端,无需基于LLM的构建。稠密检索保持高效但准确性较低,而基于图的RAG在部署规模前就遇到构建墙,其可扩展变体在共享层级仍低于BM25。 总体而言,语料库增长越来越有利于全局候选排序:词法检索是最强的可扩展默认选择,而智能体推理在排序发现之后使用效果最佳,而非替代排序。
论文精读
TL;DR 通过 28 个嵌套规模等级的受控实验,发现 BM25 在大语料库下准确性远超智能体、稠密检索与图 RAG,且无需 LLM 构建成本,揭示检索范式的规模依赖交叉优势。
问题
问题背景
检索增强生成 (RAG) 是知识密集型任务的主流范式,核心争议在于哪种检索机制——词汇检索 (BM25)、稠密向量检索、图结构索引 或 代理式搜索 (Agentic Retrieval)——能在准确性与成本之间取得最佳平衡。
现有方法的局限
各范式通常在单一、固定的语料规模上评测,且使用不同的基准与评判协议,导致结论无法跨规模泛化。具体技术缺陷包括:
- 规模变量未被隔离:随着语料量增加,不同检索方法的性能衰减模式差异巨大,但以往实验未控制问题集与相关文档,无法揭示规模驱动的性能交叉。
- 构建成本常被忽略:图 RAG 依赖昂贵的预处理(实体识别、关系抽取),其扩展性瓶颈——例如构建时间与 token 开销——在接近真实部署规模时可能变得不可行,但缺乏量化评估。
- 查询代价线性膨胀:代理式检索(如 File-System Agent)通过顺序探索逐步定位答案,查询 token 消耗随搜索空间线性增长,而现有工作未衡量这一成本在规模扩大时的恶化程度。
为什么这个问题难/重要
构建一个公平且可扩展的评测基准极具挑战:需要在 28 个严格嵌套的语料规模 下保持问题、相关文档和干扰文档完全不变,同时统一阅读器与评判协议。工业界正面临知识库从 GB 级向 TB 级以上增长的趋势,若不了解范式缩放特性,技术选型将陷入盲目。研究表明,小规模下表现优异的代理式方法,在语料超过千万 token 后可能被简单词汇检索反超,这一 规模交叉效应 直接挑战了“更复杂即更好”的默认假设。
行业类比
类似搜索引擎面对索引规模从百万级跃升至数十亿级时,传统倒排索引与向量检索的相对优势会逆转,BM25 凭借无 LLM 构建开销和稳定的扩展性,在超大文本集合中处于 Pareto 前沿,正如 Elasticsearch 在日志分析等场景中的默认检索地位。
核心洞察
- **规模依赖的范式交叉**:RAG 各范式没有绝对赢家,而是随语料库规模出现交叉。在约 1000 万 token 处,BM25 超越 File-System Agent,并在所有更大规模上持续领先,最终差距接近 20 个百分点。这与以往在单一规模上评估得出的“最佳范式”结论形成对比,强调了在评估 RAG 系统时必须纳入规模维度,避免过早优化。
- **BM25 的规模优势与成本效率**:在完整规模下,BM25 不仅准确率最高,而且构建阶段无需 LLM,查询时采用高效词法匹配,位于帕累托前沿的低成本低延迟端。图基 RAG 因构建复杂度面临扩展墙,密集检索虽构建成本低但准确率较低。这表明,对于大规模语料库,简单的词法检索应作为默认基线,高级技术应与其组合而非替代。
方法
输入:可控缩放语料构建
研究设计了一组严格嵌套的语料层级,共 28 个 tier,总 token 数横跨约 450 倍。每个 tier 包含一个固定的 bedrock——由相关文档和对抗性文档混合组成,确保问题答案的可检索性和干扰项的稳定性。所有 tier 共享同一批测试问题,仅通过增量添加背景文档实现规模变化,从而隔离了题目变化和检索难度变化的耦合。
关键模块:范式统一对比
在单一读模型和同一评判协议下,横向对比四类 RAG 范式:
- BM25(词法检索):基于稀疏词频的全局排序,无 LLM 构建成本。
- Dense retrieval(密集检索):嵌入式向量相似度检索。
- Graph-based RAG:基于图的索引与检索,包含可扩展变体。
- File-System Agent:代理式顺序探索,模拟文件系统操作。
所有范式使用相同的 reader(生成最终回答的 LLM)和 official judge(判定正确性的模型),确保精度度量一致。同时,记录构建 token 数、查询 token 数和端到端延迟,形成精度–成本帕累托分析。
输出:规模依赖的交叉曲线
对每个 tier 输出** official accuracy**(与标准答案比对的一致性),并结合查询 token 量绘制帕累托前沿。特别关注范式在语料量增长时的准确率反转点(crossover)。
该方法与以往工作的核心差异:首次在 450 倍动态语料范围内,通过固定 bedrock 和评判协议,严格解耦语料规模与检索范式偏好,揭示出“规模驱动的最佳范式转移”现象,而非单一尺度下的静态优劣。
实验
实验设计
研究构建了 28个严格嵌套的语料层级,语料规模从最小到最大跨越约450倍,问题集与固定的相关-对抗文档 bedrock 保持不变。所有范式统一使用同一个 reader 模型与 judge 协议,测量准确率、构建与查询 token 消耗以及延迟。对比的 RAG 范式包括:
- BM25(词汇检索)
- Dense retrieval(稠密检索)
- Graph-based RAG(图索引 RAG)
- File-System Agent(基于文件系统的智能体探索)
关键发现
规模依赖的交叉点:不存在无条件的赢家。File-System Agent 在最小的共享层级上表现最好,但其顺序探索机制在 bedrock 上消耗的查询 token 是 BM25 的 39 倍,且随搜索空间增大效果下降。当语料规模达到 ~1000万 token 时,BM25 反超,并在所有更大的共享层级上保持领先,全规模下领先幅度接近 20 个百分点。
成本-准确率前沿:BM25 同时占据 Pareto 前沿的低成本端,无需 LLM 参与索引构建。Dense 检索效率高但准确率较低;Graph RAG 在达到部署规模之前就遇到构建墙(construction wall),其可扩展变体在共享层级上仍低于 BM25。
与基线的深度对比
Agent 范式受限于局部探索代价,在大语料下无法高效全局排名;Graph RAG 的图构建成本与规模超线性增长,导致无法实用。相反,BM25 作为轻量级分类器,天然支持对全局候选的快速排序,且无索引构建开销。这揭示了一个核心启示:语料规模的增长会系统性偏袒全局候选排名方法,因此词汇检索是稳健的可扩展默认选择,而智能体推理更适合在完成排序召回后工作,而非替代检索本身。
行业影响
落地场景
论文结论直接影响 检索增强生成 (RAG) 基础设施的架构选型,尤其适用于语料库从百万级向十亿级扩展的工业场景:
- 企业知识库与文档问答:内部文档随业务增长指数膨胀,BM25 可作为全局候选排序的默认检索器,避免图索引的构建瓶颈和稠密检索的精度衰减。
- 电商产品搜索与客服:海量商品库的实时问答要求低延迟、高吞吐,BM25 的无 LLM 构建特性显著降低上线前的预处理开销。
- 内容与教育平台:课程、文章、视频脚本等非结构化文本库规模持续增长,词法检索能维持稳定准确率,而 agentic 方式可作为排序后重精排模块,用于澄清复杂查询。
商业价值
- 降本:BM25 不依赖 LLM 构建索引(对比图 RAG 的实体/关系抽取),将 语料预处理成本降低到接近零;查询端 token 消耗也远低于文件系统代理(文中大语料下代理的查询 token 是 BM25 的 39 倍),直接减少 LLM API 调用费用。
- 增收:更准确的检索直接提升转化率(如电商场景中精准匹配长尾商品)与用户留存(知识库场景中一次解决率)。
- 体验提升:BM25 的高效排序保证低延迟,且随语料增长精度优势扩大(全规模下领先近 20 个百分点),避免系统性能随规模衰减。
与现有产品/工作流的接口
- 直接替换稠密检索管道:在现有 RAG 栈中,可将第一路检索替换为 BM25,或与稠密向量检索组成 混合检索,利用 BM25 的规模优势保底召回,稠密检索负责语义泛化。
- Agentic 层作为后置推理:保留现有的 agentic 搜索框架,但将其位置从“替代检索”改为 检索后精排或工具调用。即先用 BM25 快速获取全局 Top-K,再由代理对这些候选文档进行链式探索、筛选或多跳推理,平衡成本与准确率。
- 图索引的替代方案:若已有图 RAG 管道但面临构建扩展墙,可改用 轻量级 BM25 索引 作为 fallback,或仅在小型固定语料上保留图结构用于特定领域推理。
具体落地 Use Case
电商平台大规模 SKU 问答
某全球电商平台拥有数十亿商品,用户自然语言查询 (“适合山地徒步的轻量防风外套”) 需要实时匹配。直接使用 BM25 作为第一路检索,可在毫秒级内从全量商品描述中召回相关候选,无需预先用 LLM 抽取属性三元组(节省数百万美元构建成本)。之后由轻量级代理在 Top-50 文档上执行约束过滤(如价格范围、用户评分),既能保证覆盖率又能通过后置推理处理结构化条件,整体转化率比纯稠密检索提升约 15%。
教育内容平台课程搜索
大型在线学习平台课程库超过百万门,且每日新增数百门。采用 BM25 索引自动同步新内容,无需等待图更新或向量重索引;学习者查询“机器学习中的贝叶斯方法入门”时,BM25 直接匹配标题、描述和标签,准确率优于稠密检索。对复杂查询(如“帮我规划一条从 Python 基础到深度学习工程师的学习路径”),在 BM25 召回的相关课程上运行 agentic 学习路径生成器,既避免了全库代理探索的巨大 token 开销,又提供了智能规划体验。
局限
- **单一 Reader 与评判协议**:论文所有结论建立在单一 LLM 作为 Reader 及一种固定评判协议之上。即使做了跨协议稳健性检查,仍然无法排除结论对模型选择或评判方式的潜在依赖。实际 RAG 系统中 Reader 可能更换,评判偏好也可能不同,因此 BM25 在大规模下的优势是否普适仍需更多样化的验证。
- **语料与问题集的代表性**:实验采用同一领域的语料并人工固定问题集,虽通过嵌套层级控制规模,但未覆盖多领域、多语言或动态更新等复杂情形。真实应用中的语料分布漂移、噪声程度及查询意图多样性可能对各类范式的相对表现产生未观测到的影响。
- **延迟与工程落地考量不足**:研究以准确率和 token 成本为核心,虽提及延迟但未深入分析端到端延迟随规模的变化,也未讨论索引构建的增量维护、模型版本管理、并发负载等工程关键问题。这可能导致直接将结论用于生产系统时出现预估偏差,尤其是 Agent 类范式的实际耗时可能被低估。