超越语义相似度:面向复杂任务的 agentic retrieval 的性能与成本
现代信息系统(包括许多 agentic workflow)依赖 dense retrieval 来探索海量非结构化数据。然而,dense retrieval 只基于表层语义相似度,对日益复杂的搜索应用而言已显不足。 本文研究 agentic retrieval:在 ReAct agentic loop 中,将 LLM 的推理能力与 retriever 高效的语料探索能力结合起来,以求解复杂检索任务。 实验结果表明: - 相比标准检索,agentic retrieval 更有效——在使用同一 embedding model 的情况下,nDCG@10 提升 8.7 分; - 专用检索方法在 out-of-domain 任务上表现不佳,而 agentic retrieval 泛化性很强:同一 pipeline 在 ViDoRe v3 与 BRIGHT 榜单上均取得有竞争力的结果。 但这一提升是有代价的:agentic retrieval 平均耗时 107.4 秒,而标准检索仅需 0.67 秒;每次查询消耗 764.1K input 与 5.8K output tokens。 总而言之,本研究证明了 agentic retrieval 在现代数据系统中的有效性,并推动未来面向大规模部署、更具成本效益的检索 agent 研究。
论文精读
TL;DR 实证研究 agentic retrieval:用 ReAct 循环结合 LLM 推理与 dense retrieval,复杂任务 nDCG@10 提升 8.7 点,跨域泛化好,但成本高(107 秒/查询)。
问题
问题背景
现代信息系统中,检索(retrieval)是 agentic workflows、RAG、DeepResearch 等复杂 AI 工作流的核心组件,负责从海量非结构化数据中快速定位相关信息。
现有方法局限
主流 dense retrieval 基于 embedding 的余弦相似度匹配,本质上只能捕捉查询与文档的 表面语义相似性。对于需要多跳推理、聚合比较、或隐含约束的复杂查询(如“找一份 2024 年后发布、面向医疗场景且开源许可宽松的 LLM benchmark”),单个向量表示难以编码全部意图;查询重写或 HyDE 等方法虽能缓解,但缺乏在检索过程中动态调整策略、验证中间结果的能力。此外,专门为特定领域训练的检索器在跨域迁移时性能明显下降,暴露出泛化性不足。
为什么这个问题难且重要
技术挑战在于:LLM 具备强推理能力但无法直接扫描大规模语料;检索器能高效遍历但缺乏对查询语义的深层理解。如何将二者结合,同时控制推理步数、token 开销和延迟,是实际部署的关键瓶颈。AI 系统开发者与产品团队对可靠的 agentic retrieval 需求迫切——它既能提升复杂任务的检索质量,又能作为通用组件嵌入各类数据系统,但当前高成本(平均 107.4 秒、764.1K input tokens)阻碍了大规模采用。
行业类比
类似 多智能体软件工程 中,用规划器分解任务并逐步检索代码库:agentic retrieval 相当于给系统装上一个“会思考的搜索层”,让查询不再是单次匹配,而是有策略地探索证据链。
核心洞察
- 核心洞察:agentic retrieval 用 LLM 多轮推理弥补 dense retrieval 的表面语义匹配不足,而不是提升 embedding 质量本身。这与传统 query rewriting 或 hard negative mining 等单一技巧不同,它构建了从检索到反思的完整 ReAct 闭环,从而在复杂任务上获得 nDCG@10 提升 8.7 点,但代价是延迟从 0.67 秒升至 107.4 秒,token 消耗达 764.1K input / 5.8K output 每查询。
- 泛化性洞察:同一 agentic retrieval pipeline 无需按数据集调参,即可在 ViDoRe v3 和 BRIGHT 两个差异显著的榜单上取得 competitive 结果。这挑战了 specialized retrieval 靠单点优化刷榜的做法,说明 agent 的通用决策能力比静态检索器特化更具跨域迁移价值,为构建面向多样场景的检索系统提供了新思路。
方法
方法详解
输入:复杂检索查询,可能包含多约束、隐式意图或需要多跳推理的语义需求。与标准 dense retrieval 相同,不依赖额外标注。
核心模块:
- Retriever 工具:使用固定 embedding model 做向量检索,返回 top-k 候选段落;迭代中可被多次调用,每次接收改写后的查询或子查询。
- LLM Reasoner(ReAct 循环):基于当前候选集与历史上下文,执行 思考-行动-观察:
- 思考:判断候选是否充分覆盖查询意图,定位信息缺口(如缺失实体、需要比较的属性)。
- 行动:选择工具调用,如
rewrite_query、expand_query或multi_hop_subquery。 - 观察:将新检索结果并入候选池,更新状态。
- Reliability Infrastructure:管理最大迭代次数、token 预算、重复结果去重、工具调用重试、异常回退,确保 agent 在长尾查询上也能终止并返回有效结果。
输出:多轮检索结果经融合与重排后的最终排序列表。评测显示,在与标准检索使用相同 embedding model 的条件下,nDCG@10 提升 8.7 点。
与同类方法差异:不同于固定模板的 query rewriting 或多阶段 retrieve-then-rerank 管道,该方法将 LLM 的显式推理与 retriever 的工具化调用置于同一动态决策循环中,可根据实时观察调整后续检索策略。
实验
实验设计
在复杂检索任务上,将 LLM 推理 与 retriever 的高效语料探索结合,构建 ReAct agentic 循环。与标准 dense retrieval 基线对比,使用相同 embedding model,评估效果、泛化性与成本。评测数据集覆盖 ViDoRe v3 与 BRIGHT leaderboards。
关键发现
- agentic retrieval 在 nDCG@10 上提升 8.7 点,证明推理可弥补语义相似度不足。
- 同一 pipeline 在多个 leaderboard 上取得 competitive 结果,显示强泛化性,优于 specialized 方法在 out-of-domain 上的表现。
- 成本显著:平均延迟 107.4 秒 vs 标准检索 0.67 秒;每查询消耗 764.1K 输入 token 和 5.8K 输出 token。
与基线深度对比
标准检索依赖浅层语义匹配,延迟低,适合简单查询;但面对复杂任务(多跳、隐含意图)时,无法通过语义相似度解决。agentic retrieval 通过多步推理、查询重构和迭代探索,效果提升明显,但带来百倍以上延迟和大量 token 开销。这一 trade-off 表明:当前 agentic retrieval 适合离线或非实时场景,未来需在推理效率和成本控制上优化,或选用更高效的开源模型。
行业影响
落地场景
Agentic retrieval 适用于需要多步推理、查询改写与工具调用的复杂信息任务,例如:
- 电商搜索:处理像“适合徒步旅行的轻量帐篷,且能防暴雨”这类多约束商品查询,通过 LLM 分解意图、迭代检索并验证候选商品属性。
- 企业知识库与客服:跨文档聚合证据回答合规、售后等复杂问题,避免仅靠表面语义相关返回碎片化结果。
- 金融研报分析:从大量非结构化 PDF 中提取并关联财务指标、风险事件,生成结构化洞察。
在 ViDoRe v3 与 BRIGHT 基准上,同一 pipeline 均取得 competitive 结果,显示跨领域泛化能力。
商业价值
核心价值在于提升搜索/问答质量,进而转化为用户留存、成交率或人工客服替代率。论文显示 nDCG@10 较标准检索提升 8.7 点,对高客单价电商、专业服务等场景,单次查询质量提升的边际收益远高于额外算力成本。但平均 107.4 秒 延迟与 764.1K input tokens 消耗使其难以直接用于大规模在线低延迟服务。商业部署应引入查询复杂度分级路由:简单查询走标准检索(<1 秒),复杂查询交给 agentic retrieval,在成本与体验间取得平衡。
与现有工作流接口
- 可作为 RAG pipeline 中 retriever 的增强替代,通过 ReAct agent 包裹现有 dense retriever,无需更换底层索引。
- 集成进 LangGraph / LlamaIndex 等 agent 框架,以工具方式暴露检索 API,保持原有 embedding 模型与向量数据库不变。
- 需配套预算控制、超时熔断、结果缓存与可观测性,以应对 token 成本与延迟抖动。
- 建议以离线批处理或异步任务形式接入高价值查询,在线场景仅对 top-K 高风险查询启用。
整体工业落地需关注成本工程优化,例如使用更小模型、缓存中间状态、限制 ReAct 步数等。
局限
- - **成本瓶颈**:论文自身承认 agentic retrieval 平均耗时 **107.4 秒**(标准检索仅 0.67 秒),且每个查询消耗 **764.1K 输入 token** 和 **5.8K 输出 token**,成本高出多个数量级。作者虽在 Discussion 中提出未来优化方向,但未给出任何具体的降本方案或近似策略,这使得该方案目前难以直接用于实时或大规模生产环境,限制了实际工程价值。
- - **实验对比有限**:仅在 **ViDoRe v3** 和 **BRIGHT** 两个基准上评测,主要与标准 dense retrieval 对比,缺少与已有 **agentic 检索系统**(如 Self-RAG、IRCoT)或更复杂的查询重构、多阶段检索基线的系统比较。此外,未分析 LLM 推理在不同查询难度下的失败模式,可能高估了泛化能力的稳健性。
- - **错误传播与模型依赖未讨论**:ReAct 循环中 LLM 生成的子查询或筛选步骤可能产生幻觉或错误分解,错误会累积放大,但论文未报告失败案例或错误传播分析。同时,结果高度依赖所选 LLM 与 embedding 模型的组合,论文未探讨模型规模、温度等超参对性能与成本的影响,难以指导实际选型。