DR-DCI: 通过动态工作空间扩展扩展直接语料库交互
针对大规模语料库的智能体搜索传统依赖检索中介接口(如 BM25 或 ColBERT)进行可扩展候选发现。这些接口虽能有效排序相关文档,但仅以排名结果或受限文档视图呈现证据,限制了智能体重新组织素材和跨文档验证约束的能力。直接语料库交互 (DCI) 通过暴露可 shell 执行的语料库操作(搜索、过滤、比较、验证)解决了这一问题,但全语料库终端命令随语料库增长而变慢且不稳定。 我们提出 DR-DCI,一种检索引导的 DCI 框架,将检索视为智能体可调用的动作,用于扩展本地工作空间。智能体不再直接操作全语料库,而是动态将相关文档拉入逐步演进的工作空间,并在其中执行 DCI 操作。该设计结合了检索层面的召回与 DCI 风格的精确性:检索保证探索的可扩展性,DCI 保留局部操作以实现有效证据解析。 实验表明 DR-DCI 在不同规模下均有效且高效。在 Browsecomp-Plus 上,DR-DCI 达到 71.2% 准确率,相比原始 DCI 和消融变体提升最多 8.3 个点,同时减少工具使用、墙钟时间和估计成本。结合工作空间保留的上下文重置,准确率进一步提升至 73.3%。在语料库扩展实验中,DR-DCI 在 100K 到 10M 文档范围内保持有效,而原始 DCI 不稳定,BM25 表现明显更差。DR-DCI 还能扩展到 20M 规模的每个文档一个文件的 Wiki-18 QA 设置,在六个基准上平均得分 63.0,优于基于检索和训练的搜索智能体基线。消融分析进一步表明,排名预览和文档间 DCI 是性能的关键。
论文精读
TL;DR DR-DCI 框架通过动态拉取相关文档到本地工作空间,将检索的召回能力与直接语料交互的精确操作相结合,在大规模语料上实现可扩展且高效的智能体搜索,显著提升 BrowseComp-Plus 等基准准确率。
问题
智能体搜索(agentic search)在处理大规模语料时,通常依赖 retriever-mediated interfaces(如 BM25、ColBERT)进行可扩展的候选文档发现。这些方法虽能高效排序相关文档,但仅将证据暴露为排序结果或有界文档视图,限制了智能体重新组织材料、跨文档验证约束和灵活执行查询的能力。
Direct Corpus Interaction (DCI) 通过暴露 shell 可执行的全语料操作(如 grep、awk、diff 等)解决了上述局限,允许智能体进行自由搜索、过滤、比较和验证。然而,随着语料规模增长,在全体语料上直接执行终端命令会变得缓慢且不稳定,严重影响性能与效率。
该问题的核心挑战在于如何兼具检索级(retriever-level)的召回可扩展性与DCI 级的精确操作能力。简单叠加无法解决上下文窗口膨胀和执行延迟问题。业界对能够进行复杂多步推理、证据综合和事实核查的智能体搜索需求日益增长,尤其在需要高准确性和可验证性的应用场景(如医疗证据审查、法律文书分析、科研文献综合)中,这一矛盾尤为突出。
这类似于一名研究员在大型图书馆中寻找特定信息:直接翻阅所有书架(全语料 DCI)极其低效;先通过索引系统(检索)圈定相关书籍,再在书桌上(本地工作区)仔细对比、交叉验证书中的细节,才是可行之策。
核心洞察
- 动态工作区扩展从根本上解决了全语料直接交互的可扩展性瓶颈。原始 DCI 虽然提供了灵活的证据操作能力,但在大规模语料上执行终端命令会随文档增长变得缓慢且不稳定,导致实际工程中不可用。DR-DCI 将检索视为代理可调用的动作,按需将相关文档拉入本地工作区,使得后续的搜索、过滤、比较和验证操作仅在局部进行,既保留了 DCI 的精确重组能力,又借助检索器的召回保持了探索的高效性,二者结合在 10M 至 20M 文档规模上展现出稳定的性能,为构建大规模可扩展的代理搜索系统提供了新思路。
- 排序预览与文档间 DCI 的组合是提升代理搜索有效性的关键工程选择。消融分析表明,提供排序预览能让代理快速获得文档相关性的先验信息,避免无效探索;而文档间 DCI 允许跨文档的约束验证和证据合成,弥补了纯检索式接口只能孤立展示文档的缺陷。这种设计在 BrowseComp-Plus 上将准确率推至 71.2%,相比消融变体最高提升 8.3 个点,同时减少了工具调用次数和推理成本,为实用化的智能搜索管线提供了明确的优化方向:赋予代理对证据的组织权和跨文档比较能力,比单纯增强检索质量更为关键。
方法
输入与问题设定
Agent 需要在大型语料库(10 万至千万级文档)上完成复杂事实核查、多步推理与约束验证任务。传统方案依赖检索器(BM25、ColBERT)返回排序片段或有限视图,虽然可缩放,但 Agent 无法自由重组、跨文档比对和验证。原始 DCI (Direct Corpus Interaction) 将语料库暴露为可执行 Shell 命令(grep、awk、diff 等),提供最大灵活性,但全量操作随规模增长迅速变慢且不稳定。
关键模块
1. 动态拉取接口 (Dynamic Pull Interface)
将检索器封装为 Agent 可调用的 pull 动作。Agent 用自然语言查询拉取相关文档,检索器返回排序预览(ranked previews),Agent 据此选择部分文档拉入本地工作区。工作区按需增量扩展,避免一次加载过多无关内容,兼顾召回率和上下文效率。
2. 工作区 DCI (Workspace DCI)
本地工作区内提供两类终端操作:
- 跨文档 DCI:跨多个文件执行 grep、对比、统计等,实现证据冲突检查与聚合。
- 文档内 DCI:用段落级命令(如
head,tail, 行号查看)精确审阅单篇证据。
所有操作仅面对子集语料,显著降低命令延迟与输出噪声。
3. 上下文保留重置 (Workspace-Preserving Context Reset)
多轮交互中上下文窗口可能溢出。此机制允许重置对话历史,但保留工作区文件内容,使 Agent 能基于已收集的文档继续推理,无需重新拉取,提升长序列任务稳定性。
4. 终端感知工作区接口
工程层面优化:硬链接物化避免复制、统一扁平文件名、对超长单行文档选择性重排、截断输出并返回(truncated)提示,确保 Agent 可靠解析命令结果。
输出与差异
Agent 在受限但灵活的工作区内产出最终答案,兼具检索级召回与 DCI 级精确操作。与 RAG 或纯检索链相比,DR-DCI 允许随意组合验证操作,不局限于排序片段;与全量 DCI 相比,通过动态工作区保持大规模下的高效与稳定。在 BrowseComp-Plus 上达 71.2% 准确率,较原始 DCI 提高 8.3 点,工具调用次数与 wall-time 显著减少。
实验
实验设计
论文围绕 DR-DCI 框架设计了三个层次的实验:
- 效果与效率验证:在 BrowseComp-Plus 长文本 QA 上对比 raw DCI、消融变体及多种检索式搜索代理,同时记录工具调用次数、挂钟时间和估算成本。
- 受控规模压力测试:在 BCP-100 数据集上,将语料从 100K 逐步扩展到 10M 文档,观测不同框架(raw DCI、BM25-only、DR-DCI)的稳定性和效果衰减。
- 外部大规模验证:在 Wiki-18 QA 设置下,将每篇文档存储为独立文件,构建 20M 级文件系统,与检索基线和经过训练的搜索代理进行 6 个子基准的比较。
所有实验均使用相同的终端基础环境和语言模型,以保证公平。
关键发现
- DR-DCI 显著优于无检索的全量 DCI:在 BrowseComp-Plus 上达到 71.2% 准确率,最多比 raw DCI 和消融变体高出 8.3 个百分点,同时工具调用次数、挂钟时间和估算成本均下降。
- 上下文重置进一步稳定性能:引入 workspace-preserving context reset 后,准确率提升至 73.3%,表明有选择地压缩上下文能缓解长轨迹中的 agent 漂移。
- 规模适应性极强:在 BCP-100 上,DR-DCI 在 100K 到 10M 文档的范围内保持有效,而 raw DCI 随着规模增大变得不稳定、BM25-only 性能大幅下滑。
- 跨数据集泛化:在 20M 文件的 Wiki-18 上,DR-DCI 平均得分 63.0,超过所有检索式和训练过的搜索代理基线,验证了其在大规模真实场景中的实用性。
- 消融关键组件:ranked previews 和 inter-document DCI 是性能的核心驱动力,缺失它们导致明显退化。
与基线的深度对比
传统检索式代理(如基于 BM25 或 ColBERT)仅暴露排序后的有限视图,缺乏跨文档重组和约束验证能力,容易错过需要多文档对齐的深层证据。Raw DCI 虽提供 shell 级灵活操作,但直接在全量语料上运行终端命令,延迟极高且易因噪音或过长输出导致 agent 迷失。DR-DCI 的创新在于将检索建模为 agent-callable action:agent 动态拉取相关文档到本地 workspace,再执行 DCI 操作。这形成了一种 “检索保 recall、DCI 提 precision” 的混合范式:检索阶段快速扫描全局,DCI 阶段在受限高相关子集内精细挖掘和验证。实验数据表明,这种解耦使 agent 在保持与全量 DCI 相当甚至更高效果的同时,大幅削减了不必要的工具调用和上下文开销,在可扩展性和任务成功率之间找到了工程最优解。
行业影响
落地场景
DR-DCI 将检索器的可扩展性与直接语料库交互的灵活性结合,适合需要跨文档证据综合与验证的场景:
- 企业知识管理:代理从海量内部文档(如 Confluence、SharePoint)中动态拉取相关资料,在工作区内执行搜索、过滤、比对,生成精准答案。
- 合规审计:对合同、政策文件进行跨文档一致性检查,自动验证条款冲突或缺失。
- 电商内容治理:从数百万商品描述中检索相关条目,核查是否存在夸大宣传或违规信息。
- 医疗/法律研究辅助:在临床试验报告、判例库中提取和对比证据链,加速综述和尽职调查。
商业价值
- 降本:减少人工信息整合时间;在 BrowseComp-Plus 上,DR-DCI 较原始 DCI 降低工具调用次数、耗时与估计成本达 8.3 个百分点,且随语料库规模从 10 万扩至 1000 万文档,依然稳定有效,避免了全库直接操作的高昂开销。
- 增收:提升搜索类产品或对话式 AI 的回答可靠性,增强用户信任与粘性,驱动订阅或使用量增长。
- 体验提升:通过工作区内可验证的本地操作,减少模型幻觉,输出更可审计。
与现有产品/工作流的接口
DR-DCI 可作为 RAG 管道增强层 或 代理工具集 集成:
- 与向量数据库(如 Pinecone、Weaviate)或稀疏检索器(BM25、ColBERT)搭配,作为第一级召回后第二级精确解析的组件。
- 在 LangChain、AutoGen 等代理框架中封装为 Agent-callable Action,提供
pull、grep、diff等标准终端命令,代理根据任务动态扩展本地工作区。 - 支持通过 API 或微服务部署,输入查询和语料库索引,输出结构化的证据结果,无缝嵌入现有搜索栈。
具体落地用例
- 全球电商合规扫描:某大型电商平台需确保商品描述符合多国广告法。代理动态拉取相关法律文档与商品候选集,在工作区内批量运行正则匹配和差异对比,自动标记高风险商品,将审核效率提升数倍。
- 制药文献元分析:研究人员分析某类药物副作用时,DR-DCI 从 PubMed 等语料中检索潜在相关报告,在工作区内执行跨文档频率统计和共现分析,辅助生成系统综述,缩短研究周期。
局限
- **动态拉取机制依赖初始检索器质量**,若 BM25/ColBERT 在第一轮漏检强相关文档,后续 DCI 操作可能永远缺失必要证据,且论文未针对检索器失效场景设计补救策略,这在高专业化或低频术语查询时风险较大。
- **实验覆盖的任务类型有限**,仅在 BrowseComp-Plus(多跳验证)与 Wiki-18(文件级 QA)上评估,缺少对长文本生成、结构化数据推理等任务的支持,也未讨论在跨语言或异构语料上的泛化能力。
- **工作空间上下文重置虽然提升准确率,但引入额外推理与存储开销**;论文未量化该机制在大规模并发或长会话下的性能损耗,也未比较与持续的上下文压缩方案的效率差异。