论文

Beyond Monolingual Deep Research: 使用 Cross-Lingual BrowseComp-Plus 评估智能体和检索器

Beyond Monolingual Deep Research: 使用 Cross-Lingual BrowseComp-Plus 评估智能体和检索器

当前深度研究智能体的评估主要集中于单一语言环境,即用户查询与支持证据使用相同语言。然而,真实场景中相关证据可能以不同语言出现。为此,我们提出 XBCP (Cross-lingual BrowseComp-Plus),一个受控基准,它保留 BrowseComp-Plus 的英文问答空间,但改变支持文档的语言。 XBCP 包含两种互补设置: - 跨语言设置:每个查询与单一指定语言的证据配对。 - 多语言设置:完整证据语料库在 12 种语言(涵盖高资源和低资源语言)中均匀随机分布。 我们使用稀疏和密集多语言检索器评估四种深度研究智能体,测量答案准确率、证据召回、搜索行为、校准、引用忠实度和神谕检索。结果表明,当证据被翻译时,性能显著下降。即使是强大的密集检索器也会丢失证据召回,智能体校准变差,引用可靠性降低。值得注意的是,即使直接提供所有黄金证据,准确率仍然较低。这些发现表明,跨语言深度研究暴露了检索失败和智能体端对语言不匹配证据整合的独立困难。

论文精读

TL;DR 构建跨语言深度研究基准 XBCP,量化揭示检索与代理推理的双重瓶颈:证据语言不匹配导致准确率大幅下降,即使提供完美证据仍难恢复。

问题

当前,深度研究代理 因能自动搜索证据、综合推理并生成有依据的答案而备受关注,但其评估主要局限于查询与证据同语言场景。

现有基准如 BrowseComp-Plus 假设用户查询与支持文档均为英文,忽略了真实 Web 语料的多语言异构本质。多语言检索器 虽可处理多种语言,但跨语言证据的召回与利用从未被系统评测。这导致我们无法回答:当 Agent 用英文提问,而关键证据以他种语言存在时,系统是否仍然可靠?这种单语假设严重削弱了研究代理在全球化知识工作中的实用性。

跨语言评估的难点在于双重瓶颈:检索侧,语言鸿沟会降低稠密检索的 证据召回率,并使 Agent 的置信度校准恶化;代理侧,即使通过 Oracle 检索 直接提供所有黄金证据,答案准确率依然无法恢复到单语水平,且引用忠实度同步下降。这表明,跨语言证据的整合并非仅靠提升检索即可解决,Agent 自身的推理架构也需要适应语言不匹配的信息。在 12 语种分布的 多语言设置 下,问题更为突出,对检索与推理构成复合挑战。

这类似于构建一个全球化研究助手:当用户用英文查询“深度学习硬件市场趋势”,关键报告若以韩文或法文发布,系统必须能无缝发现、对齐并综合这些信息,否则将遗漏重要结论。

核心洞察

  • 跨语言深度研究存在 agent 侧瓶颈:即使通过 oracle retrieval 直接提供所有相关证据,agent 的答案准确率仍显著低于单语基线。这表明问题不仅出在多语言检索的召回损失,更在于 agent 自身难以有效整合语言不匹配的证据。与以往仅关注检索质量的工作不同,该洞察将瓶颈定位在 agent 的推理与合成环节,为后续优化指明了新方向。
  • 多语言场景下 agent 的校准度和引用忠实性大幅下降:在 XBCP 的跨语言与多语言设定中,agent 的输出置信度与实际正确率脱节,且生成的引用更易出现无关或捏造内容。这与单语设定中相对可靠的行为形成鲜明对比,暴露出当前 deep research agent 在信息不确定时会采用不可靠的策略,对跨语言搜索系统的可信部署构成直接挑战。

方法

XBCP 基准构造方法

输入取自 BrowseComp-Plus 的英文问答对,并将所有证据文档通过受控翻译管道转化为目标语言,同时严格保留原始语义和事实信息。翻译采用通用机器翻译模型,并针对每种目标语言执行分段、翻译、对齐流程。随后进入质量验证模块,依据预设评分标准(如忠实度、流畅性)进行人工抽样校验,确保翻译不引入事实扭曲或漏译,仅保留通过验证的高质量句段。

在此基础上,XBCP 生成两种互补的评估设定:

  • 跨语言设定:每个查询的证据统一分配给某一指定语言,形成查询与证据一对一的语言错配。
  • 多语言设定:将所有证据文档等量随机分配给 12 种高低资源语言,构建混合语言语料库,模拟真实场景下的语言多样性。

最终的输出是一个严格控制的基准,包含英语查询、英语答案,以及对应语言版本的证据文档,并配套自动化评估脚本,可测量 agent 的端到端准确率、证据召回率、搜索行为、置信度校准、引用忠实度等指标,甚至支持 Oracle 检索(直接注入 gold 证据)以孤立分析 agent 的跨语言推理瓶颈。

与同类方法的关键差异:现有浏览基准默认查询与证据语言一致,而 XBCP 通过系统性地引入语言变量,首次将跨语言检索性能与 agent 自身整合异语言证据的能力解耦,揭示了即使获得完美检索结果,agent 仍存在独立的跨语言推理困难。

实验

实验设计

研究构建了 XBCP (Cross-Lingual BrowseComp-Plus) 基准,将原 BrowseComp-Plus 的英文问答空间保留,而将支撑文档翻译为 12 种高资源与低资源语言。实验涵盖两个互补场景:

  • 跨语言设置 (Cross-lingual):每个查询的黄金证据被统一翻译为单一指定语言。
  • 多语言设置 (Multilingual):整个证据语料按均等比例随机分配到 12 种语言中。

评估对象为四个深度研究智能体,搭配稀疏与密集多语言检索器。度量维度包括答案准确性、证据召回率、搜索行为、置信校准、引用忠实度以及 Oracle 检索(直接提供黄金证据时的表现)。

关键发现

当证据语言与查询不一致时,智能体性能出现显著退化:

  • 即使是强大的密集检索器,证据召回率也大幅下降。
  • 智能体的置信校准变差,对检索结果的引用可靠性降低。
  • 在 Oracle 检索条件下(直接给黄金证据),答案准确性依然低于单语基线,揭示出智能体自身在整合语言不匹配证据时的独立困难。

与基线对比

基线为原始 BrowseComp-Plus 下的单语表现。跨语言环境下,所有智能体-检索器组合的指标均明显下滑,且该退化无法仅归因于检索失败——智能体推理端的跨语言证据整合同样是瓶颈。这表明多语言深度研究系统需要同时改进检索跨语言对齐和智能体推理泛化能力。

行业影响

落地场景

XBCP 暴露的跨语言深度研究缺陷,直接冲击全球化信息密集型产品:

  • 多语言智能客服:客户以母语提问,而知识库文档为英语或其他语言,代理需跨语种整合答案。
  • 跨境电商与市场调研:商品描述、评论、政策文件散布于多语种网页,代理需可靠抓取并引用外语文档。
  • 跨国企业知识管理:内部 wiki、合同、技术文档常以来源语言存储,检索系统应无视语种差异。
  • 学术与法律引擎:研究者用英语查询,需阅读法文、德文等原文证据,引用精度直接影响结论可信度。

商业价值

  • 降本:自动化的跨语言证据合成可减少人工翻译和多轮搜索的人力开销。当代理能准确检索外文资料时,无需维护全语种平行知识库,降低内容本地化成本。
  • 增收:打破语言壁垒可触达非英语市场,例如全球电商平台用单一英文问答界面服务多语种商品信息,扩大用户群体。
  • 体验提升:可信的跨语言引用和校准度提升用户对 AI 搜索的信任,减少因语言不匹配导致的无效结果,提升留存率。

与现有产品/工作流接口

当前主流 RAG 流水线通常假设查询与文档同语种。集成 XBCP 式的跨语言评估与改进需:

  • 检索层:替换或并联稀疏/密集多语言检索器(如 mE5BGE-M3),并在向量存储中保留多语种 embedding。
  • 代理层:引入语言感知的提示策略,明确告知文档语种,或加装轻量翻译模块作为回退。
  • 评估层:增加证据召回率跨语言校准度引用保真度等指标,持续监控多语言性能退化。

具体落地案例

  1. 全球开发文档问答平台:某科技产品面向全球开发者,文档以英文撰写,但用户以日语、西班牙语提问。该平台集成多语言检索器与深度研究代理,直接从英文原文中抽取证据并生成带引用的回答,避免因翻译文档滞后或缺失导致信息过时。当代理校准度低时,界面自动提示“答案基于英文原文档”,让用户自行判断。
  2. 跨国制药情报引擎:医疗监管报告、临床试验数据常以原始语言发布。情报分析人员用英文查询“最新药物相互作用”,代理需召回德语、中文等语种报告,并精确引用段落。该产品通过 oracle retrieval 分析发现代理整合异语证据的能力瓶颈后,在推理阶段引入多步自我核查,显著降低引错率,提升分析报告的专业可信度。

局限

  • **翻译引入的泛化偏差**:XBCP 通过**机器翻译**将英文证据转换为 12 种目标语言,以维持问答空间的封闭性。但翻译过程可能**引入人为的流畅性、术语一致性偏差**,使证据语言并非真实的多语言原生文本,导致检索难度和代理整合难度的评估与真实跨语言场景存在差异,尤其可能**低估低资源语言的噪声和语码混杂**问题。
  • **代理与检索器覆盖有限**:实验评估仅纳入 **4 种深度研究代理**和有限的**稀疏/稠密多语言检索器**组合。未涵盖基于大语言模型(LLM)自身的检索增强生成(RAG)管道、混合检索策略或最新的多语言重排序模型,也未分析不同代理架构(如**思考-行动-观察循环**的实现差异)对跨语言瓶颈的敏感性,结论的**通用性受限**。
  • **未提供缓解策略或改进路径**:论文揭示了跨语言场景下检索召回下降、校准恶化、引用保真度降低等瓶颈,但**未提出任何针对性的缓解方法**,如跨语言查询扩展、对齐训练或证据集成策略。作为基准工作,尽管问题定义清晰,但缺少对**工程优化的指导方向**,降低了即时应用价值。
论文Yuheng Lu2026-06-13原文

相关内容