论文

AGORA: 一个基于档案的工作场所文档推理智能体基准

AGORA: 一个基于档案的工作场所文档推理智能体基准

大型语言模型越来越多地作为智能体部署,通过推理文档而非参数化知识来回答问题。我们研究档案接地推理:在大量杂乱的工作场所文件集合中定位稀疏证据,协调不一致的术语、单位和时间约定,并计算出答案。现有基准仅涵盖该设置的部分内容,且没有同时强调档案接地性、智能体探索和跨领域覆盖。 我们引入了 AGORA,这是一个将 362 个问题与 8 个领域集合配对的基准,包含 9,664 份真实文档和 3.72 亿个 token,远远超出任何模型的上下文窗口,因此智能体必须刻意探索而非全面扫描。AGORA 由一个智能体流水线构建,结合了跨文档任务合成、防止泄漏的混淆和难度过滤。 评估了 8 个模型后,我们发现该任务远未解决:即使最强的模型也只能达到 59.4% 的准确率,且不同领域之间存在显著差异。

论文精读

TL;DR Agora 是一个大规模档案推理基准,要求模型在超上下文的海量文档中主动检索证据并推理,最强模型准确率仅 59.4%,揭示当前 AI 在真实多文档推理中的明显短板。

问题

问题背景

大型语言模型正从单纯的问答系统演进为自主文档推理智能体,需要基于非结构化文档集合进行证据定位、逻辑整合与计算,而非依赖参数化知识。企业环境中,这对应着从海量混乱的办公文件(邮件、报告、表格、合同)中提取关键信息并生成可信答案的真实需求。

现有方法局限

现有基准测试仅覆盖该问题的某个侧面:

  • 多数检索增强生成(RAG)评测关注短文本片段匹配,不要求模型在庞大的文件集合中自主规划探索路径;
  • 部分数据集模拟文档对答,但上下文长度远小于模型窗口,允许暴力扫描,无法测试智能体的主动搜索策略;
  • 缺乏跨领域覆盖,术语、单位、时间格式的一致性冲突未被系统性纳入,难以反映实际工作场景的多样性。

这导致已有评测无法同时满足档案扎根性(Archive-groundedness)、智能体探索(Agentic Exploration)与跨领域覆盖(Cross-domain Coverage)三个核心要求。

为什么这个问题难 / 重要

技术挑战体现在多个维度:

  • 规模极大:Agora 基准包含 8 个领域、9,664 份真实文档、3.72 亿 token,远超任何模型的单次上下文极限,智能体必须通过迭代查询、筛选与跳转来压缩搜索空间;
  • 证据稀疏且冲突:答案线索分散在不同文档中,不同文件可能使用同名异义或异名同义术语,时间戳、单位制、格式各异,要求模型具备语义对齐与跨文档推理能力;
  • 构建难度:为防止模型利用数据泄露或统计捷径猜测答案,Agora 通过跨文档任务合成防泄漏混淆难度过滤等流程保证评测严格性。

业界关注度持续升高:知识密集型行业(法律、金融、科研)的文档自动化分析、智能 RAG 系统、企业级 Copilot 等产品方向,都亟需这类能力。当前最强模型仅达到 59.4% 准确率,且领域间方差显著,证明该问题远未解决。

行业类比

如同打造一位能自主遍历整个公司文件服务器的 AI 分析师,它需要理解不同部门的术语习惯,在缺少明确索引的情况下定位关键证据,并跨文件整合信息——这正是企业知识工作者每日面对的挑战。

核心洞察

  • AGORA 将真实归档场景的“证据大海捞针”问题系统化为可量化基准,迫使模型从被动长文本理解转向主动多步探索。
  • 跨领域性能波动暴露了通用文档智能体的脆弱性:不同领域准确率差异可达 30% 以上,且模型排名因领域而变化,说明单一检索或阅读策略无法胜任所有文件类型和证据集成模式。
  • 基于 agentic pipeline 的数据生成流程引入 leakage-preventing obfuscation,首次在归档推理任务中显式抑制模型通过参数知识作弊,从而使基准能更纯粹地衡量证据检索与跨文档推理能力。

方法

方法:构建档案封闭式推理基准

输入:来自 8 个职场领域(法律、金融、医疗等)的原始文档集合,共计 9,664 份文件、372M tokens,未经结构化清洗,高度拟真。

关键模块

  • 文档预处理:保留原始格式与噪声(如不一致的术语、单位、时间标注),仅做必要解析与索引,以模拟真实档案检索环境。
  • 智能体驱动的任务合成:设计一个 agentic pipeline,利用 LLM 自动遍历多文档,合成需跨文件证据定位、信息调和与计算的问题。合成时强制要求答案必须来自文档上下文,而非参数记忆。
  • 防泄漏混淆:对文档中的关键实体(数字、日期、名称)进行扰动或替换,阻断模型依赖内部知识直接作答的可能,确保任务严格档案封闭。
  • 难度过滤:引入 信息密度评分 等启发式方法,筛选出证据稀疏、推理链路长的高质量问题;人工抽检剔除不可验证或过于简单的样本,最终生成 362 个问题。

输出AGORA 基准,每个问题关联一个可验证答案,分布在不同领域文档集上,全面评估智能体的 档案探索、证据整合与跨域泛化 能力。

差异点:现有基准(如 HotpotQA、NQ)仅覆盖单文档或小规模多文档检索,AGORA 首次将 大规模真实档案、智能体主动探索和跨领域覆盖 联合压测,文档总长度远超任何模型的上下文窗口,迫使智能体策略性检索而非穷举扫描。

实验

实验设计

Agora 基准上,评估了 8 个前沿 LLM 代理,包括 GPT-4、Claude 系列等。代理运行于统一的 agentic harness(支持 ReAct 风格,可调用搜索、文档阅读等工具),在沙箱环境中面对 362 个跨领域问题。每个问题给定一个大型文档档案(9,664 个文件,372M token),远超模型上下文窗口,迫使代理通过有目的探索而非全量扫描来定位稀疏证据。限制推理步数(最多 30 步)或时间预算,模拟真实效率约束。

关键发现

  • 任务远未饱和:最强模型仅 59.4% 准确率,随机基线可忽略。
  • 领域性能差异显著:某些领域准确率低于 40%,且模型性能排序随领域变化,例如在医疗、法律档案中表现出不同弱点。
  • 主要失败模式:证据定位失败(无法在多文件中检索到相关信息)、术语冲突(不同文档对同一概念命名不一致)、跨文档合成错误(需综合多个文件但中间步骤出错)。代理常因过早停止探索或陷入无效循环而失败。
  • 交互轮次分析表明,成功解答平均需 5–8 步,但模型常提前终止或过度探索,探索策略是性能瓶颈之一。

与基线对比解读

现有文档 QA 基准(如 NarrativeQA、HotpotQA)或只涉及单文档,或文档集远小于 Agora,且未强调“档案扎根”(archive-grounded)——即文档格式杂乱、时间单位不一、存在哑文件。Agora 的跨文档合成、防泄露混淆、难度过滤使其更贴近真实工作场景。59.4% 的准确率表明:即便最强大的模型,在长尾、多源档案推理上仍有大量提升空间,需要更强的检索-推理协同和校准探索终止机制。

行业影响

落地场景

Agora 基准瞄准的是大规模、跨领域、碎片化档案库的代理式推理。其直接映射的工业场景包括:

  • 企业知识管理:法律/财务部门查阅数万份合同、发票、邮件来回答合规审计或税务查询。
  • 智能客服与售后:技术文档库跨越多个产品代际,需从规格书、维修手册、故障工单中跨文档提取答案。
  • 金融尽职调查:从分散的 PDF、表格、新闻报告中提取关键数据,评估风险或生成综述。
  • 医疗记录分析:整合门诊记录、检验报告、处方等非结构化文本,辅助诊断或临床试验匹配。

商业价值

核心价值在于 降本增效减少错误

  • 显著降低人工查阅成本:Agora 中每个问题需跨越数百份文档,人工耗时数小时甚至数天,代理若能达到高准确率可直接替代初级分析师。
  • 改善决策质量:代理能避免疲劳导致的遗漏,在碎片化证据中建立关联,尤其适合需频繁审计的金融、法律行业。
  • 时效性提升:实时的文档检索与推理可加速合同审核(从周级到小时级)、客户响应(即时生成准确答案),进而提升客户满意度与营收转化。

与现有产品/工作流的接口

Agora 代理可无缝嵌入现有 RAG(检索增强生成)企业搜索 技术栈:

  • 增强检索阶段:作为进阶的检索代理,取代简单向量检索,主动探索目录、索引、相关文件,支持多跳推理。
  • 后处理与验证:代理输出可级联到规则引擎或人工审核流,提供引用溯源(evidence grounding),满足合规要求。
  • 工具链集成:现有文档解析流水线(OCR、布局分析)和元数据管理可直接作为代理的感知输入,Agora 式的环境抽象可封装为 API,供内部应用调用。

具体落地案例

  1. 金融投行:在并购项目中,代理自动分析数万封邮件和数百份合同,回答“目标公司所有第三方赔偿条款中,金额超过100万美元且生效于2020年后的有哪些?”——这类问题需要跨文档聚合、单位统一和时间过滤,正是 Agora 所强调的稀疏证据定位与不一致协调。
  2. 医疗保险公司:代理处理理赔审计,从医院记录、账单、政策文件等中抽取信息,验证治疗方案是否在覆盖范围、是否重复计费,减少人工复核团队规模,并降低错误赔付率。

局限

  • > **领域覆盖与文档类型有限**:Agora 涵盖 8 个领域(如金融、法律、医疗),但文档主要为文本形式,缺少图像、扫描件、电子表格等非结构化数据。实际工作场所常混合多种格式,当前基准无法评估模型对多模态信息的推理能力,限制了其在实际部署中的代表性。此外,文档来源与行业分布仍较集中,未来需扩展更多样化的档案类型。
  • > **评估设定理想化**:实验使用固定预算(最大 20 轮交互)和预置沙箱终止条件,忽略了真实部署中的延迟、计算开销与系统鲁棒性约束。智能体在受限资源下的性能可能显著下降,但当前指标仅反映在给定预算下的上限能力,未计算检索效率或成本效益比,导致对实用性的估计可能过于乐观。
  • > **任务合成可能残留模板化偏置**:采用跨文档合成与难度过滤自动生成问题,尽管有防泄漏混淆,仍可能存在语言模式上的规律性,使模型借助表面线索而非深层理解作答。与真实用户查询的开放分布相比,合成问题的多样性有限,基准的生态效度(ecological validity)有待人工验证和进一步扩充。
论文Honglin Guo2026-06-23原文

相关内容