Databricks 现场竞赛评测 AI Agent 泛化能力
现场竞赛证明,AI Agent 在文档推理上的性能提升能泛化到新语料,但顶尖系统也仅解决约六成问题,余量巨大。
Databricks 举办首届 Grounded Reasoning Cup,邀请 11 支学术团队在全新企业文档语料库上实时测试 AI Agent。Stanford 以 63.3% 准确率夺冠,比团队平均水平高 22 个百分点。竞赛揭示:文档预处理、定向检索和验证步骤比单一模型调用更重要,但仍有 18.8% 问题无人解决。
正文摘录
顶尖学术团队如何在现场竞赛条件下构建出能泛化到新企业文档语料库的 AI Agent。 今年,Databricks 举办了首届 Grounded Reasoning Cup,这是一场史无前例的现场 AI 竞赛,旨在评估 AI Agent 对复杂企业级文档集合进行推理的能力。通过在现场竞赛条件下、基于新发布的语料库来测试 Agent,Grounded Reasoning Cup 旨在帮助回答 AI 评测中最困难的问题之一:在基准测试上的性能提升,能在多大程度上泛化到类似的真实世界任务? 这场竞赛汇集了来自美国和加拿大的 11 支顶尖学术团队,并为他们配备了来自 OpenAI、Anthropic 和 Google DeepMind 等前沿实验室的资源与指导。在为期两个月的时间里,各团队在我们旗舰级的 grounded-reasoning 基准(基于文档证据的推理)OfficeQA 上开发和优化他们的 Agent,该基准旨在反映具有经济价值的企业工作流程。比赛当天,这些团队需要将他们的系统实时应用到一个全新发布的 grounded-reasoning 基准 OfficeQA Pro V2 上,以检验他们的改进是否能够泛化。 Stanford 凭借一个达到 63.3% 准确率的系统获胜,超出团队平均水平约 +22 个百分点,超出前沿 Agent 离线基线平均约 +35 个百分点。顶尖团队通过文档预处理、定向检索、并行 Agent、结构化工具使用和验证展示了显著的收益。与此同时,18.8% 的问题没有被任何团队解决,凸显出企业级基于文档证据的推理仍有大量提升空间。