论文

AgenticDataBench:数据智能体的综合基准

AgenticDataBench:数据智能体的综合基准

数据科学旨在从异构原始数据中提取可操作的洞见,释放现代社会海量数据生成的价值。自动化这一过程对于减少数据科学家的劳动密集型工作并实现可扩展的数据驱动应用至关重要。近年来,基于大语言模型(LLM) 的数据智能体成为自动化数据科学工作流的有前景解决方案。然而,该领域缺乏全面的基准,难以在多样化场景下以细粒度严格评估这些智能体。 为填补这一空白,我们提出AgenticDataBench,一个涵盖多领域真实任务且带有细粒度真实标签的综合基准。首先,我们从15个垂直领域收集真实数据集与任务,包括来自一家领先金融科技公司的5个B2B实际用例。其次,为消除真实任务中的冗余并生成高质量任务,我们引入数据科学技能(即重复的数据中心操作模式),并通过技能对齐的层次聚类从Stack Overflow大规模任务解决方案中提取代表性技能,量化基准覆盖率。第三,对于真实业务任务,我们选择技能组合多样性最大的任务-解决方案对,确保实际场景的广泛覆盖。第四,针对缺乏真实任务的领域,我们提出基于LLM的系统化任务生成方法,依据技能创建工作流与任务。最后,利用注释基准与开源测试平台评估最先进的数据智能体,提供详细的技能级洞见。

论文精读

TL;DR AgenticDataBench 是一个覆盖 15 个垂直领域、基于技能对齐聚类构建的细粒度数据代理基准,首次将真实 B2B 场景与合成任务结合,支撑技能级别的可解释评估。

问题

问题背景

数据科学工作流自动化正成为 LLM 应用的前沿方向。数据 Agents(基于大模型的智能体)能够处理异构原始数据并生成可执行的洞察,有望大幅降低数据科学家的人工投入,加速数据驱动决策。

现有方法的局限

当前评估数据 Agents 的基准存在明显短板:

  • 领域覆盖窄:多数基准仅涉及少数公开数据集(如 TPC、Kaggle),缺乏来自金融、医疗等垂直行业的真实业务场景,难以反映实际生产环境下的任务多样性。
  • 粒度粗糙:仅以端到端任务成功率或简单的答案匹配作为指标,无法精确定位 Agent 在数据清洗、特征工程、建模选择等子环节的具体表现,导致调试和优化缺乏方向。
  • 任务设计同质化:现有任务多由人工编写,容易引入偏好且难以系统覆盖所有数据操作模式,造成评估偏差。

难点与重要性

构建高质量基准面临双重挑战:

  1. 真实性与可控性的平衡:真实企业任务虽具备高保真度,但常含冗余且难以扩展;合成任务则易损失真实世界的复杂噪声。
  2. 技能维度的全面量化:数据科学操作可抽象为一系列可复用的数据中心化技能(如时间序列聚合、缺失值插补),缺乏对这些技能的显式建模,基准就无法衡量 Agent 在多维能力上的分布。

这一问题之所以关键,是因为业界对稳定、可信赖的数据 Agent 需求迫切。例如在 B2B 金融场景中,Agent 的微小错误可能导致重大业务损失。只有通过覆盖 15+ 领域、包含细粒度技能标签的基准,才能系统诊断 Agent 的短板,推动其从实验室走向生产环境。这类似于自动驾驶领域需要覆盖各种路况的仿真测试套件,数据科学也需要一个标准化的技能覆盖评测框架。

行业类比

好比软件工程中 CI/CD 流水线通过单元测试与集成测试保证代码质量,数据科学同样亟需一套特征与操作全覆盖的测试集,以验证 AI 驱动的自动化分析能否真正可靠交付。

核心洞察

  • AgenticDataBench 引入**基于技能的细粒度评估框架**,将数据科学工作流分解为可量化的操作模式。与大多数基准仅关注端到端任务成功率不同,该工作从 Stack Overflow 大规模方案中提取技能,并以此作为标注与覆盖度度量单位,能够定位代理在特定数据处理环节(如数据清洗、特征工程)的薄弱点,为模型改进提供直接诊断信号。
  • 通过融合**来自金融科技的真实 B2B 用例**并依据技能构成最大化任务多样性,该基准避免了合成任务与真实场景的分布偏移。相比仅使用开放数据集或简单脚本生成任务的基准,AgenticDataBench 的构建流程确保了任务集在领域、复杂度、操作链路三个维度上的高覆盖,使评估结果对生产环境中的实际效能更有指示意义。

方法

AgenticDataBench 的构建遵循 数据收集 → 技能建模 → 任务精选与生成 → 细粒度标注 的流水线。

首先从 15 个垂直领域(含 5 个来自头部金融科技公司的 B2B 实际用例)收集真实数据集和任务描述,同时从 Stack Overflow 的大规模数据科学问答中提取任务-解决方案对,作为技能建模的基础。

关键模块包括:

  1. 技能提取与对齐:对 Stack Overflow 提取的解决方案,应用 技能对齐的层次聚类(skill-aligned hierarchical clustering),识别出可复现的 数据中心操作模式(data-centric operational patterns),即“技能”。每项技能对应一种标准化的数据处理动作(如清洗、聚合、特征工程等),并以此量化基准的技能覆盖度。
  2. 任务多样性最大化:对于已有真实业务数据的场景,用一个 技能组成多样性指标 筛选任务-解决方案对,优先保留组合变异度最高的子集,使基准广泛覆盖实际工作流中的技能组合。
  3. 基于 LLM 的任务生成:对于缺少真实数据的领域,设计系统化的 LLM 驱动任务生成 流程,以技能为约束,合成贴近现实的多步数据科学工作流和任务实例,弥补领域缺口,并保证生成任务在技能层面的合理性。
  4. 细粒度标注:为各任务产出层级化真实标签(如中间表、最终答案、操作序列),支持对数据代理进行细粒度(步骤级/技能级)评估。

最终输出是 AgenticDataBench:一个涵盖多领域、细粒度标注且技能覆盖可量化的数据代理评测基准。

与同类方法的差异点:不同于仅堆砌任务数量的基准,AgenticDataBench 通过 技能驱动的覆盖度框架LLM 辅助的缺失领域补全,首次实现了对数据代理从原子操作到端到端工作流的系统性、可解释评估。

实验

实验设计

AgenticDataBench 的构建分为四步:

  1. 领域数据收集:从 15 个垂直领域(含金融科技 B2B 场景)收集真实数据集与任务,确保领域多样性。
  2. 技能提取与覆盖量化:基于 Stack Overflow 大规模解决方案,通过技能对齐层次聚类提取代表性数据科学技能,并依此量化基准的技能覆盖度。
  3. 任务择优:选择使技能组合多样性最大化的真实任务-解决方案对,避免冗余。
  4. 合成任务生成:对缺乏真实数据的领域,基于技能图谱用 LLM 生成逼真任务。

评估框架支持细粒度技能级诊断,可分解任务到具体技能步骤,度量智能体在每个技能上的表现。

关键发现

  • 真实商业场景挑战性显著:金融科技 B2B 任务因数据异构与领域逻辑复杂性,导致 SOTA 数据智能体成功率远低于公共数据集任务。
  • 技能短板暴露:智能体在数据清洗领域知识注入环节失误集中,而简单的探索性分析表现较好。
  • 覆盖广度带来诊断价值:技能驱动设计使基准能指出智能体在哪些具体操作模式(如时间序列对齐、跨表关联)上不足,为优化提供明确方向。

与基线对比解读

相较于仅关注端到端成功率的传统基准,AgenticDataBench 的技能级标注真实业务用例填补了细粒度评估的空白。即使某些智能体在公开数据集上得分相近,在 AgenticDataBench 的 B2B 子集上性能分化显著,表明领域多样性技能组合复杂度才是当前数据智能体的主要瓶颈。此外,通过分层聚类获取的技能标签比人工定义更客观、可扩展,使基准易于更新拓展。

行业影响

落地场景

AgenticDataBench 作为首个按技能维度精细评估数据代理的基准,直接服务于自动化数据科学产品。典型的应用包括:

  • 企业级数据分析平台:如 BI 工具(Tableau、PowerBI)可集成数据代理,实现自然语言到自动建模、可视化生成的全流程自动化,AgenticDataBench 用于评估代理在异构数据源上的鲁棒性。
  • AutoML 与 MLOps 工具:在流水线中嵌入数据代理,完成数据清洗、特征工程等步骤,基准帮助量化代理对不同数据操作模式的掌握程度。
  • 垂直行业解决方案:例如金融反欺诈系统,需要从多表日志中自动提取特征并训练模型;电商推荐场景下,代理可自主完成用户行为分析、A/B 测试设计。

商业价值

  • 降本:通过量化代理的薄弱技能(如对时间序列的聚合操作),企业可针对性优化,减少人工补位成本。基准的细粒度技能标签直接定位性能短板,避免全量回归测试的资源浪费。
  • 加速洞察交付:对于缺乏数据科学团队的中小企业,嵌入式数据代理能基于自然语言指令在数分钟内产出分析报告,AgenticDataBench 可帮助选择最适配的代理模型。
  • 风险管理:在金融、医疗等强监管领域,基准覆盖的真实 B2B 用例(如 fintect 公司提供的反洗钱任务)可作为合规验证套件,降低代理误判导致的业务风险。

与现有产品/工作流的接口

基准的设计明确考虑了集成路径:

  • 评估即服务:开源的测试床(testbed)支持通过 API 接入自有代理,返回技能级得分,可直接嵌入 CI/CD 管线,作为发布闸门。
  • 与数据栈兼容:任务基于真实数据集(覆盖 15 领域),格式与 Pandas、Spark 等 DataFrame 操作一致,代理可直接利用现有工具链。
  • 技能驱动的任务生成:对于垂直领域缺少真实任务的情况,基准提供的 LLM-based task generation 方法可作为模板,快速为内部数据仓库生成评测用例,降低构建自定义基准的门槛。

具体落地 Use Case

  1. 金融风控平台:集成 LLM 数据代理 后,分析师输入“从过去三个月交易日志中找出异常转账模式”,代理自动联合多个表、处理缺失值并输出特征重要性排序。使用 AgenticDataBench 评估代理在 joingroupby 等技能的表现,确保在反洗钱场景下的可靠性。
  2. 电商推荐系统优化:运营人员要求“分析用户点击序列,提取高价值会话特征”,代理独立完成数据聚合与窗口函数操作。基准中的 time-seriesranking 技能指标帮助平台筛选出在序列建模任务上表现最优的代理版本。

局限

  • **技能覆盖偏差**:基准构建从 Stack Overflow 提取技能模式,虽覆盖了常见数据操作,但高度依赖问答社区,可能遗漏非编码类实践(如数据治理、合规处理)或高度专业化领域的深度技能。实际数据科学工作常涉及脏数据清洗、跨系统集成和隐私限制,基准中任务可能简化了这些约束,导致代理在真实环境中的表现被高估。
  • **生成任务的可靠性**:对于缺乏真实任务的领域,采用 LLM 自动生成工作流与任务。然而,生成的质量受限于 LLM 自身的数据分布,可能引入幻觉或偏向模型友好的模式,缺乏真实业务场景中的噪声、边缘案例和突发需求。由此评估的结果无法完全反映代理面对未知复杂任务时的鲁棒性,影响基准的生态效度。
  • **评估维度的单一性**:当前评估聚焦于任务完成准确度,忽略了资源效率(如 token 消耗、延迟、计算成本)和安全性指标,而这些是实际部署决策的关键。此外,基准固定了任务与答案,随着数据代理快速迭代,恐怕迅速过时;缺乏持续更新机制和对抗性样本的纳入,限制了长期指导价值。
论文Zhaoyan Sun2026-07-02原文

相关内容