论文

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

真实世界的数据科学涉及长时间跨度的工作流,涵盖数据清洗、探索、建模、可视化和验证,并需要在真实操作环境中协调使用笔记本、IDE、终端、浏览器和数据库等工具。然而,现有基准缺乏真实计算机交互,且不评估智能体能否在真实计算环境中执行完整的端到端数据科学工作流,无法捕捉数据科学实践的多阶段、多工具性质。 我们提出 DSAgentBench,这是首个在真实计算机环境中评估智能体自动化完整数据科学工作流能力的基准。DSAgentBench 包含 275 个多样化任务,覆盖整个数据科学生命周期,反映了实践中的复杂性和工具协调要求。每个任务要求基于中间输出进行决策并协调使用工具,同时配备一个确定性评估器,用于验证分析正确性、视觉输出和模型性能,而不仅仅是代码执行。 我们使用 15 个闭源和开源模型进行了广泛实验,结果显示即使最强的智能体 Claude-4.6-Sonnet 也仅达到 56.70% 的任务成功率,而所有开源智能体均低于 1%,在工具编排、操作系统接地和多步推理方面频繁失败。这些结果揭示了当前智能体系统与真实数据科学工作流之间的巨大能力差距,使 DSAgentBench 成为开发接地、可验证、自主数据科学智能体的基础。我们已在 https://github.com/vis-nlp/DSAgentBench 发布 DSAgentBench。

论文精读

TL;DR DSAgentBench 是首个在真实计算机环境中评估智能体执行端到端数据科学工作流的基准,含 275 个多工具任务,最强模型成功率仅 56.7%,揭示明显能力缺口。

问题

问题背景

数据科学自动化正从单任务代码生成走向 end-to-end agent 工作流,业界关注 agent 能否在真实计算机环境中完成从数据获取到模型部署的全流程。

现有方法局限

现有基准(如 DS-1000、Spider、MLAgentBench)存在三类短板:

  • 环境抽象:多数在模拟沙箱或预定义 API 中评估,不涉及真实 OS 交互(文件系统、GUI、终端、浏览器),无法暴露 agent 的 OS grounding 和工具协调能力。
  • 任务粒度:集中在单个代码单元或短程推理,缺少跨阶段依赖和中间结果验证,而真实数据科学需要根据 EDA 输出调整特征工程,再根据模型指标决定调参或部署。
  • 评估方式:以代码可执行为主,不校验分析结论正确性、可视化质量或模型性能,难以反映业务可用性。

为什么难/重要

端到端数据科学要求 agent 在长程工作流中:

  1. 维护多步规划与状态追踪
  2. 协调 notebook / IDE / 终端 / 浏览器 / 数据库等工具的输入输出
  3. 从中间结果中提取信号并决策下一步

任何一步失败会级联放大,导致整体任务失败。业界对自主数据科学 agent 的需求持续上升(如 AutoML、代码助手演进到 agent 形态),但缺乏真实环境基准导致能力无法量化,系统设计缺少反馈信号。

行业类比

类似 SWE-bench 对软件工程 agent 的推动,DSAgentBench 有望成为数据科学 agent 在真实计算环境中的可验证评测基准。

核心洞察

  • 真实计算机环境中的端到端评估暴露了“代码执行正确”与“任务完成”之间的关键差异。DSAgentBench 要求智能体依据中间输出动态决策并协调 notebook、终端、浏览器等工具,而现有数据科学基准大多只检查最终代码或输出片段,忽略环境状态和交互过程。这种差异解释了为什么在通用编码基准上表现良好的模型在该基准上成功率骤降——单纯生成可运行代码无法应对真实工作流中的环境不确定性与工具状态依赖。
  • 开源智能体与闭源模型的巨大差距(全部开源模型成功率低于 1%,而 Claude-4.6-Sonnet 达到 56.70%)表明当前 agent 能力瓶颈主要在工具编排、OS 级 grounding 和多步推理,而非单一代码生成。这与许多仅在静态数据集上微调的开源模型形成对比:它们可能擅长函数调用或代码补全,但缺乏在持续环境反馈下协调多个异构工具的执行策略。该结果提示需要新的训练范式或环境交互数据,而非简单扩大模型规模。
  • DSAgentBench 的确定性评估器同时验证分析正确性、可视化质量和模型性能,而不只是代码可执行性,为数据科学 agent 提供了更接近工程验收的评估标准。传统基准常以单元测试或输出匹配来衡量,而该工作将评估扩展到图表内容、统计结论和模型指标,更贴近实际工作中对交付物的要求。这有助于推动 agent 从“能跑脚本”向“能完成可交付分析”演进,促进可验证、可落地的自主数据科学系统开发。

方法

输入:每个任务实例包含自然语言指令、初始工作目录状态、可用工具集与数据集。Agent 被部署在真实计算机环境中(Docker 容器),需要完成数据获取、EDA、特征工程、建模、评估与部署等阶段。

关键模块 分为三部分:

  • 环境架构:基于 Docker 容器,集成 Jupyter Notebook、VS Code、终端、浏览器、数据库等工具,提供统一的 动作空间(如点击、键入、命令执行、API 调用),模拟真实数据科学工作台。
  • 任务执行工作流:Agent 采用类似 ReAct 的循环,观察界面截图或终端输出,选择下一步动作,环境返回反馈。任务要求基于中间输出进行决策,并协调多工具,而非单步代码生成。
  • 确定性评估器:针对三类输出进行验证:数值结果(如 DataFrame 比对、统计检验)、可视化质量(图像内容与标签检查)、模型性能(准确率、F1 等指标)。评估器经双注释者验证,保证可靠性。

输出:每个任务返回二值成功/失败,汇总为 task success rate,并伴随错误类型分类。

原作者指出:“现有基准缺乏真实计算机交互,无法捕捉数据科学实践的多阶段、多工具特性。DSAgentBench 是第一个在真实环境中评估完整数据科学工作流的基准。”

跟同类方法的差异点:与仅考代码生成的 DS-1000 或仅考 GUI 操作的 OSWorld 不同,DSAgentBench 首次覆盖端到端数据科学全流程,并要求工具协调与中间结果 grounding。

实验

实验设计

DSAgentBench 包含 275 个任务,覆盖数据科学全生命周期:数据获取、EDA、特征工程、建模、评估与部署。智能体在真实计算机环境(notebook、IDE、终端、浏览器、数据库)中执行任务,需协调多工具并依据中间输出进行决策。评估采用确定性 evaluator,验证分析正确性、可视化质量、模型性能,而非仅代码可运行。共评估 15 个闭源与开源模型。

关键发现

  • 最强模型 Claude-4.6-Sonnet 任务成功率为 56.70%。
  • 所有开源智能体任务成功率均 <1%。
  • 主要失败原因:工具编排、OS 级 grounding、多步推理。

与基线的对比解读

论文没有预设单一基线,而是将 15 个模型互相比较。Claude-4.6-Sonnet 虽领先,但未过半,表明当前 agentic 系统在处理长程、多工具数据科学工作流时仍有显著差距。开源模型几乎无法完成任务,说明仅靠模型 scaling 无法弥补环境交互与规划能力的不足。这一结果凸显了开发可落地、可验证的自主数据科学智能体的迫切性——需要更强的任务分解、状态追踪和工具调用可靠性。

行业影响

落地场景

DSAgentBench 所验证的 agent 能力可嵌入企业数据科学平台,例如 BI 工具的智能助手、AutoML 管线的前置探索模块、以及数据标注/清洗服务的自动化层。具体用例:

  • 电商运营分析:Agent 从 Snowflake 拉取订单数据,在 Jupyter 中完成 EDA 与特征工程,调用终端训练 XGBoost 模型,并生成转化率归因报告。
  • 金融风控:Agent 操作 IDE 编写信贷评分卡,连接数据库获取历史交易,运行回测并输出模型性能图表,辅助审批决策。

商业价值

主要落在降本:将数据科学家从重复性的数据清洗、试验记录、报告生成中释放,缩短从原始数据到可部署模型的周期。虽当前最强模型 Claude-4.6-Sonnet 成功率仅 56.70%,离生产可用尚有距离,但 benchmark 提供了可量化的能力基线,避免在未验证的 agent 方案上盲目投入。其 确定性评估器 验证分析正确性和可视化质量,降低错误结果流入下游的风险。

与现有工作流接口

可集成进现有 data stack:通过容器化环境(Kubernetes)运行 agent,任务 spec 由 Airflow/Dagster 调度,结果写入 MLflow 或 Weights & Biases。评估器可作为 CI/CD 质量门禁,对 agent 生成的 notebook、可视化资产和模型指标自动打分。与仅执行代码的 benchmark 不同,DSAgentBench 强调工具协调与中间结果 grounding,因此接口需要支持系统级动作捕获(如鼠标键盘、终端命令)和文件系统状态比对。

局限

  • **任务覆盖度有限**:DSAgentBench 的 275 个任务虽覆盖数据科学全生命周期,但相对真实世界的多样性仍显不足。大规模分布式计算、流式数据处理、特定行业深度建模(如生物信息学、金融时序)等场景未被系统纳入,导致基准结果可能无法直接推广到此类高复杂度任务。此外,任务生成依赖模板和人工校验,可能引入标注者偏差,影响基准的生态效度。
  • **评估指标与真实需求仍有差距**:确定性评估器能无歧义地验证数值结果、图表和模型性能,但真实数据科学还涉及代码质量、可维护性、结果可解释性、成本效率等软性指标。当前评估器未覆盖这些维度,高任务成功率不一定意味着实际工作流质量高。同时,评估器仅支持固定输出格式,可能限制代理的多样化解决方案。
  • **开源模型表现异常低下**:所有开源代理成功率低于 1%,远低于闭源模型,这一巨大差距可能部分源于基准设计对开源模型的系统集成或提示模板不够优化,而非模型能力真实反映。基准的初始状态、工具接口和动作空间可能更适配闭源模型的预训练分布,导致开源模型难以公平对比,限制了对开源社区改进的指导意义。
论文Mizanur Rahman2026-08-11原文

相关内容