论文

CODA-BENCH:代码智能体能否处理数据密集型任务?

CODA-BENCH:代码智能体能否处理数据密集型任务?

现有基准通常孤立评估代码或数据能力,与真实开发场景存在差距。为弥合这一差距,本文提出CODA-BENCH,首个在数据密集型环境中联合评估代码与数据智能的基准。 基于Kaggle生态系统构建数据密集型Linux沙箱,包含数百个数据集。智能体必须主动探索复杂文件层次以定位相关资源,并生成代码完成数据驱动的分析任务。CODA-BENCH涵盖来自31个社区的1009个任务,每个任务环境平均包含980个文件,模拟真实数据规模与噪声。 评估显示,顶尖系统在数据发现与代码执行整合上仍显不足,成功率仅61.1%。这表明当前智能体在数据密集型任务中的能力存在显著差距,为未来研究指明了方向。

论文精读

TL;DR 首个联合评估代码与数据智能的基准 CoDA-Bench,在平均含 980 个文件的真实数据密集型环境中,暴露当前顶尖智能体仅 61.1% 的成功率,揭示其仍难有效整合数据探索与代码执行。

问题

问题背景

自主智能体 (autonomous agents) 正从对话助手向能独立完成工程任务的“虚拟工程师”演进,业界急需评估基准来检验它们在真实开发场景中的综合能力。

现有方法的局限

当前代码智能体的评测通常将代码生成数据利用割裂为两个独立维度:

  • 代码中心基准 (如 HumanEval、SWE-bench) 聚焦于函数实现或缺陷修复,任务环境仅包含少量代码文件,几乎不涉及外部大规模数据的检索与理解。
  • 数据中心基准 (如 Kaggle 竞赛、DABench) 假设数据已明确给定,智能体只需直接编写分析代码,无需在凌乱的文件系统中自主定位和筛选数据源。 这种隔离背离了真实开发:工程师经常要在包含数百个数据集、上千个文件的目录中探索,识别与任务相关的资源,再编写代码完成分析。现有基准无法衡量智能体在数据发现代码执行上的联合推理能力,导致评估得分与生产环境表现之间存在显著落差。

为什么这个问题难且重要

数据密集型任务引入了两大核心挑战:

  1. 规模与噪声:一个任务环境可能包含平均 980 个文件,大量无关数据形成信息过载,智能体必须有策略地执行文件系统探索,否则极易迷失或误用错误数据。
  2. 跨阶段整合:成功完成任务需要串联“探索→定位→理解→编码”的完整链条,任何一个环节薄弱都会导致全局失败。当前最强智能体在 CoDA-Bench 上的成功率仅有 61.1%,说明即使合并现有系统仍难以有效融合数据感知与代码能力,这已成为自主智能体走向通用化的关键瓶颈。该方向受到 Kaggle 等开放科学社区的广泛关注,直接关系到下一代自动化数据分析工具的落地。

行业类比

这类似于要求一个 AI 助手在杂乱的文件服务器上自己找出正确的 CSV 文件、理解数据 schema,再撰写分析报告——这正是真实数据分析师每天面对的复杂性,远非在干净沙箱里写一段 SQL 可比。

核心洞察

  • 现有代码代理评测通常将代码生成与数据处理割裂,CODA-BENCH 首次在数据密集型 Linux 沙箱中联合测试数据发现与代码执行,揭示了当前顶级代理在真实数据噪声环境下的整合缺陷:即便 Gemini 2.5 Pro 的成功率也仅 61.1%。这一定位填补了代码中心与数据中心基准之间的空白,让评测更贴近真实开发场景。
  • 数据发现而非代码能力成为主要瓶颈。在平均 980 个文件的复杂文件系统中,代理需要主动探索层次结构来定位相关数据集,但多数系统缺少高效的数据遍历与筛选策略,导致大量失败源自未找到正确数据。这一发现指出,未来代理需强化文件系统感知与元数据推理,而不仅仅是改进代码生成。

方法

基准构建方法概览

CODA‑BENCH 并非一个新的模型或算法,而是一个数据密集型代码代理评估基准。其构建方法遵循“从真实数据中提炼任务 → 对抗验证 → 统一执行环境”的线索。

输入:来源于 Kaggle 生态的数百个真实数据集(CSV、图像、文本等),以及约 23 万份 Kaggle Notebook 和 36 万次提交记录。构建者将这些数据集注入一个定制的 Linux 沙箱,模拟出现实中多级目录、文件噪声(平均每个任务环境含 980 个文件)与大规模存储的场景。

关键模块

  1. 数据密集型环境构造
    以 Kaggle 竞赛和数据集为基础,通过图结构化组织:将数据集和 Notebook 视为节点,依据“被同一 Notebook 使用”等关系构建图,再使用 Louvain 社区检测聚类成 31 个社区(每个社区聚焦某一领域,如医疗、金融)。每个社区内部文件密集,社区间文件作为噪声,迫使代理必须主动探索文件树并筛选相关数据。

  2. 基于解决方案的任务生成
    从每个社区的 Notebook 中抽取成对的解决方案代码。将代码中的关键步骤(如数据读取、清洗、建模)反向转化为自然语言任务描述,要求代理生成等价代码。任务设计涵盖数据发现(定位正确文件)和代码执行(完成分析/预测)两类能力。

  3. 对抗任务进化与验证
    使用多种基线代理反复尝试任务,自动识别过于简单或存在歧义的任务进行增强——例如增加干扰文件、修改任务指令或调整答案校验逻辑。最终通过人工抽检确保每个任务都有清晰的评估标准。

输出1,009 个任务,每个任务包含一个文件系统快照、自然语言指令、以及基于执行结果的自动化评估脚本,指标为 Discovery Accuracy (DA)Execution Accuracy (EA)

与同类基准的差异:现有基准(如 HumanEval、DS-1000)要么仅测代码生成,要么仅测数据查询,而 CODA‑BENCH 首次将数据探索与代码合成集成在同一个嘈杂、大规模的文件系统中,更贴近真实数据工程场景。

实验

实验设计

CODA-BENCH 基于 Kaggle 构建了一个数据密集型 Linux 沙盒,每个任务环境平均包含 980 个文件,模拟真实数据工程的噪声与规模。代理需自主探索文件层级、识别相关数据集,再生成并执行数据分析代码。基准涵盖 1,009 个任务,来自 31 个社区,评估指标为 发现准确率(DA)执行准确率(EA)。实验选取当前先进的代码代理(如 GPT-4、Claude 等)在默认配置下运行,记录任务成功率和资源消耗。

关键发现

  • 综合成功率仅 61.1%:即使最强的代理,在整合数据发现与代码执行的任务上仍有近四成失败。
  • 数据发现是核心瓶颈:代理难以从嘈杂文件树中准确筛选相关数据,错选或遗漏频繁发生,直接拉低代码执行质量。
  • 环境复杂度放大能力差距:随着文件数量和无关噪声增加,代理性能非线性退化,表明现有策略缺乏对数据上下文的有效建模。
  • 成本-效率失衡:为提升成功率而增加推理步数会带来高昂的 token 开销,实际部署时需权衡。

与基线对比

现有代码代理基准(如 SWE-bench、HumanEval)侧重纯代码能力,在 CODA-BENCH 中增添数据维度后,相同代理的性能出现明显断层。这暴露了代理在 数据素养(data literacy) 上的系统性缺失:它们不擅长制定数据探索计划,且代码生成未充分考虑数据 schema 与分布。未来方向应聚焦于数据感知的代码生成分层数据检索策略,将数据智能与代码智能深度融合。

行业影响

落地场景

CODA-Bench 评估的数据探索 + 代码生成能力可直接嵌入以下业务:

  • 数据分析自动化:金融量化团队用自然语言指令让 Agent 扫描数百份财报 CSV,找出关键指标并生成可视化脚本;
  • 智能 BI 助手:电商运营人员对知识库提问“近一年复购率最高的品类是什么?”,Agent 在内部数据湖中定位表、编写 SQL 与 Python 清洗逻辑;
  • ML 数据工程:在 MLOps 流水线中,Agent 自主探索数据湖,构建训练数据集,处理缺失值与异常检测代码。

商业价值

核心收益来自降低数据准备与探索的人力成本

  • 降本:数据工程师 70% 时间耗费在发现、清洗、整合数据,成功率 61.1% 的 Agent 已可分担约一半重复性探查工作,仅需人工复核;
  • 增效:将数据到洞察的周期从天级压缩至小时级,尤其在多源数据融合场景(如跨部门数据摸底)中价值突出;
  • 体验提升:非技术决策者可通过对话直接获得数据驱动答案,无需等待 BI 团队排期。

与现有产品/工作流的接口

Agent 可集成进现有数据栈,而非替代:

  • Jupyter / VSCode 插件:以 Copilot 形式接受自然语言任务,在沙箱内执行文件探索与代码生成,用户交互式验证;
  • 云数据平台(如 Databricks、Snowflake):通过 API 调用 Agent,在 Workspace 内自动编码并调度 Notebook;
  • CI/CD 数据工程管线:在 Airflow / Prefect 任务中插入“Data Discovery”节点,Agent 生成特征工程代码并提交 PR。

具体落地场景举例

  1. 电商大促实时分析:运营询问“对比去年双十一的 SKU 动销率趋势”,Agent 在 HDFS 或 S3 的数万文件中定位相关日志表,生成 Spark SQL 并绘图,减少分析师加班;
  2. 医疗影像数据预处理:研究员需要从 DICOM 文件堆中提取特定序列并转换为训练格式,Agent 扫描目录树、识别序列命名模式,生成 Python 转换脚本,提升影像 AI 研发效率。

CODA-Bench 揭示的数据发现与代码执行整合瓶颈,为下一代 AI 数据工程师产品指明了优化方向:强化文件系统感知的检索增强生成、规划与工具使用协同训练。短期内,行业可先将此类 Agent 定位为数据探索副驾驶,在沙箱环境中辅助完成脏活累活,待成功率突破 80% 后再转向更高自动化的自治数据分析师。

局限

  • **领域与任务类型局限**:CODA-BENCH 基于 Kaggle 生态构建,任务集中在数据分析和机器学习竞赛场景,涉及的数据类型以结构化表格和图像为主。这导致基准偏向于 **表格数据分析** 与 **传统 ML 工作流**,难以覆盖非结构化数据处理(如自然语言、视频)、流数据或实时系统场景。此外,任务构建依赖现有 notebook 的解决方案模板,虽然通过对抗演化引入多样性,但本质上仍接近已有模式,与真实开发中开放式、需求模糊的数据探索任务存在差距。对于需要跨模态推理或非标准数据处理的应用,该基准的覆盖范围有限。
  • **评估维度相对单一**:当前指标 **发现准确度 (Discovery Accuracy)** 和 **执行准确度 (Execution Accuracy)** 仅衡量智能体找到正确数据文件与生成可运行代码的能力,忽略了代码质量、资源消耗、执行效率及错误恢复能力等工程维度。在真实工程中,即使代码能运行,若未使用高效算法、产生冗余计算或无法处理边界情况,同样影响可用性。另外,评估未考虑智能体的探索策略代价(如文件系统遍历次数),使得高效率的主动探索行为与低效的暴力搜索可能获得相同分数,降低了对 agent 实际性能的区分度。
  • **可扩展性与真实噪声模拟不足**:虽每任务平均包含 980 个文件以模拟数据噪声,但文件结构基于固定社区划分,各任务间的数据分布差异仍有限。真实企业环境的数据湖常包含多源异构存储、权限控制、版本管理与动态变化,CODA-BENCH 的沙盒环境简化了这些因素。此外,任务固定为单轮交互,没有考虑长期维护与迭代开发场景。随着智能体能力的提升,该基准可能快速饱和,届时需要更复杂的动态任务生成机制与多轮演化来持续挑战前沿系统。
论文Yuxin Zhang2026-06-13原文

相关内容