行业新闻

人大 CoDA-Bench:千文件环境下 Code Agent 准确率最高61.1%

新基准 CoDA-Bench 发现,Code Agent 在复杂数据环境中常因找错文件而非写错代码而失败。

人大团队推出 CoDA-Bench,把 Code Agent 丢进含 1000+ 个文件的真实数据目录,只给自然语言问题,不告知文件路径。结果显示,最强系统准确率仅 61.1%。这揭示当前 Code Agent 的瓶颈不是写代码,而是找不到对的数据。

正文摘录

把 Agent 丢入 1000+ 文件:人大 CoDA-Bench 揭示 Code Agent 瓶颈 ![](https://image.jiqizhixin.com/uploads/article/coverimage/025b821a-7d75-4ca6-bfe1-99d70c0ee43d/011(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 给 Code Agent 一个明确的数据文件,它往往能写出正确的分析代码。 但如果把它放进一个包含 1000+ 文件的真实数据目录,只告诉它一句自然语言问题——不给文件名、不告诉路径、不提供 schema——它还能完成任务吗? 中国人民大学的研究团队提出 CoDA-Bench,联合评估 Agent 的 Code Intelligence + Data Intelligence(代码智能与数据智能)。该基准首次把 Code Agent 放进包含 1000+ 数据文件的复杂环境下,要求模型先自主探索文件系统、找到相关数据,再编写代码完成分析。实验显示,即使当前表现最好的系统,在 CoDA-Bench 上执行准确率也只有 61.1%;在更难的 CoDA-HARD 子集上,最高准确率进一步降至 49.6%。 当前 Code Agent 的真实瓶颈,并不是"不会写代码",而是找不对数据。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-03原文

相关内容