人大 CoDA-Bench:千文件环境下 Code Agent 准确率最高61.1%
新基准 CoDA-Bench 发现,Code Agent 在复杂数据环境中常因找错文件而非写错代码而失败。
人大团队推出 CoDA-Bench,把 Code Agent 丢进含 1000+ 个文件的真实数据目录,只给自然语言问题,不告知文件路径。结果显示,最强系统准确率仅 61.1%。这揭示当前 Code Agent 的瓶颈不是写代码,而是找不到对的数据。
正文摘录
把 Agent 丢入 1000+ 文件:人大 CoDA-Bench 揭示 Code Agent 瓶颈 .jpg)  给 Code Agent 一个明确的数据文件,它往往能写出正确的分析代码。 但如果把它放进一个包含 1000+ 文件的真实数据目录,只告诉它一句自然语言问题——不给文件名、不告诉路径、不提供 schema——它还能完成任务吗? 中国人民大学的研究团队提出 CoDA-Bench,联合评估 Agent 的 Code Intelligence + Data Intelligence(代码智能与数据智能)。该基准首次把 Code Agent 放进包含 1000+ 数据文件的复杂环境下,要求模型先自主探索文件系统、找到相关数据,再编写代码完成分析。实验显示,即使当前表现最好的系统,在 CoDA-Bench 上执行准确率也只有 61.1%;在更难的 CoDA-HARD 子集上,最高准确率进一步降至 49.6%。 当前 Code Agent 的真实瓶颈,并不是"不会写代码",而是找不对数据。