人大发布DeNovoSWE数据集,训练代码智能体从零生成完整仓库
DeNovoSWE让代码AI从修bug升级为从头建仓库,实验显示长程能力提升显著。
以前代码AI只能修bug,现在研究人员用DeNovoSWE数据集训练它从文档出发构建整个软件仓库。该数据集包含4818个真实任务实例,通过分治与批评修复机制生成高质量文档,让模型在仓库级生成任务上正确率从5.8%跃升至47.2%。
正文摘录
 新智元报道  【新智元导读】 DeNovoSWE 是一个用于训练代码智能体从零生成完整仓库的数据集,包含 4818 个真实任务实例。它通过结构化文档和严格验证机制,帮助智能体掌握复杂系统构建能力,而不仅仅是修复代码。这为代码智能体迈向更高阶的软件工程任务提供了关键支持。 随着 LLM Code Agent 能力的不断提升,越来越多的研究者意识到现在是时候迈向下一个阶段更接近真实场景需求的长程任务了。于是涌现出了一些长程任务评测的 Benchmark 比如 NL2RepoBench 以及 BeyondSWE 等等。大家对 Code Agent 预期承担的角色逐渐从仓库维护者变成了架构师,能够做规划完成整个仓库的代码的长程任务。 近日,中国人民大学高瓴人工智能学院完成相关研究,重磅发布 DeNovoSWE 数据集,专注于长程软件工程任务,尤其是仓库级别代码从零生成任务。