华为联合港中文港科大发布 LegoFlow 代码数据工程框架
把造题到评测的代码数据流水线交给智能体自动跑,LegoFlow 仅用约千条轨迹即显著提升基座模型的 SWE-bench 成绩。
华为与港中文、港科大研究者推出 LegoFlow:把代码数据流水线自动化的框架,从仓库和 PR(拉取请求,开发者提交的代码改动)中筛出任务,由智能体生成解题轨迹(模型一步步解题的完整记录),再训练和评测模型。团队从 1200 万个候选 PR 中筛出 5000 个任务并开源。
正文摘录
.jpg)  从 1200 万个候选拉取请求中,最终留下 5000 个 SWE 代码任务 —— 不足 0.05%。把「出题、答题、改卷、训练、评测」这条代码数据流水线全自动跑起来,就是 LegoFlow; 在这个过程中,我们还发现了三个观察。 软件工程是最近大语言模型的核心能力,但高质量代码数据的生产仍相当复杂,涉及从仓库发现、任务验证、轨迹推理到训练评测的漫长流程。 如何把「造题、答题、筛选、训练、评测」这条代码数据流水线全自动跑起来? 华为、港中文、港科大的研究员们联合推出 LegoFlow ,一个简单易用、交互式的代码数据工程框架,亮点包括: - 自动化智能体工作流 :从仓库和 PR 收集到任务验证、轨迹推理、训练与评测,每道流程都封装为标准插件技能,Claude Code、Codex 等编码智能体可直接调用。 - 开源任务与轨迹 :团队发布 LegoFlow-SWE,包含从 1,200 万个 PR 中筛选出的 5,000 个任务,覆盖 8 种编程语言和 20 个任务标签,以及 2,780 条验证成功的高质量轨迹;