微软等提出 LoopsBench,评测长期 Coding Agent 执行能力
LoopsBench 用依赖 DAG 拆解长周期开发任务,评测 Coding Agent 的持续执行和回归控制能力。
LoopsBench 是微软和南京大学等机构提出的基准测试,用于评估 Coding Agent(能自主完成编程任务的 AI 系统)在长时间软件开发中的表现。它把任务拆成多个可验证的开发单元,并恢复它们之间的依赖关系,从而考察 Agent 能否持续推进、保留已完成工作并控制回归。
LoopsBench 用依赖 DAG 拆解长周期开发任务,评测 Coding Agent 的持续执行和回归控制能力。
LoopsBench 是微软和南京大学等机构提出的基准测试,用于评估 Coding Agent(能自主完成编程任务的 AI 系统)在长时间软件开发中的表现。它把任务拆成多个可验证的开发单元,并恢复它们之间的依赖关系,从而考察 Agent 能否持续推进、保留已完成工作并控制回归。