行业新闻

微软等提出 LoopsBench,评测长期 Coding Agent 执行能力

LoopsBench 用依赖 DAG 拆解长周期开发任务,评测 Coding Agent 的持续执行和回归控制能力。

LoopsBench 是微软和南京大学等机构提出的基准测试,用于评估 Coding Agent(能自主完成编程任务的 AI 系统)在长时间软件开发中的表现。它把任务拆成多个可验证的开发单元,并恢复它们之间的依赖关系,从而考察 Agent 能否持续推进、保留已完成工作并控制回归。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-22原文

相关内容