启动SWE-fficiency,评估LM加速真实GitHub仓库 Jeff Ma我们正在推出SWE-fficiency,用于评估语言模型能否加速真实GitHub仓库处理真实工作负载!包含498个优化任务,涵盖9个数据科学、机器学习和HPC仓库——每个任务都有真实工作负载需要加速。现有智能体难以达到专家级别的优化水平! 动态Jeff Ma2025-11-12原文 打开互动版