主推赞美引用推关于SWE-fficiency评估LM加速仓库效率
太棒了!
我们正在推出SWE-fficiency,用于评估语言模型是否能在真实工作负载上加速真实的GitHub仓库!
包含498个优化任务,涵盖9个数据科学、机器学习和高性能计算仓库——每个任务都有需要加速的真实工作负载。
现有智能体难以达到专家级别的优化水平!
我们正在推出SWE-fficiency,用于评估语言模型是否能在真实工作负载上加速真实的GitHub仓库!
包含498个优化任务,涵盖9个数据科学、机器学习和高性能计算仓库——每个任务都有需要加速的真实工作负载。
现有智能体难以达到专家级别的优化水平!