ParallelKernelBench 测试显示前沿 LLM 编写多 GPU 内核能力有限
前沿 LLM 在写多 GPU CUDA 内核时多数失败,但部分生成代码比人工实现更快。
Together AI 发布 ParallelKernelBench,用 87 个真实工作负载测试前沿 LLM(如 GPT-4、Claude)编写多 GPU CUDA 内核的能力。表现最好的模型也仅完成不到三分之一任务,但少数生成的内核速度超越了所有公开实现,说明 LLM 在特定场景仍有潜力。
正文摘录
 摘要 大语言模型(LLM)在编写 GPU 内核(Kernel,一段在 GPU 上运行的程序)方面已经变得出奇地擅长 [1][2][3] ,但几乎所有衡量这一进展的现有基准都是单 GPU 的。在生产环境中,通信往往是瓶颈:通信开销可占推理延迟的 20% 以上 [4] ,而且随着计算速度的增长远超互连带宽,这一差距还在不断扩大。 [ParallelKernelBench](https://www.alphaxiv.org/abs/2606.parallel-kernel-bench) (PKB) 提供了一个用于多 GPU 内核生成的基准测试和评估框架,包含来自真实代码库的 87 个问题,其任务是将 PyTorch + NCCL 替换为一个直接通过 NVLink 传输数据的 CUDA 内核。我们测试了前沿的编程模型,如 GPT-5.5、Gemini 3 Pro、Opus 4.7 等。评估显示各模型普遍存在显著的性能差距:只有不到三分之一的问题被正确解决,而其中超过四分之一的速度甚至未能超越朴素的基线。 我们将讨论它们失败的原因、失败的模式,以及模型在某些情况下出人意料地生成了比任何公开实现都快的内核的几个案例,其中包括一个用于 [NVIDIA NeMo-RL 的 GRPO 训练循环](https://github.com/NVIDIA-NeMo/RL/tree/main) 的内核,此前该方向没有经过优化的公开参考实现。 为什么多 GPU 与单 GPU 内核生成不同 LLM 在 GPU 内核生成方面取得了进展,但这一进展大多是在单 GPU 上衡量的。