动态

Deepseek发布FlashMLA,优化H800性能

Deepseek发布FlashMLA,优化H800性能
歸藏(guizang.ai)
Deepseek 开源周第一天:FlashMLA项目

让H800的计算性能翻了两倍!!

为Hopper架构GPU开发的高效MLA解码内核

专门针对可变长度序列进行了优化

H800上可以达到 3000 GB/s的内存带宽和580 TFLOPS的计算性能
DeepSeek
🚀 开源周第一天:FlashMLA

荣幸分享FlashMLA——我们为Hopper GPU开发的高效MLA解码内核,针对可变长度序列优化,现已投入生产。

✅ BF16支持
✅ 分页KV缓存(块大小64)
⚡ 3000 GB/s内存带宽 & 580 TFLOPS
动态歸藏(guizang.ai)2025-02-24原文

相关内容