通过替换kernel和注意力实现,1T模型吞吐量提升15%
RT @LysandreJik: Thinking Machines 的 Inkling 发布了:首个开放的大型(1T)模型,支持文本、图像和音频输入,文本输出。我注意到模型加速变得容易得多。我们将模型的因果 Conv1D 替换为 `causal-conv1d` 内核。更改一行,每秒 token 数增加 4%。然后我们将注意力实现替换为 FlashAttention-4。又一次简单的更改,再增加 11%。总吞吐量提升约 15%,无需更改模型架构或重新训练。我们还没有触及 MoE 层,这些层可能提供最大的优化机会。这就是让我对内核工作感到兴奋的原因:让模型开发者能够像更改模型配置一样轻松地找到并集成最佳优化内核。内核开发者可以专注于构建最快的实现,模型开发者可以快速测试和采用它们。使用该模型的每个人都会受益。在 1T 模型上两次轻微更新带来 15% 的提升,这是一个相当不错的开始。