行业新闻

Inferact 在谷歌 TPU v7 上跑 Kimi K3,吞吐比 GB200 高 57%

Inferact 在谷歌 TPU v7 上跑 Kimi K3,吞吐比 GB200 高 57%

vLLM 原班人马创业公司 Inferact 证明:在 TPU 上手写底层内核,推理速度可以反超英伟达 GPU,且精度不变。

Inferact 用 16 块谷歌 TPU v7 跑 Kimi K3,单卡吞吐达每秒 709 个 token,比同配置的英伟达 GB200 快 57%。做法是把推理时调度的几百个小程序合并成一个 megakernel,再配合 DeepSeek 提出的 DSpark 投机解码框架。

正文摘录

- title: 谷歌 TPU 跑 Kimi 比英伟达 GPU 快 57%!用的还是 DeepSeek 推理框架 - sourcecompany: 量子位 - bodymarkdown: 16 块谷歌 TPU v7 跑 Kimi K3,每秒跑出了 709 个 Token,比老黄的 GB200 快了 57%。 做出这个成绩的,既不是造 Kimi 的月之暗面,也不是造 TPU 的谷歌,是一家叫 Inferact 的推理创业公司。 Inferact 创始团队就是 vLLM 的原班人马,今年拿了 a16z 领投的 1.5 亿美元种子轮,估值 8 亿美元。 他们给 TPU 写了一种叫 megakernel 的推理内核,把模型推理时原本要调度的几百个小程序焊成一个大程序。 配合 TPU 独特的片上内存架构,megakernel 把内存带宽利用率逼到了硬件理论峰值附近。 配上 DeepSeek 提出的 DSpark 加速框架,K3 在 TPU 上跑出了前面提到的每秒 709 token 的成绩。 Inferact 把 TPU 和英伟达 GPU 放在完全相同的条件下跑了一轮 benchmark,TPU 赢了。 测试是用 16 块 TPU v7 Ironwood 对阵 16 块英伟达 GB200,两边都跑 Kimi K3,都用 vLLM 推理引擎,唯一的变量是芯片和底层的 kernel 实现。 最终,TPU 跑出的成绩是每秒 709 个 token,GB200 跑出每秒 452 个,TPU 的速度快了 57%。 DSpark 是由 DeepSeek 提出的推理加速框架,其原理是让一个小模型先快速猜出一串候选 token,然后大模型再对这串候选 token 做批量验证,猜对的直接跳过,猜错的回退重来。

阅读原文(qbitai.com)→

行业新闻听雨2026-09-26原文

相关内容