动态

展示 llama.cpp 在 Mac Studio 上运行 Gemma 4 模型达到 300t/s

展示 llama.cpp 在 Mac Studio 上运行 Gemma 4 模型达到 300t/s
Georgi Gerganov
让我展示 llama.cpp 的真正实力:

- 在 Mac Studio M2 Ultra(3年前)上运行
- Gemma 4 26B A4B Q8_0(全质量)
- 内置 WebUI(随 llama.cpp 附带)
- 开箱即用的 MCP 支持(web-search、HF、github 等)
- 提示投机解码

结果:300 t/s

(实时视频)
动态Georgi Gerganov2026-04-02原文

相关内容