热门产品

BaseRT

BaseRT

BaseRT 是 Apple Silicon 上最快的 LLM 运行时,适合需要本地高效运行大模型的开发者,一键安装快速推理。

热门评论

PH 用户
Hey Product Hunt! 我是 Lukas,BaseRT 的联合创始人。
TLDR:Apple M5 Pro 上 LLM 的新性能天花板。

M5 引入了新的张量核心架构,通过 Metal 4 tensor API 暴露出来。我们把 BaseRT 调整到能充分利用它。

结果如下:

相比 llama.cpp,prompt 处理(prefill)速度最高提升 6.3 倍
相比 MLX,prefill 速度最高提升 3.9 倍

我们在 Qwen3/3.5/3.6、Llama 3.2 和 Gemma 4 的 10 种配置上进行了测试,参数规模从 0.6B 到 35B。

我们构建 BaseRT 是因为我们认为设备端推理即将变得非常重要,而 Apple Silicon 是运行它的最佳消费级硬件。

软件一直没有跟上芯片的速度,我们正努力缩小这个差距。欢迎提问关于基准测试、Metal 4 tensor API 或者我们下一步计划的问题。非常期待你的反馈,如果你有 M5,试试看然后告诉我们你的跑分。
PH 用户
好奇这个提升有多少是 M5 张量核心独有的,又有多少来自通用的 Metal 4 tensor API。我在用 M4 Pro,很多做本地推理的人还没升级——BaseRT 在 M4 上相比 llama.cpp/MLX 依然有明显优势吗(只是倍率小一点),还是说大部分提升都锁定在新硬件上?
PH 用户
非常有趣的工作。感觉我们终于看到软件跟上 Apple Silicon 已经具备的能力了。

我好奇一点:如果某个应用需要根据延迟或质量要求切换不同模型,BaseRT 能帮忙管理这种编排吗,还是说这故意留给了应用层?
PH 用户
我在 M2 上安装了它,一分钟内拉了一个 7B 模型,即使在电池供电下也很流畅。不用每次 token 付费,而且电脑不发热,真好。
PH 用户
好奇它如何处理模型热切换,比如只在 prompt 明显需要时才换到更大的 LLM。如果能根据任务在 Llama 3 8B 和 70B 之间简单地一键切换或自动路由,对 MacBook 的续航会是个很好的加分项。
PH 用户
我很想看到有一个简单的内置模型下载器,这样我就能直接从CLI获取并切换流行的开源模型权重,而不用手动去找GGUF文件。这样测试新模型会顺畅得多。
热门产品Lukas Wesemann2026-07-19原文

相关内容