端侧大模型易用性迎来分水岭 本地运行性能达云端 75%
2025 年本地大模型在性能与易用性上大幅跃升,作者实测其编码能力已达云端模型的 75%,部署门槛显著降低。
一位资深 ML 工程师在 M2 Mac 上实测,2025 年的本地模型(如 Gemma 4、Qwen 等)已能完成代码重构、Agent 编码等任务,速度与准确率接近云端前沿模型的 75%,且工具链成熟到“点两下就能跑”。
正文摘录
.jpg) 最近,我们都在关注旗舰级大模型的进步,其实本地运行的 AI 模型也迎来了重要的分水岭。 在可行性和实用性方面,很多新模型已经实现了性能的跨越,不论智力、智能体(Agent)能力还是工具链成熟度,在最近半年里都有巨大的提升。 看起来已经能做到「点两下就能跑」了。 本文作者 Vicki Boykis 是一家创业公司的创始机器学习工程师,主要从事推荐系统 / 个性化 / 信息检索方面的工作。 此前,她曾在 Mozilla.ai 从事 LLM 和 LLM 基础设施方面的工作,也曾在 Duo、Tumblr、Automattic 和 Comcast 从事机器学习和推荐系统方面的工作。 她最近发表的博客文章,在 HackerNews 上成了爆款:  我从本地模型刚推出时就开始和它们合作,现在它们已经做得出乎意料地好了。 我有一台 2022 年款 M2 Mac,配备 64 GB 内存和 1TB 存储空间。基于这样的硬件,我一直都在使用: - Mistral 7B - Gemma 3 - OpenAI OSS-20B - Qwen 3 MOE,以及其他一些 Qwen 变体,例如 Qwen 2.5 Coder。