按显存档位推荐最佳LLM模型,点评编码/智能体性能。
转推 @0xSero: 针对你的硬件的最佳模型
--- 8GB 显存 ---
1. Spark-X2.5-4B: https://t.co/bat1l6nQXX
根据基准测试,该模型性能接近9B模型,聚焦编码与智能体(agentic)性能,拥有1M token上下文窗口。
2. Bonsai-27B: https://t.co/beUKpC7y4G
这是你在8GB显存上能最接近前沿模型的选项。它基于Qwen3.6-27B,将权重量化到Q2,可得到262K token上下文窗口+视觉能力。
--- 16GB 显存 ---
1. Gemma-4-12B: https://t.co/tc6IBTrbc3
如果你需要视觉能力,这是顶级模型。它拥有丰富的世界知识,擅长在图像/视频中查找内容,并在长上下文中保持连贯性。
不是最好的智能体,但确实有分量。
--- 24GB 显存 ---
首选
1. Qwen3.8-27B: https://t.co/HLxQ3NqbXn 我特别推荐Mia Lab的exl3-3.5bpw版本。
我使用该模型进行编码、游戏开发、媒体编辑、vllm/sglang配置管理、集群管理。我对它的出色表现感到震惊。
它推理较少,并带有MTP,所以能在不错的速度下运行。
预计可达Sonnet/Luna水平。
--- 32GB - 64GB ---
首选
1. Nex-n2.5-Mini: https://t.co/YLudOrTzqc
Nex对像Qwen3.6-35B这样强的模型在智能体/编码/媒体任务上进行后训练。我之前用过他们的模型,他们缩短推理长度,并设法榨出更多IQ。
该模型对Mac/较慢GPU尤其出色,因为它是MoE,每生成一个token只激活一小部分。
预计可达Sonnet/Luna水平。
--- 96GB - 128GB 显存 ---
这是前沿真正开始的地方。
1. Qwen3.8-Flash-Next: https://t.co/ZHF8HdNBG7
在deepswe上得分58.7%,支持视觉,速度极快,世界知识丰富,可以干真正的活。从Terra/Opus-4.6切换到Qwen,你几乎感觉不到差异。
它有55B参数,可以卸载到更便宜的内存或nvme上,速度损失很小,所以你需要:
- AMD Strix Halo
- DGX Spark
- 4x 3090
- 1x RTX Pro 6000
- Mac M5 Ultra/Max
----
2. GLM-5.3-Flash-EXL3-2BPW: https://t.co/zzqoN6zJmm
我设计它用于运行在1x DGX Spark或任何128GB系统上。它非常擅长逆向工程,并能保持约86%的BF16智能。
仍是实验性,如有问题请报告。
--- 196GB - 256GB ---
前沿
1. GLM-5.3-Flash-EXL3-4BPW: https://t.co/LFsUkZnSgR
91.7% top token一致率,0.065 KLD,这是目前该规模档位不容置疑的最佳模型。需要一些调校才能正常运作,但我认为这是Opus/Sol级别。它能应付我抛给它的所有任务,从未遇到瓶颈。
----
2. DeepSeek-V4-Flash-Vision: https://t.co/fjoWaXfbaV
我认为DeepSeek在对话方面更胜一筹,更有人情味,似乎有更丰富的世界知识。出色的智能体。除此之外没什么好说的。
----
3. GLM-5.3-EXL3-3bpw-REAP: https://t.co/2RQe3CXPrh
这将是可在2x DGX Sparks/Mac M5-Ultra 256GB上运行的最聪明的模型,适合编码、智能体和逆向工程。它会相当慢,但过一夜你可以用它做逆向/破解/构建复杂组件。
在编码/智能体/英语之外会有明显退化,所以我不建议用于这些场景之外。
----
4. Nex-N2.5-Pro: https://t.co/qmeyrW7dsX
不可思议的模型,尤其适合媒体编辑。试试吧。
--- 384GB - 512GB ---
1. GLM-5.3: https://t.co/ujKpGbAwGN 我推荐exl3-3bpw到exl3-4bpw版本。它真正有能力完成疯狂的开发和智能体任务,能与Fable/GPT-5.6-Sol一较高下。
我遗漏了什么?
--- 8GB 显存 ---
1. Spark-X2.5-4B: https://t.co/bat1l6nQXX
根据基准测试,该模型性能接近9B模型,聚焦编码与智能体(agentic)性能,拥有1M token上下文窗口。
2. Bonsai-27B: https://t.co/beUKpC7y4G
这是你在8GB显存上能最接近前沿模型的选项。它基于Qwen3.6-27B,将权重量化到Q2,可得到262K token上下文窗口+视觉能力。
--- 16GB 显存 ---
1. Gemma-4-12B: https://t.co/tc6IBTrbc3
如果你需要视觉能力,这是顶级模型。它拥有丰富的世界知识,擅长在图像/视频中查找内容,并在长上下文中保持连贯性。
不是最好的智能体,但确实有分量。
--- 24GB 显存 ---
首选
1. Qwen3.8-27B: https://t.co/HLxQ3NqbXn 我特别推荐Mia Lab的exl3-3.5bpw版本。
我使用该模型进行编码、游戏开发、媒体编辑、vllm/sglang配置管理、集群管理。我对它的出色表现感到震惊。
它推理较少,并带有MTP,所以能在不错的速度下运行。
预计可达Sonnet/Luna水平。
--- 32GB - 64GB ---
首选
1. Nex-n2.5-Mini: https://t.co/YLudOrTzqc
Nex对像Qwen3.6-35B这样强的模型在智能体/编码/媒体任务上进行后训练。我之前用过他们的模型,他们缩短推理长度,并设法榨出更多IQ。
该模型对Mac/较慢GPU尤其出色,因为它是MoE,每生成一个token只激活一小部分。
预计可达Sonnet/Luna水平。
--- 96GB - 128GB 显存 ---
这是前沿真正开始的地方。
1. Qwen3.8-Flash-Next: https://t.co/ZHF8HdNBG7
在deepswe上得分58.7%,支持视觉,速度极快,世界知识丰富,可以干真正的活。从Terra/Opus-4.6切换到Qwen,你几乎感觉不到差异。
它有55B参数,可以卸载到更便宜的内存或nvme上,速度损失很小,所以你需要:
- AMD Strix Halo
- DGX Spark
- 4x 3090
- 1x RTX Pro 6000
- Mac M5 Ultra/Max
----
2. GLM-5.3-Flash-EXL3-2BPW: https://t.co/zzqoN6zJmm
我设计它用于运行在1x DGX Spark或任何128GB系统上。它非常擅长逆向工程,并能保持约86%的BF16智能。
仍是实验性,如有问题请报告。
--- 196GB - 256GB ---
前沿
1. GLM-5.3-Flash-EXL3-4BPW: https://t.co/LFsUkZnSgR
91.7% top token一致率,0.065 KLD,这是目前该规模档位不容置疑的最佳模型。需要一些调校才能正常运作,但我认为这是Opus/Sol级别。它能应付我抛给它的所有任务,从未遇到瓶颈。
----
2. DeepSeek-V4-Flash-Vision: https://t.co/fjoWaXfbaV
我认为DeepSeek在对话方面更胜一筹,更有人情味,似乎有更丰富的世界知识。出色的智能体。除此之外没什么好说的。
----
3. GLM-5.3-EXL3-3bpw-REAP: https://t.co/2RQe3CXPrh
这将是可在2x DGX Sparks/Mac M5-Ultra 256GB上运行的最聪明的模型,适合编码、智能体和逆向工程。它会相当慢,但过一夜你可以用它做逆向/破解/构建复杂组件。
在编码/智能体/英语之外会有明显退化,所以我不建议用于这些场景之外。
----
4. Nex-N2.5-Pro: https://t.co/qmeyrW7dsX
不可思议的模型,尤其适合媒体编辑。试试吧。
--- 384GB - 512GB ---
1. GLM-5.3: https://t.co/ujKpGbAwGN 我推荐exl3-3bpw到exl3-4bpw版本。它真正有能力完成疯狂的开发和智能体任务,能与Fable/GPT-5.6-Sol一较高下。
我遗漏了什么?