动态

按显存档位推荐最佳LLM模型,点评编码/智能体性能。

按显存档位推荐最佳LLM模型,点评编码/智能体性能。
Victor M
转推 @0xSero: 针对你的硬件的最佳模型

--- 8GB 显存 ---

1. Spark-X2.5-4B: https://t.co/bat1l6nQXX

根据基准测试,该模型性能接近9B模型,聚焦编码与智能体(agentic)性能,拥有1M token上下文窗口。

2. Bonsai-27B: https://t.co/beUKpC7y4G

这是你在8GB显存上能最接近前沿模型的选项。它基于Qwen3.6-27B,将权重量化到Q2,可得到262K token上下文窗口+视觉能力。

--- 16GB 显存 ---

1. Gemma-4-12B: https://t.co/tc6IBTrbc3
如果你需要视觉能力,这是顶级模型。它拥有丰富的世界知识,擅长在图像/视频中查找内容,并在长上下文中保持连贯性。

不是最好的智能体,但确实有分量。

--- 24GB 显存 ---

首选

1. Qwen3.8-27B: https://t.co/HLxQ3NqbXn 我特别推荐Mia Lab的exl3-3.5bpw版本。

我使用该模型进行编码、游戏开发、媒体编辑、vllm/sglang配置管理、集群管理。我对它的出色表现感到震惊。

它推理较少,并带有MTP,所以能在不错的速度下运行。

预计可达Sonnet/Luna水平。

--- 32GB - 64GB ---

首选

1. Nex-n2.5-Mini: https://t.co/YLudOrTzqc

Nex对像Qwen3.6-35B这样强的模型在智能体/编码/媒体任务上进行后训练。我之前用过他们的模型,他们缩短推理长度,并设法榨出更多IQ。

该模型对Mac/较慢GPU尤其出色,因为它是MoE,每生成一个token只激活一小部分。

预计可达Sonnet/Luna水平。

--- 96GB - 128GB 显存 ---

这是前沿真正开始的地方。

1. Qwen3.8-Flash-Next: https://t.co/ZHF8HdNBG7

在deepswe上得分58.7%,支持视觉,速度极快,世界知识丰富,可以干真正的活。从Terra/Opus-4.6切换到Qwen,你几乎感觉不到差异。

它有55B参数,可以卸载到更便宜的内存或nvme上,速度损失很小,所以你需要:

- AMD Strix Halo
- DGX Spark
- 4x 3090
- 1x RTX Pro 6000
- Mac M5 Ultra/Max

----

2. GLM-5.3-Flash-EXL3-2BPW: https://t.co/zzqoN6zJmm

我设计它用于运行在1x DGX Spark或任何128GB系统上。它非常擅长逆向工程,并能保持约86%的BF16智能。

仍是实验性,如有问题请报告。

--- 196GB - 256GB ---

前沿

1. GLM-5.3-Flash-EXL3-4BPW: https://t.co/LFsUkZnSgR

91.7% top token一致率,0.065 KLD,这是目前该规模档位不容置疑的最佳模型。需要一些调校才能正常运作,但我认为这是Opus/Sol级别。它能应付我抛给它的所有任务,从未遇到瓶颈。

----

2. DeepSeek-V4-Flash-Vision: https://t.co/fjoWaXfbaV

我认为DeepSeek在对话方面更胜一筹,更有人情味,似乎有更丰富的世界知识。出色的智能体。除此之外没什么好说的。

----

3. GLM-5.3-EXL3-3bpw-REAP: https://t.co/2RQe3CXPrh

这将是可在2x DGX Sparks/Mac M5-Ultra 256GB上运行的最聪明的模型,适合编码、智能体和逆向工程。它会相当慢,但过一夜你可以用它做逆向/破解/构建复杂组件。

在编码/智能体/英语之外会有明显退化,所以我不建议用于这些场景之外。

----

4. Nex-N2.5-Pro: https://t.co/qmeyrW7dsX

不可思议的模型,尤其适合媒体编辑。试试吧。

--- 384GB - 512GB ---

1. GLM-5.3: https://t.co/ujKpGbAwGN 我推荐exl3-3bpw到exl3-4bpw版本。它真正有能力完成疯狂的开发和智能体任务,能与Fable/GPT-5.6-Sol一较高下。

我遗漏了什么?
动态Victor M2026-09-09原文

相关内容