作者在OpenClaw上基准测试本地模型,改进UX
谁在OpenClaw的GPU上运行本地模型?
本周我开始对不同模型进行基准测试。我正在改进OpenClaw上的模型选择和切换用户体验,例如,我运行
/model vllm/gemma-e4b
来切换通道中的模型,然后模型控制器自动将其加载到内存中,准备好,或者如果容量不足则给出内存不足错误。就像你在并行使用多个模型时一样
接下来我将尝试llama-swap、LM Studio和Ollama,并对它们进行比较。模型有大量的变体、权重格式和量化,需要进行基准测试
到目前为止,我一直使用未量化的原始safetensors,这已经让我能够在硬件上并行运行大约5次生成
所以如果我打算尝试LM Studio,我宁愿使用bf16 ggml-org/gemma-4-E4B-it-GGUF,而不是更小的版本——因为如果你的硬件可以在未量化版本上运行5个并行会话,那么削弱一个已经很小的模型是没有意义的
本周晚些时候,我还将和@mervenoyann一起发布关于这些的体验报告和基准测试结果
如果你已经在OpenClaw上尝试过这些模型,我想听听你的想法
本周我开始对不同模型进行基准测试。我正在改进OpenClaw上的模型选择和切换用户体验,例如,我运行
/model vllm/gemma-e4b
来切换通道中的模型,然后模型控制器自动将其加载到内存中,准备好,或者如果容量不足则给出内存不足错误。就像你在并行使用多个模型时一样
接下来我将尝试llama-swap、LM Studio和Ollama,并对它们进行比较。模型有大量的变体、权重格式和量化,需要进行基准测试
到目前为止,我一直使用未量化的原始safetensors,这已经让我能够在硬件上并行运行大约5次生成
所以如果我打算尝试LM Studio,我宁愿使用bf16 ggml-org/gemma-4-E4B-it-GGUF,而不是更小的版本——因为如果你的硬件可以在未量化版本上运行5个并行会话,那么削弱一个已经很小的模型是没有意义的
本周晚些时候,我还将和@mervenoyann一起发布关于这些的体验报告和基准测试结果
如果你已经在OpenClaw上尝试过这些模型,我想听听你的想法