将空白Hermes安装转化为本地主权Agent,运行在RTX 5090上
我今天花了时间将空白的 Hermes 安装转化为 RTX 5090 上的主权本地 agent。始终在线,可通过 Telegram 访问,完全本地化。以下是它能做的一切。
它在 5090 上运行 Qwen3.6-27B,并通过 Telegram 从我的手机回答。
~~~
我首先让它更快。切换到 MTP 构建以实现自推测解码:62 > 115 tokens/sec。
~~~
它现在可以按命令对模型进行基准测试。我让它对 gguf 进行速度测试,它会停止自己的模型服务器以释放 GPU,运行 llama-bench,渲染一张卡片,发送到我的手机,然后重新启动自身。它从未离线过。
~~~
它也非常了解我。我把它指向我的私有 HF 仓库,那里存储了我从使用 AI 开始的所有 AI 痕迹。我创建了一个本地 markdown 记忆库,从我的历史中播种,并对其进行语义搜索。
~~~
整个堆栈都留在家中:磁盘上的权重,5090 上的推理,口袋中的 agent。
这是它制作的展示其所有功能的视频。
它在 5090 上运行 Qwen3.6-27B,并通过 Telegram 从我的手机回答。
~~~
我首先让它更快。切换到 MTP 构建以实现自推测解码:62 > 115 tokens/sec。
~~~
它现在可以按命令对模型进行基准测试。我让它对 gguf 进行速度测试,它会停止自己的模型服务器以释放 GPU,运行 llama-bench,渲染一张卡片,发送到我的手机,然后重新启动自身。它从未离线过。
~~~
它也非常了解我。我把它指向我的私有 HF 仓库,那里存储了我从使用 AI 开始的所有 AI 痕迹。我创建了一个本地 markdown 记忆库,从我的历史中播种,并对其进行语义搜索。
~~~
整个堆栈都留在家中:磁盘上的权重,5090 上的推理,口袋中的 agent。
这是它制作的展示其所有功能的视频。