部署和推理 HuggingFace 上的任何模型
介绍 Together AI 的 Goose 工具如何一键部署 HuggingFace 模型到 GPU 环境,省去基础设施配置。
用 Goose 和 Together 的专用容器推理服务,只需一个提示就能将任何 HuggingFace 模型部署到生产级 GPU 环境。无需复杂配置,发布当天即可运行。
正文摘录
开发者的工作方式正在发生真实转变。代理(Agent)打开了过去看似禁区的工作——不是因为技术不可行,而是因为需要大多数人不具备的细分专业知识。容器化、推理服务器配置、模型专属环境搭建:这些任务过去要么需要深厚专业知识,要么得花上数小时自学才能入门。代理提供了一种优雅的方式,填补那些前置知识缺口。你描述需求,代理来填补知识空白。 这就是解锁的关键。不是速度,而是 可访问性。 Netflix 发布新模型的当天 Netflix 最近在 HuggingFace 上发布了 [void-model](https://huggingface.co/netflix/void-model)。发布那天,我的第一反应和往常一样:我想试试。但“想试一个新模型”和真正 运行 它是两回事。把它部署到可用环境、配置推理服务器、搞定容器配置、把一切正确连接起来——这部分通常会在“这个看起来很酷”和“好了,我实际在用”之间引入一到两天的延迟。 这一次,延迟几乎为零。 使用 [Goose](https://goose-docs.ai/)(一个 CLI 代理运行器)结合 Together 的 [dedicated containers skill](https://github.com/togethercomputer/skills/tree/main/skills/together-dedicated-containers),我在一次会话中就从“Netflix 刚发布了一个模型”到“我已经有一个正在运行它的容器”。代理生成了部署 void-model 到 Together 的 Dedicated Container Inference (DCI) 基础设施所需的所有代码,基本上就在发布当天。