讨论 LLM 按 token 计费与算力预留难题,欲让开源模型弹性扩缩容
唯一能提供真正按 token 计费的公司是那些实验室。
其他所有人都不得不迅速退回到预置容量,因为他们需要专门围绕你的流量做规划。这意味着你会为闲置的 GPU 支付高得多的费用。
所以,如果你想基于像 kimi k3 这样的开源模型自由构建,并随时扩缩容,目前是做不到的。
我们的目标是发展到足够大,成为第一家提供这种产品的公司。
其他所有人都不得不迅速退回到预置容量,因为他们需要专门围绕你的流量做规划。这意味着你会为闲置的 GPU 支付高得多的费用。
所以,如果你想基于像 kimi k3 这样的开源模型自由构建,并随时扩缩容,目前是做不到的。
我们的目标是发展到足够大,成为第一家提供这种产品的公司。