行业新闻

NVIDIA 推理软件栈在 Blackwell 上将 DeepSeek V4 Token 成本降低 5 倍

NVIDIA 推理软件栈在 Blackwell 上将 DeepSeek V4 Token 成本降低 5 倍

NVIDIA 推理软件栈通过系统级优化(而非单单硬件升级)大幅降低 token 成本,这是 AI 工厂经济性的关键战场。

当 AI 从试点走向生产,基础设施决策已从芯片峰值规格转向单位成本:每美元能产出多少 token。NVIDIA 的全栈推理软件(包括 TensorRT-LLM、Dynamo 框架等)持续提升硬件效率,仅一个月就在 Blackwell 平台上将 DeepSeek V4 的 token 成本降低了 5 倍。Baseten、Cognition、Deep Infra 和 Together AI 等公司已通过这一软件栈获得显著收益。

正文摘录

- title: NVIDIA 推理软件栈如何实现最低 Token 成本 - sourcecompany: NVIDIA - bodymarkdown: 随着组织从 AI 试点转向生产级 AI 工厂,基础设施决策的重点已从峰值芯片规格转向每 [token](https://blogs.nvidia.com/blog/ai-tokens-explained/) 成本(AI 模型处理的最小文本单元)—— 每美元、每瓦特以及在所需延迟目标内能交付多少有用的 token。 NVIDIA 的推理软件栈与 NVIDIA GPU、CPU、网络和系统协同设计,并借助广泛的开源生态增强,持续提升硬件性能。在 [NVIDIA Blackwell](https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/) 平台上,该软件栈仅用一个月就将 DeepSeek V4 模型的 token 成本降低了 5 倍。 ![](https://blogs.nvidia.com/wp-content/uploads/2026/06/semi-analysis-inference-x-5x.jpg) SemiAnalysis InferenceX 结果比较了使用 SGLang 和 NVIDIA Dynamo 推理框架的 NVIDIA GB300 NVL72 系统的 token 成本与交互性。 领先公司和推理服务提供商已经看到 NVIDIA 推理软件栈在 Blackwell 上的复合价值: - Baseten 使用 NVIDIA TensorRT-LLM 开源库在 Blackwell GPU 上服务 DeepSeek V4 Pro,用于推理、编程和长上下文场景,应用专有运行时优化,每秒 token 数提升高达 50%。

阅读原文(blogs.nvidia.com)→

行业新闻Amr Elmeleegy2026-06-30原文

相关内容