行业新闻

NVIDIA 加速 Google DeepMind 的 DiffusionGemma 以支持本地 AI

NVIDIA 加速 Google DeepMind 的 DiffusionGemma 以支持本地 AI

DiffusionGemma 通过并行生成文本块大幅降低延迟,NVIDIA 优化使其在消费级 GPU 上也能高效运行,推动本地 AI 应用发展。

Google DeepMind 发布了 DiffusionGemma —— 一种能并行生成多个词、而非逐个词输出的实验性开源文本模型。NVIDIA 对其进行了优化,使其在 GeForce RTX、RTX PRO 和 DGX Spark 等本地 GPU 上运行得更快,让开发者获得低延迟的单用户工作负载体验。

正文摘录

今天,Google DeepMind 发布了 DiffusionGemma —— 一款实验性的开源模型,专为极速文本生成而设计。NVIDIA 已对 DiffusionGemma 进行优化,使其在 NVIDIA GeForce RTX GPU、NVIDIA RTX PRO 平台和 NVIDIA DGX Spark 系统上运行得更快,覆盖从本地 PC 到云端的环境。 DiffusionGemma 并非逐字生成文本,而是并行生成多个词,一次性输出整块文本,为开发者、研究人员和 AI 爱好者日常运行的单用户负载开辟了新的低延迟前沿。 新模型的特点包括: - 并行生成:DiffusionGemma 每一步最多可去噪 256 个 token,而非逐个预测。 - 基于 Gemma 4:DiffusionGemma 构建在 Gemma 4 之上,这是一个 260 亿参数的混合专家模型,每一步仅激活 38 亿参数,将扩散头与 Google 的 Gemma 4 架构相结合。 - 性能提升高达 4 倍:这一提升意味着在本地硬件上实现快速文本生成,而单用户生成通常会在本地硬件上出现延迟。 - 开源且本地运行:DiffusionGemma 采用宽松的 Apache 2.0 许可证开放权重,完全在 RTX 和 DGX Spark 上运行 —— 无需云端,无单次 token 成本 —— 并在 [Hugging Face Transformers](https://huggingface.co/nvidia/diffusiongemma-26B-A4B-it-NVFP4)、vLLM 和 Unsloth 中获得首发支持。 另一种文本生成方式 目前广泛使用的大语言模型几乎都是自回归的 —— 即逐个生成 token,每个新词都依赖于前一个词。这种顺序处理正是交互式 AI 感觉像是在“打字”的原因。

阅读原文(blogs.nvidia.com)→

行业新闻Michael Fukuyama2026-06-10原文

相关内容