动态

NVIDIA通过CUDA和硬件创新主导AI计算市场

NVIDIA通过CUDA和硬件创新主导AI计算市场
Zephyr
> 2006年,我是英伟达
> 制造GPU让玩家能高清玩《魔兽世界》
> 黄仁勋有个愿景
> "如果我们让它们做……数学呢?"
> 整个董事会觉得他终于疯了
> 创建CUDA
> 一个优雅的软件监狱,学者们自愿成为囚犯
> 玩家困惑了。"这能让《孤岛危机》跑得更快吗?"
> 黄仁勋:"……不 :)"

> 快进到2012年
> AI研究人员,在阿德拉和免费披萨的刺激下,发现他们需要大量矩阵乘法来生成猫图片
> 他们的Intel至强处理器在哭泣、冒烟,并申请离婚
> 他们发现了CUDA
> "天哪,你做的这个数学玩意太完美了"
> 整个AI领域成为一家以让《堡垒之夜》运行更流畅而闻名的公司的子公司

> 我们看到这一切,眼睛变成了美元符号
> 决定监狱需要更好的设施
> 发明Tensor Cores
> "如果芯片的一部分只做AI数学,但速度快得离谱呢?"
> 就像给一辆本田思域加了一个专门用于去杂货店的氮气加速器
> AMD的竞争卡正试图用算盘和希望做同样的数学

> 因为研究人员太懒,不能信任他们写一个for循环
> 只需给他们一个大的红色"MAKE AI"按钮,运行我们的代码
> 创建cuDNN
> 直接嵌入TensorFlow和PyTorch
> 生态锁定完成。我们拥有土地、工厂和工人的灵魂。

> 一群来自叫"OpenAI"的东西的嬉皮士打电话
> 他们想构建AGI之类的东西
> 他们需要算力
> 带着世界上第一台DGX-1来到他们的办公室,可能是个改造过的车库
> 就像《太空漫游》中的巨石
> 我告诉他们它有8个通过NVLink连接的GPU,这样它们可以像女学生一样以光速八卦
> 他们问它做什么
> "它做AI,白痴。插上电就行。"
> 他们签了文件。

> 但我们还没完。监狱需要更好的院子。
> 看到他们试图用CAT-5网线连接我们漂亮的DGX盒子
> 尴尬。
> 收购Mellanox及其InfiniBand技术
> 现在连接GPU的神经系统也是我们的了
> NVSwitch让整机架的GPU紧紧握手,变成一个巨大的超级大脑

> 同时,在圣克拉拉一个昏暗的地下室里……AMD
> 他们发布了新GPU。"AMD Instinct MI300X!我们有更多理论算力!"
> "更好的基准测试性能。"
> 一个勇敢的研究人员尝试使用它。
> 花了6周时间安装他们的山寨版CUDA——ROCm
> 遇到400个错误、一个内核恐慌,以及他妻子的离婚文件
> 他终于让一个模型以承诺速度的一半运行
> 基准测试是针对1x1的矩阵大小
> 他把卡扔进垃圾桶,用公司卡买了块NVIDIA H100。成本无关紧要。
> 理智是无价的。

> 黄仁勋走上舞台。皮夹克有自己的引力。发布了GB200 NVL72
> 72个GPU和36个Grace CPU在一个NVLink域中,带宽130 TB/s
> GPU在思考之前就已经共享了想法。
> 2025年
> AMD推出了他们的"机架规模"解决方案,MI355X 128-GPU机架
> 只是16组8个GPU用以太网胶带粘在一起
> 一个横向扩展的小丑车
> 我们宣布Rubin CPX GPU,在推理过程中实现更便宜的预填充
> 节省$$
> 这是最终的供应商锁定
> 所有其他芯片设计师看到这一点,不得不把他们的架构扔进垃圾桶,回到绘图板
> 所有赞美穿皮衣的先知。
动态Zephyr2025-09-11原文

相关内容