行业新闻

商汤大装置用系统优化将国产算力做成正毛利生意

商汤通过异构计算、系统优化与算电协同,让国产芯片跑出正毛利,展示了系统级创新如何突破硬件瓶颈。

商汤把高端芯片留给最吃带宽的Decode环节,让30块国产芯片做Prefill,整体算力利用率提升85%-152%。再叠加算电协同Agent,单位电力的Token产出增加80%。这套端到端自研的方案,让国产芯片从亏钱变成了能赚钱的生意。

正文摘录

预计到 7 月末,商汤大装置的日均 Token 处理量,将从年初的 4000 亿一路狂奔到 2.42 万亿,年底还冲着 10 万亿去,大概是年初的 25 倍。 商汤大装置负责人杨帆介绍,过去好几年,算力圈一直在念叨一句老话——谁买国产芯片,谁认亏。 商汤大装置没有守株待兔,不等这道差距被芯片厂商自己填平,就先跑通了一套 系统层面的组合方案。 他们将 Prefill 和 Decode 阶段分离,把对显存和带宽要求最高的 Decode 环节,交给性能更强的高端资源撑着;对算力要求相对分散的 Prefill 环节,则交给数量更多的国产芯片扛。 这样分的道理并不复杂,Decode 阶段要一个字一个字往外蹦,每蹦一个字都要把之前生成的内容在显存里翻一遍,吃的是带宽; 有了这样的分工,一块高端芯片,大概就能带动约 30 块国产芯片一起干活,拿到与单独用高端资源接近的效果。 商汤大装置 前后适配过 20 多款不同厂商的国产芯片,其中已经有六七款能够稳定地商业化盈利。 这些工作琐碎但繁重,从底层的编译器适配,到算子重写,再到上层框架的对接,最后还要落到调度策略的调整,每一层都得单独去啃。 为此,商汤大装置在算子层面做了针对性的重写和调优,又在系统层级调整了资源分配和调度策略,把国产芯片的算力利用率尽可能地压榨了出来。 通过异构混合推理,主流国产芯片 MFU(Model FLOPs Utilization,模型算力利用率)提升了 85%-152%。 具体到业务场景,在 AI4S 长序列蛋白质预测场景中,通过融合算子优化,整体预测耗时减少 75%;在 AIGC 视频生成场景中,国产芯片运行 DiT 模型时,多卡并行视频生成加速比达到了 93%。 商汤这套用高端资源撑瓶颈、通用国产卡冲量的混合推理方案,之所以能跑通,光靠技术优化还不够。

阅读原文(qbitai.com)→

行业新闻Jay2026-07-19原文

相关内容