是石科技:纯软件优化使 PCIe 推理吞吐提升近 7 倍
长尾 GPU 的性能损失,多半来自框架适配而非硬件本身;这篇讲是石科技如何用纯软件把 PCIe 整机的推理吞吐拉近高端卡。
是石科技推出 Meta-Infer 推理引擎,用内核补齐、算子与通信重构、并行与显存调优、缓存复用四类纯软件手段,修补主流框架对 PCIe 等非官方验证硬件的适配短板。在 8 卡 PCIe 整机上,DeepSeek-V4.1-Flash 输入吞吐从 1932 tok/s 提升至 13274 tok/s,约 6.87 倍。
正文摘录
PCIe 显卡被低估了!内核补齐 + 通信重构,DeepSeek 推理吞吐翻近 7 倍 AI 推理的竞争正在悄然发生转向:不再单纯比拼“谁能够买到性能最顶级的硬件”,而是转向“谁可以把手中已有的算力资源用得更值”。 很多 GPU 卡,开源框架能够完成模型加载、权重下载、服务拉起,实现“能跑起来”,但实际压测性能往往远低于官方宣传水平。模型本身没有缺陷,硬件也可正常工作,性能损失的核心,来自模型框架与硬件之间存在的性能鸿沟。 这类 GPU 卡没有高速卡间互联,同时不在主流开源框架官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用 NVLink 硬件的调优参数、显存与并行配置沿用其他硬件默认值等一系列问题。硬件本身具备的算力潜力,被软件层的适配短板所禁锢。 是石科技(METASTONE)是一家“独立第三方全栈算力运营商”的科技企业。不绑定任何特定大模型厂商,致力于为客户提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。 凭借源自国家级计算中心的丰富经验,公司确保了算力集群高达 99.95% 以上的安全稳定运行(SLA)。目前,是石科技已纳管超过 20000P 的算力资源,运营 10 多个智算中心,拥有 2 个国家级超算中心。团队成员曾荣获 3 项戈登·贝尔奖,具备深厚的超大规模集群全栈技术服务实力等。 是石科技自研 Meta-Infer 高效部署引擎,是面向异构加速芯片的企业级高性能大模型推理引擎,尝试通过纯软件优化手段弥合这道硬件-框架之间的缝隙,在不改动模型结构、不修改任务语义的前提下,充分挖掘 GPU 卡架构硬件的推理能力,为行业提供一种可能性: 依靠软件优化,成本更低的 GPU 卡,有机会在部分推理业务指标上,逼近原本需要更高端 GPU 才能实现的服务能力。