沐曦联合十大开源社区共建国产GPU算力生态
沐曦通过深度开源和快速适配,力图打造国产GPU的Android式生态,降低开发者迁移门槛。
沐曦在WAIC上展示其全栈开源软件MXMACA,兼容PyTorch 2.8全部GPU算子,并联合vLLM、龙蜥等十大社区。目标是通过开放生态降低迁移成本,吸引500万开发者,让国产GPU真正可用。
正文摘录
在算力这条赛道里泡久了的人都清楚一件事,NVIDIA 能稳坐龙头,靠的从来不只是单颗芯片的硬件性能。 制程、架构、显存这些硬件指标,都是有清晰参数、看得见摸得着的东西,国产厂商咬着牙研发,总有机会把差距收窄。 换一张算力卡,意味着要把过往多年的技术积累大幅推倒重来,迁移成本足以让大多数团队止步。 所以国产 GPU 真正要啃的硬骨头,是造出一个能让开发者心甘情愿迁过来的国产算力开发环境。 这套全栈软件从编译器、算子底层函数库,一路覆盖到各大主流 AI 推理训练框架,目标只有一个: 他们专门搭了一套自动化测试体系,纳入 GitHub 上近 5000 个热门开源项目,每一轮 MXMACA 版本更新都要跑一遍全量测试。 针对 PyTorch 2.8,MXMACA 把全部 2410 个 GPU 算子做到了完整兼容;更关键的是速度,每次 PyTorch 出新版本,行业里同类方案通常要磨上好几个月才能适配完,沐曦这边一周就能收工。 生态里两百多款大模型,沐曦自己只深度调试了五六十款主流型号,剩下的直接甩给普通本科生,让他们拿着沐曦的显卡逐一去测。最后只有十来款出现了适配障碍,绝大多数开箱即用。 如今,一个大模型从训练完成到上线服务,周期被压得极短,大模型厂商、云厂商都想在模型一升级就第一时间拿到收益。 可行业技术更新几乎没有间歇,今天某个模型厂商放出一套创新技术,隔天就有团队推出迭代方案。 在这种节奏下,如果只依靠一套封闭自研的软件栈闭门跟进,既跟不上行业速度,也没法快速响应客户的各类需求。 以前的常规操作是“社区发了新版本,厂商拉下来自己适配”,也就是拉源码、下 patch、打补丁、编译、调试,一整套流程走完才能用。 能做到这样,是因为沐曦的支持代码本来就长在社区里,新模型发布时往往 default 就已经支持了。