多家机构联合发布异构LLM推理设计实践,厘清三大核心边界决策
为异构LLM推理提供了系统性设计地图,帮助工程团队避免跨硬件部署的常见陷阱。
大模型推理部署中,Prefill和Decode阶段常运行在不同硬件上,但缺乏统一设计范式易导致推理错乱。论文系统拆解异构推理设计空间,提炼三个核心边界决策与九条最佳实践,避免试错调参陷阱。
正文摘录
异构 Token 工厂不再踩坑!多机构联合发布工业级设计实践,拆解跨硬件推理服务的核心边界 .jpg) 随着大模型推理服务部署走向成本与算力双约束,Prefill-Decode (PD) 分离的异构推理 已从前沿方案进入生产落地。推理加速器的差异性体现在不同精度计算速度、访存带宽与存储大小、机内机间通信带宽等多方面。比如构建异构 Token 工厂时,可以选择计算密集型的硬件算力运行 Prefill 阶段,高通信带宽的硬件算力运行 Decode 阶段。此时 KV Cache 跨硬件、跨精度、跨互联传输成为常态,但业界长期缺乏统一设计范式 —— 硬件、量化精度、网络、KV Cache 分层存储的选型互相耦合,部署运维人员只能靠试错调参,极易出现字节传输成功但推理结果错乱、首 Token 延迟飙升、KV Cache 数据污染、故障恢复失效等问题。 近日,上海创智学院、上海交大、复旦、人大、沐曦、基流、上海仪电多家产学研机构联合发布论文《Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving》,首次系统性地拆解了异构 Prefill-Decode 推理的设计空间,提炼出三个核心边界决策与九条部署最佳实践,并在沐曦 C600 GPU + 英伟达 Hopper GPU 的生产环境中完成验证。