行业新闻

中诚华隆发布 HL200 推理芯片及超节点集群,主打万卡级推理算力

国产推理算力从单芯片走向万卡集群,HL200 主打高能效、低时延,推动大模型商业化落地。

中诚华隆推出第二代推理芯片 HL200,支持 FP4/FP8 超低精度,单卡 FP8 算力 2P,能效比 5.12 TFLOPS/W。配套超节点集群可实现最高 10240 卡横向扩展,目标解决万亿参数大模型的高并发、低时延推理需求。

正文摘录

近日,中诚华隆在北京举办 2026 GPU 新品发布会,正式推出全新 HL200 推理芯片与超节点智算集群方案,标志着国产 AI 推理算力从单点芯片突破走向万卡级集群体系化协同的跨越式升级。工业和信息化部电子信息科技委执行副主任兼秘书长毕开春、中国科技咨询协会理事长刘志光出席活动并致辞。来自国家主管部门、科研院所、产业投资机构、央国企及产业链核心合作伙伴的百余位代表参会,共同见证国产推理算力全新成果落地。 当前,AI 产业正加速从训练驱动转向推理驱动。随着 AI Agent 规模化落地、长上下文交互与多轮对话场景普及,行业 Token 消耗快速攀升,超长上下文场景下的高效、低时延推理能力,已成为算力赛道的核心竞争壁垒。 面向万亿参数大模型商业化落地的刚性需求,中诚华隆延续“一年一芯”迭代节奏,在前代芯片技术积淀基础上全面升级,推出第二代 HL200 推理芯片,精准适配生成式 AI 与 AI Agent 的高并发推理场景。 HL200 原生支持 FP4、FP8 超低精度推理,同时兼容主流 FP16 精度,全维度覆盖大模型推理算力需求。数据显示,单卡 FP16/BF16 算力为 0.5P,FP8 算力为 2P,FP4 算力为 4P,能效比达 5.12 TFLOPS/W,稳居国内第一梯队,有效解决行业推理能效偏低、部署成本偏高的痛点。生态层面,HL200 全面兼容 PyTorch、ONNX、vLLM 等主流技术栈,并配套 OpenAI 兼容接口与轻量化迁移方案,大幅降低企业模型迁移与业务切换成本。 目前,HL200 在 DeepSeek V4 Flash、DeepSeek V4 Pro、GLM 5.2 等主流大模型的对标适配测试中,相比国际同级芯片,Prefill 全流程性能全面领先,模型解码延迟优势显著,可稳定支撑大模型规模化、高时效商业推理部署。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-08-24原文

相关内容