浪潮信息发布元脑 SD200 Ultra 与 HC2000 两款智算产品
浪潮信息把 AI 算力瓶颈拆成能力上限与规模供给两层,用两款新品分别应对,提供了看智算走向的框架。
浪潮信息在 AICC 2026 发布两款智算产品:超节点 AI 服务器元脑 SD200 Ultra 单机可运行 10 万亿参数模型,All to All 通信时延降至 0.69 微秒;多元算力机组元脑 HC2000 让不同类型芯片按推理阶段分工,官方称同等投资下 Token 产能提升 10 倍。
正文摘录
但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。 前沿模型的参数规模、上下文长度、推理深度在同时变大,Agent 可能连续运行几个小时甚至几天。 另一个问题是 智能规模 ,这个问题更直击灵魂——你的算力能以多低的成本生产多少智能? Token 需求在爆发,但推理负载是多元的,Prefill 和 Decode 的计算特征不同,堆同一种算力已经覆盖不了这些差异。 智能上限和智能规模,两个问题各自独立,又相互关联,只解决其中一个,无法突破全部的算力瓶颈。 刚刚的 AICC(人工智能计算大会)2026 上,IDC 发布了 《2026 年中国人工智能计算力发展评估报告》 ,把这两个方向拆开讲了一遍。 过去,人们使用大模型时,算力调用更像是「脉冲式」的,用户问一个问题,系统返回一个答案,只调用一次算力。 但在 Agent 接管任务之后,情况变了。一个人类意图可能触发几十次、几百次连续推理;多个 Agent 组成协作网络之后,系统连续运转的时长,还能进一步增加到几个小时甚至好几天。 原本一次次短暂发生的算力请求,开始变成持续不断的计算负载,并 进一步给基础设施带来新的压力 。 IDC 数据显示,从今年到 2030 年,全球 Token 消耗量的复合增长率将达到 4822.6%,Agent 吃掉的 Token 正在急剧膨胀。 IDC 报告显示,全球 AI 算力需求满足率从 2024 年的 79% 一路下滑,2027 年预计跌至 71%,即便此后上游半导体供应链压力有所缓解,到 2030 年也只能恢复到 77% 左右。 百分比的波动看起来不大,但需求基数在急速膨胀,到 2030 年,算力缺口的绝对值将达到 3809 亿美元,扩大到 2024 年的将近十倍。 过去,弥补这种缺口的方式主要是靠「大力出奇迹」,也就是通过集群规模的扩展,堆叠更多的算力。