寒序科技发布uHBM与uLPU推理架构,权重驻留片内减少搬运
寒序科技提出权重驻留计算方案,将模型权重存进计算芯片内,减少搬运以加速AI推理,目标达每秒2000多个token。
寒序科技发布uHBM与uLPU推理芯片架构,核心思路是把模型权重直接放进计算芯片内,用Persistent MRAM(断电不丢数据的磁随机存储器)长期保存,避免每次生成一个token都从外部存储反复读取权重。这种“权重驻留”设计旨在解决Decode阶段的内存带宽瓶颈,宣称内部读取带宽达24 TB/s。
正文摘录
 新智元报道  一个权重,只有 4 bit。 搬运十亿次,让你和 AI 有了距离。 寒序科技决定,不搬了! 今天,寒序科技正式公布 uHBM ® 与 uLPU™ 推理计算架构。  寒序 uHBM ® 与 uLPU™ 产品路线图 如果最重要的数据,根本不用搬呢? 这件事在大模型 Decode 阶段尤其突出。 一次 Token 的生成,需要反复读取巨量模型权重;对于 FFN/GEMV 这类典型 memory-bound workload,很多时候真正限制推理速度的,并不是乘法器不够多,而是权重必须一次又一次穿过存储接口,抵达计算单元。 一颗 FP4 权重只有 4 bit。 一次搬运,几乎微不足道。 但是当几十亿颗权重,为每一个 Token,一遍又一遍地移动时,它最终变成带宽、功耗、延迟和散热,最后变成一整排服务器、一整座机房,以及一张越来越大的电费账单。 这就是寒序做 uHBM ® 的起点。  uHBM ® 未封装裸晶片颗粒 他们不想继续搬得更快。他们想让权重住在计算发生的地方。