行业新闻

北大联合阶跃星辰提出 TensorCast,统一管理大模型张量,首字延迟最高降 93.2%

TensorCast 统一管理模型权重和 KV Cache 等张量生命周期,用可编程抽象替代重复优化,使推理更快且更灵活。

大模型推理中,模型权重、KV Cache(注意力缓存,存储历史键值以加速生成)等张量的管理分散在各系统中,重复造轮子且难以协同。北大、阶跃星辰和北邮提出 TensorCast,在计算、网络和存储间加入统一可编程的张量管理抽象层,让开发者像管理系统资源一样管理张量。在高并发多轮对话 Agent 场景,首字延迟(从请求到首个输出字符的时间)最高降低 93.2%。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/a4a1ee8a-569b-4923-b52c-78a6e76829e8/055(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。 然而,随着模型规模持续增长、上下文长度不断扩展,以及多轮交互 Agent 等新型应用快速兴起,大模型基础设施正在面临一个新的挑战 —— 面对海量跨系统组件流动的「张量状态」,大模型基础设施如何灵活高效地管理它们? 例如: - 大模型服务弹性扩容时,需要将 TB 级模型权重快速分发到新实例; - 长上下文、多轮对话场景中,需要存储大量 GB 级 KV Cache,并在推理实例之间快速迁移、复用; - 强化学习中,需要将训练节点产生的 TB 级新模型参数快速同步到大量 rollout 推理节点。 这些张量已经不再只是计算过程中的临时数据,而逐渐成为大模型系统中的核心状态。围绕每个需求,学界业界已经有了定制化的优化方案。然而,一个新的问题正在出现: 不同系统都在重复解决类似的张量管理问题,却缺少一个统一的基础抽象 。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-17原文

相关内容