商汤大装置分享异构推理架构:日均 Token 服务量半年增近十倍
商汤大装置讲了一件事:当推理需求爆炸,怎么用不同品牌芯片混着跑、动态分配 Prefill 和 Decode 资源,把单位 Token 成本压下来。
Token 调用量向千倍级增长,推理已取代训练成为算力增长主引擎。商汤大装置资深技术专家罗伟在 2026 全球 AI 芯片峰会介绍,平台以 Token、状态与时延预算为中心,通过横向资源编排与纵向模型、引擎、芯片三层优化提升 Token 产能,日均 Token 服务量从 2 月的 0.46 万亿增至 8 月的 4.5 万亿。
正文摘录
- title: 让 Token 生产更高效:异构混推的关键技术演进与创新实践 - sourcecompany: 量子位 - bodymarkdown: Token 经济加速爆发,算力需求发生结构性反转,推理需求已取代训练,成为算力增长主引擎。 随之而来的,是 AI 基础设施面临的全新命题与挑战:当 Token 调用量迈向千倍级增长,推理系统如何承接持续攀升的需求?如何通过异构算力实现高效、稳定的 Token 生产? 在近日举办的“2026 全球 AI 芯片峰会·Token 工厂异构混训混推技术研讨会”上,商汤大装置资深技术专家罗伟以《Token 工厂:以异构算力构建新一代 Al 基础设施》为主题发表演讲,深入剖析规模化推理面临的系统挑战,并分享 商汤大装置在异构推理架构、模型适配及关键技术演进等方面的实践与探索 。 01 行业挑战:Agent 时代,推理负载瓶颈贯穿整套系统 Agent 时代的负载特征,和传统单轮对话的推理需求有明显不同。 首先是长上下文,带来了输入计算和 KV Cache 占用的持续增长;其次是连续多轮的对话,意味着前缀复用和热点不断变化;再者是突发与长尾需求多,意味着流量和长度的分布会持续波动。 罗伟表示,面对这些变化,商汤大装置的底层逻辑已经转向“以 Token、状态与时延预算为中心”,所有设计都围绕 Token 的生产效率、交付质量与单位成本,进行资源的组织和利用。 这一以 Token 为中心的系统设计,也支撑商汤大装置持续提升规模化 Token 生产与服务能力。如今,商汤大装置的日均 Token 服务量,已经从年初 2 月的 0.46 万亿,增长至 8 月 4.5 万亿。 02 创新实践:横向串资源、纵向拉效率,系统级提高 Token 产能 如何把单点效率组织成系统级 Token 产能?罗伟分享了商汤大装置的两条主线:“横向编排”与“纵向优化”。