商汤推异构混合推理,国产芯片参与推理集群实现盈利
商汤通过异构混合推理让国产卡发挥各自优势,推理Token规模暴涨且首次实现盈利。
商汤将大模型推理拆成Prefill(读题)和Decode(答题)两步,分别用国产通用卡和高端卡接力跑,使国产芯片参与推理集群首次实现可盈利,日均处理Token量预计年底达10万亿。
正文摘录
 新智元报道  今年 WAIC 开幕当天,上海世博展区挤满了各种机器人、大模型和智能体。 但如果你问一圈做 AI 的人,2026 年最让他们睡不着觉的事情是什么,答案出奇一致—— 不是模型不够强,是算力不够用了。 过去一年,AI 行业发生了一个根本性的切换:大模型从「陪聊」变成了「干活」。 这带来一个很直观的变化:Agent 太能吃了。 这不是夸张。今年,密歇根大学、斯坦福等机构测算发现,在一组真实软件工程任务中,编码 Agent 每生成 1 个输出 Token,背后平均要累计处理约 154 个输入 Token。  更要命的是,这些 Agent 不是偶尔吃一顿,它们 7×24 小时不停地吃。行业里的共识是,今年 AI 推理的算力需求是去年的 5 倍到 10 倍。 与此同时,英伟达最新的高端卡今年很难大批进入国内,存量供给几乎没怎么增长。 需求暴涨,供给不动。怎么办? 就在今天,商汤在总部举办以「算创·无限」为主题的 Agentic 时代 AI 基础设施创新发展论坛。