行业新闻

智谱上线GLM-5.3-Flash 商汤大装置提供国产算力支持

国产算力大规模支撑前沿模型商用,性能与成本已接近英伟达GPU。

智谱上线并开源GLM-5.3-Flash(320B-A18B),为首个原生多模态模型,性能超此前版本,在AA指数中与Claude Opus 4.8持平。商汤大装置以国产异构芯片集群支持其大规模商用,Token调用量达62T,端到端性能提升3倍。

正文摘录

8月26日晚,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列的首个原生多模态模型。其总参数 320B,能力超过 GLM-5.2,在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 57 分,进入全球前沿模型能力区间,与 Anthropic 最受欢迎的模型 Claude Opus 4.8 得分持平。GLM-5.3-Flash 的架构专为极低成本而设计,结合智谱最新的 30T Token 多模态预训练语料,能够以更少的计算资源实现更强的性能。 依托先进的国产异构混推技术,商汤大装置为 GLM-5.3-Flash 上线提供大规模国产算力支持与 Token 服务,打造国产算力规模化商用又一硬核落地标杆。 这一合作的背后,正是商汤打造的 “一套模型、一座 Token(词元)工厂、一套智能体管控系统” 核心能力体系。其中 Token 工厂承担着把智能能力规模化生产出来的关键作用:它通过多模态模型和大装置基础设施的联合优化,把不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的 Token。同时 Token 工厂与大模型之间构建起双向反哺闭环,更好适配原生多模态模型的迭代需求。商汤大装置高效支持了智谱 GLM-5.3-Flash 的上线工作,正是这套闭环能力的有力印证。 长期以来,市场对国产算力的认知是,性价比不高、难以规模商用。而在正式发布前,GLM-5.3-Flash 以匿名模型 Ox-Alpha(中文社区称作牛来)在 OpenCode 和 OpenRouter 上进行了大规模测试,Token 调用量高达 62T,这些请求流量全部由国产芯片提供算力支持。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-08-28原文

相关内容