无问芯穹联合中国信通院开源首个AI Infra运维智能体评测基准
首个专门评估AI基础设施运维智能体实际解决问题的能力的开源基准发布,基于百亿真实数据,覆盖多种国产芯片。
运维智能体好不好用,不能只看“说得多好”,要看能不能解决实际问题。中国信通院联合无问芯穹发布首个面向AI基础设施的运维智能体评测基准AISHPerf,基于百亿条真实运维数据,覆盖5种国产芯片和全链路故障场景,旨在推动AI运维从经验驱动走向可量化评估。
正文摘录
.jpg) 随着全球智能体加速落地,算力需求呈指数级爆发,以 GPU 为核心的 AI 基础设施正变得愈发关键。据摩根士丹利报告预测,2028 年全球 AI 基础设施累计总投资将达 2.9 万亿美元。然而,根据行业通用成本结构测,其中由运维人力、故障损失与集群闲置构成的成本占比可高达 15%20%,全行业潜在的可优化空间超过 4350 亿美元。 作为全球领先的 AI 基础设施服务商,无问芯穹早在去年 10 月便率先启动研发并成功部署早期版本的运维智能体。实践表明,相比传统人工运维,智能体显著提升了整体运维效率: 工单平均处理时长缩短 50%,关键故障处理效率提升约 6 倍;运维人员得以从重复性的排查工作中解放,人效提升 5 倍以上,综合运维成本下降约 30% ,为大规模 GPU 训练与推理业务提供了更加稳定、高效的基础设施保障。 但究竟什么样的运维智能体才是 “好用” 的智能体? AI 集群运维是一个极具挑战性的场景,涉及复杂的系统知识、工具调用以及长链路推理,是对智能体能力的综合考验。过去对模型的评估看重语言能力, 而当 AI 进入基础设施领域后,“能否解决实际问题” 已成为核心评判标准 —— 它最终会影响到每一度电、每一张 GPU 卡的产出效率。 基于此, 中国信息通信研究院(简称 “中国信通院”)推出了首个面向 AI Infra 运维的智能体评测基准 ——AISHPerf - 智算运维智能体评测基准,而无问芯穹作为重点技术支持单位参与了基准建设 ,基于积累的近百亿条真实运维数据,为智能体在智算运维场景的落地定义了问题并提供了一个可参考的基线。