行业新闻

Databricks AI规模训练中GPU故障治理实践

Databricks AI规模训练中GPU故障治理实践

Databricks AI分享了大规模GPU训练中故障分类与治理方法,强调静默故障和数值损坏比崩溃更难检测,并以故障概率公式量化工程难度。

大规模GPU训练中,故障分为崩溃、静默降级和数值错误三类。Databricks AI介绍了从硬件到软件层的多级健康检查系统,以及故障率随规模指数增长(1024卡30天57%概率)的工程挑战。

正文摘录

如何在 Databricks AI 保持 GPU 可靠 作者:Steven Chen, Feng Wang, Bhavik Soni, Chengguang Yang, Albert Zhong, Naren Loganathan, Harsh Panchal 和 Jianwei Xie 分布式 GPU 训练已成为行业常态。团队现在训练基础模型、微调前沿规模模型、构建大型视觉系统,并运行深度推荐网络,规模曾仅限于前沿实验室。 构建能满足当今规模的 GPU 基础设施需要在很多方面做对:检测导致运行中断的故障、发现从不自我宣告的缓慢退化、验证数千条链路的 fabric 健康状态、围绕最终会失效的硬件做调度,以及当失效发生时干净地恢复。其中许多是基础性问题,而上层更难的问题依赖于它们。 在 Databricks AI,我们每周大规模运行训练工作负载,故障持续在硬件、fabric 和软件中显现。本系列涵盖在此规模下保持 GPU 可靠所需的一切,从本篇博文的基础开始:运行 GPU 时遇到的故障模式、浮现这些故障的多样化工作负载,以及捕获它们的多阶段健康检查系统。训练是最苛刻的工作负载类别,也是这里关注的焦点,尽管同样的工程服务于 Databricks 的推理和其他 GPU 工作负载。 大规模 GPU 故障的三大类别 大规模 GPU 故障大多分为三类:崩溃作业、静默减速和数值损坏。崩溃作业是容易的情况,因为一旦发生你立刻就知道。更难处理的故障是工作负载完成但模型中带有错误数值,或者以降级性能运行数小时而无人察觉。 崩溃作业 分布式训练作业崩溃的原因有很多:GPU 退化或从总线脱落、RDMA fabric 问题、I/O 系统挂起、CPU 端 rank 与其他 rank 偏离。

阅读原文(databricks.com)→

行业新闻2026-07-01原文

相关内容