AI 算力维保

AI 算力维保

难的不是换件,是判断该不该换、能不能修

GPU 集群停一天的代价,和一台文件服务器停一天完全不是一个量级。但能修 AI 算力设备的第三方服务商很少。

HGX / SXM

整机平台

板卡级

维修与整机复原

380V

自有工业用电测试

3000W+

CRPS 电源常备

7×24×4

报障响应

GPU 集群停一天的代价,和一台文件服务器停一天完全不是一个量级。但市面上能修 AI 算力设备的第三方服务商很少——难的不是换件,是判断该不该换、能不能修。

我们从 GPU 板卡到整机集群,覆盖 AI 服务器全链路的备件供应与技术服务。


覆盖哪些设备

  • NVIDIA HGX / SXM 整机平台 H100 / H200 / A100 / A800 等
  • PCIe 加速卡 L40S / A100 / RTX 4090 / 5090 等
  • 主流品牌 AI 服务器整机 浪潮 / 超聚变 / 新华三 / 联想 / 戴尔 / 超微 等
  • 配套算力网络设备 InfiniBand / RoCE 交换机与网卡

备件分三个层级

模组级

SXM / HGX GPU 模组、SXM Baseboard、NVLink / NVSwitch 模块。

板卡级

PCIe 加速卡、IB / 以太网卡、RAID 卡、光模块与高速线缆、主板。

整机与配套级

AI 服务器整机、3000W+ CRPS 电源模块与供电板、风冷模组与风扇模组、内存与 NVMe、机框、背板、导轨与线束。


四类最容易导致停机的故障,以及我们怎么处置

AI 算力四类高发故障与处置:GPU 掉卡、显存报错、供电与散热、训练中断误判
四类高发故障与我们的处置判断。板卡级维修与整卡更换的价格差着一个数量级。

GPU 掉卡(XID 79 / GPU fallen off the bus)

长时间满载后的热循环,导致供电虚焊、金手指接触不良、PCIe 链路降级。

处置:热态复现定位,板卡级维修优先于整卡更换。 一块 GPU 模组的价格和一次板级维修的价格,中间差着一个数量级。

显存报错(ECC 报错 / Row Remapping 资源耗尽)

HBM 坏行屏蔽资源用尽之后会持续报错,硬拆返修风险极高。

处置:先判定「可修」与「必须更换」的边界,避免无效返修和二次损失。这一步判断错了,钱和时间会一起赔进去。

供电与散热

3000W 级电源模块失效、风扇模组衰减、硅脂泵出导致的持续高温。

处置:整套供电与散热备件常备,同步排查机房侧配电与三相平衡。 很多「服务器问题」的根在机房配电上。

集群训练中断被误判成 GPU 故障

训练中断常见于网络侧而非计算侧,容易被当成 GPU 坏了。

处置:链路级排查,光模块与高速线缆备件池支持即换即测。


我们具备的技术能力

  • 故障定位:XID 错误码分析、掉卡诊断、显存 ECC 与坏行屏蔽判定
  • 板卡级维修与整机复原
  • 出库前 48 小时以上满载压测
  • 自有 380V 工业用电测试环境,支持整机满载加电测试
  • 现场备件库:按客户机型在机房预置备件
  • 7×24×4 报障响应,备件先行到场
  • 整机技术培训与一线工程师带教

一句话

我们的价值不在于修得快 —— 而在于故障发生时,对应备件已经在库、已经测过、可以直接上机。


手上有 GPU 或 AI 服务器的故障、料号或备件清单要核对的,直接发过来。 联系方式见联系我们,24 小时内人工回复。