
AI 算力维保
难的不是换件,是判断该不该换、能不能修
GPU 集群停一天的代价,和一台文件服务器停一天完全不是一个量级。但能修 AI 算力设备的第三方服务商很少。
HGX / SXM
整机平台
板卡级
维修与整机复原
380V
自有工业用电测试
3000W+
CRPS 电源常备
7×24×4
报障响应
GPU 集群停一天的代价,和一台文件服务器停一天完全不是一个量级。但市面上能修 AI 算力设备的第三方服务商很少——难的不是换件,是判断该不该换、能不能修。
我们从 GPU 板卡到整机集群,覆盖 AI 服务器全链路的备件供应与技术服务。
覆盖哪些设备
- NVIDIA HGX / SXM 整机平台 H100 / H200 / A100 / A800 等
- PCIe 加速卡 L40S / A100 / RTX 4090 / 5090 等
- 主流品牌 AI 服务器整机 浪潮 / 超聚变 / 新华三 / 联想 / 戴尔 / 超微 等
- 配套算力网络设备 InfiniBand / RoCE 交换机与网卡
备件分三个层级
模组级
SXM / HGX GPU 模组、SXM Baseboard、NVLink / NVSwitch 模块。
板卡级
PCIe 加速卡、IB / 以太网卡、RAID 卡、光模块与高速线缆、主板。
整机与配套级
AI 服务器整机、3000W+ CRPS 电源模块与供电板、风冷模组与风扇模组、内存与 NVMe、机框、背板、导轨与线束。
四类最容易导致停机的故障,以及我们怎么处置

GPU 掉卡(XID 79 / GPU fallen off the bus)
长时间满载后的热循环,导致供电虚焊、金手指接触不良、PCIe 链路降级。
处置:热态复现定位,板卡级维修优先于整卡更换。 一块 GPU 模组的价格和一次板级维修的价格,中间差着一个数量级。
显存报错(ECC 报错 / Row Remapping 资源耗尽)
HBM 坏行屏蔽资源用尽之后会持续报错,硬拆返修风险极高。
处置:先判定「可修」与「必须更换」的边界,避免无效返修和二次损失。这一步判断错了,钱和时间会一起赔进去。
供电与散热
3000W 级电源模块失效、风扇模组衰减、硅脂泵出导致的持续高温。
处置:整套供电与散热备件常备,同步排查机房侧配电与三相平衡。 很多「服务器问题」的根在机房配电上。
集群训练中断被误判成 GPU 故障
训练中断常见于网络侧而非计算侧,容易被当成 GPU 坏了。
处置:链路级排查,光模块与高速线缆备件池支持即换即测。
我们具备的技术能力
- 故障定位:XID 错误码分析、掉卡诊断、显存 ECC 与坏行屏蔽判定
- 板卡级维修与整机复原
- 出库前 48 小时以上满载压测
- 自有 380V 工业用电测试环境,支持整机满载加电测试
- 现场备件库:按客户机型在机房预置备件
- 7×24×4 报障响应,备件先行到场
- 整机技术培训与一线工程师带教
一句话
我们的价值不在于修得快 —— 而在于故障发生时,对应备件已经在库、已经测过、可以直接上机。
手上有 GPU 或 AI 服务器的故障、料号或备件清单要核对的,直接发过来。 联系方式见联系我们,24 小时内人工回复。
