
技术笔记
现场记下来的东西,谁修的谁写
故障模式、备件兼容、固件基线,还有只有到了现场才会遇到的那些情况。写给修机器的人看,不是写给搜索引擎看。
料号库 · 故障复盘 · 行业观察
这里记录我们在现场遇到的真实问题:某个料号为什么容易踩坑、某类故障背后的机制是什么、这个行业正在发生什么变化。不是公司新闻,也不是产品软文。
料号库 具体料号的配置要点、常见坑与替代关系
故障复盘 现象、原理、排查顺序、换件动作与事后建议
行业观察 过保潮、备件供应链、第三方维保与原厂续保的差异
-
RAID 重建的那几个小时:URE、双盘失效与阵列选型
大容量盘做 RAID 5,重建期间踩中不可恢复读错误(URE)的概率有多高;重建中性能为什么掉一半;控制器更换和双控降级运行的风险与规程。
-
同型号同容量,为什么装不上
固件版本、扇区格式(512n/512e/4Kn)、实际可用容量、转速、内存 rank 与颗粒组织、原厂标识校验——备件互换性的六个维度,以及备件本身的质量问题。
-
机器没坏,只是变慢了:RAID 缓存电池
RAID 卡缓存电池(BBU / 超级电容)失效会让控制器从回写降级为直写,写性能掉一个数量级。学习周期、更换后不开回写、断电时的数据风险,以及过保设备上这类耗材的供应问题。
-
内存:报错的和不报错的
一条 DIMM 报可纠错错误(CE)会让整个通道降频;插槽填充顺序装错会少认容量;而最难查的是不报错却隔三差五宕机的不可纠错错误(UCE)。从 BMC 日志入手的排查方法。
-
固态盘的寿命是写出来的
SSD 掉速的三种原因(SLC 缓存写满、可用空间不足、寿命节流);用 Percentage Used 和 TBW 判断剩余寿命;同批次上架的固件风险与分批升级。
-
电源与散热:最便宜的件保护着最贵的件
冗余电源单模块失效是静默的;供电不稳会表现得像硬盘故障;风扇全速运转往往不是风扇的错;一个风扇停转可能让 CPU 长期高温。电源与散热件的排查与更换周期。
-
丢包、降速、不亮灯:网络物理层的排查顺序
光模块厂商编码校验导致端口不亮;万兆口只跑千兆的三种原因;偶发丢包查三天最后是一根线。按 CRC 与误码计数判断物理层问题,以及由便宜到贵的更换顺序。
-
停产、过保、还能用几年:生命周期末端的决策
设备过保第一年最容易做错的三个决定;判断服务器还能用几年该看什么(不是上架年限);原厂宣布停产之后备件的四条来源;更换主板时序列号与授权的处理。
-
选第三方维保要问清楚的五件事
报价能不能按台给明细;「4 小时响应」指的是哪个 4 小时;保内设备的服务边界怎么写;资产台账不准报价就不准;备件到底在哪个城市。签合同之前该问的五个问题。
-
机房搬迁与长时间停机:风险不在路上
搬迁最大的风险不是运输,是断电与复电——长期运行的机械盘冷启动失败率明显更高。盘序、线序、阵列信息的保全,分批上电的做法,以及混合品牌机房的分包问题。
-
同样是 300G 15K 的 SAS 盘,为什么装进 VMAX 就是不认
料号:005050266(EMC VMAX40K 300G 15K 2.5)· 005052957(EMC Unity 450F 600G 10K 2.5)
-
库房里躺了三年的备件电池,装上去直接报低电量
料号:078-000-079(EMC VPLEX)· 81Y2432(IBM DS5020)· 5541807-A(HDS VSP9500)
手上有料号需要核对配置或库存的,把料号发过来就行。
联系方式见联系我们,24 小时内人工回复。
