机械盘按年限换,固态盘不能。
同一批上架的固态盘,有的三年还好好的,有的一年就报寿命告警——差别不在使用了多久,在写进去了多少。这个区别决定了固态盘的维护方式和机械盘完全不同。
一、掉速,不一定是坏了
现象:刚上线的时候飞快,用了一段时间之后写入速度明显下降。
三种可能,处理方式完全不同:
可能一:SLC 缓存写满了。很多固态盘会把一部分闪存当作高速缓存用(模拟 SLC 模式),写入先进这块区域,再慢慢搬到正常区域。持续大量写入时,缓存会被写满,速度回落到原生速度。这是正常行为,不是故障。
可能二:可用空间不足。盘越满,垃圾回收(GC)的压力越大——要腾出一个可写的块,就得先把有效数据搬走再擦除。剩余空间少于 10–20% 时,这个开销会明显反映在延迟上。
可能三:寿命消耗接近阈值。部分型号在接近寿命上限时会主动降速,用降低写入速率来保护数据完整性。
怎么区分:看 SMART 里的两个值——Percentage Used(已用寿命百分比)和 Total Bytes Written(累计写入量)。寿命还早、盘也不满,那多半是第一种;寿命接近阈值,那是第三种。
顺带一提:读取密集型(read-intensive)和写入密集型(write-intensive / mixed-use)是两种不同的产品,耐久度指标差好几倍。把读取密集型的盘放在写入密集的场景里,寿命会短得让人意外——这不是质量问题,是选型问题。
二、用写入量算更换周期,不用年限
关键指标:
- Percentage Used:厂商给的已消耗寿命百分比,最直观
- Total Bytes Written / Host Writes:累计写入量,可以和规格书上的 TBW 或 DWPD 对照
- Available Spare:剩余备用块比例,掉得快说明坏块在增加
怎么规划:取一段时间(比如一个月)的写入增量,除以剩余可写量,就能估出剩余寿命。这个算法比「上架满五年就换」准得多,而且能提前半年以上知道该备件了。
什么时候换:寿命告警出现之后,按计划更换,不要等它进入只读状态。
为什么不能等:固态盘寿命到期的表现是转为只读——数据还在,读得出来,但写不进去。对运维来说这是个好消息(数据没丢),对业务来说这是个坏消息(服务已经停了)。两者的区别,在故障那一刻没有意义。
三、固件不升级,可能是定时炸弹
现象:某些批次的固态盘在运行到特定的通电小时数时会集体异常。
这类问题在行业里出现过不止一次。机理大同小异:固件里某个计数器或状态机在特定条件下出错,导致盘失效或数据不可访问。厂商发现后会发布固件修复。
真正的风险在于同批次。数据中心的采购方式决定了同一批盘会在同一天上架,之后承载相近的负载,通电小时数几乎同步。所以一旦触发条件成立,它们会在很接近的时间里一起出问题——而不是像随机故障那样分散开。
一组 RAID 里同时掉两块以上,就不是冗余能兜住的事了。
怎么做:
- 定期核对厂商的固件公告和产品通告(PSA / Customer Advisory)
- 记录在用固态盘的型号、固件版本、上架时间和累计通电小时数
- 需要升级时分批做,不要一次全升——固件升级本身也有风险
- 同批次的盘,考虑做一次交错更换,打散它们的寿命曲线
记录固件基线的意义就在这里。我们的料号库对每个料号记录固件基线,不只是为了替换时匹配,也是为了这类批次性风险来的时候能快速排查覆盖面。
一份巡检清单
固态盘的巡检和机械盘不一样,重点在趋势不在告警:
- 导出所有固态盘的 Percentage Used 和累计写入量
- 找出消耗速度明显高于同组的盘——通常意味着负载分配不均
- 剩余寿命不足 20% 的,进入更换计划
- 可用空间低于 20% 的卷,评估扩容或迁移
- 核对在用固件版本与厂商最新公告
- 记录同批次盘的上架时间,标记高风险组
这套数据一个季度导一次就够,但要连续导——单次快照没有意义,有价值的是两次之间的差值。
关于备件
固态盘的替换同样要核对完整规格:容量、接口(SATA / SAS / NVMe)、耐久度等级、外形(2.5 寸 / M.2 / U.2)、固件基线。
七小服的料号库收录 11,894 个料号,其中 4,786 个为库房常备实物,固态盘部分可以在备件料号速查里按品牌或料号搜。入库做 48 小时以上加压测试,出库逐件复测,随件附规格标签与测试报告。
本文描述的是这类设备的常见故障模式,不是某一台机器的具体案例。行业固件通告的公开出处见资料与依据。
