“passed”不等于硬盘安全——它仅是固件快照,可能被raid卡伪造或掩盖current_pending_sector等隐患;须用smartctl -i确认smart启用、-a查raw_value(非value)、重点关注id5/197/199/233,并区分nvme与sata ssd参数差异。

直接看 smartctl -H /dev/sda 输出的 “PASSED” 不代表硬盘安全——它只是固件当前上报的一个快照,可能被 RAID 卡伪造,也可能掩盖 Current_Pending_Sector 已存在但尚未触发重映射的事实。
确认 SMART 真正启用且能读到真实数据
很多老服务器或带 RAID 卡(如 LSI MegaRAID)的机器,smartctl -i /dev/sda 会显示 SMART support is: Disabled 或直接报 ATA device not found。这不是硬盘问题,是访问路径被拦截了。
- 先用
lsblk或sudo fdisk -l确认设备名,比如是/dev/sdb - 运行
sudo smartctl -i /dev/sdb,若输出里没有SMART support is: Enabled,别急着换盘,先试加设备类型参数:sudo smartctl -i -d megaraid,0 /dev/sdb(对应第一个物理盘)或-d ata(SATA 盘常见) - 如果仍报
Permission denied,说明没加sudo;若报No Information,大概率是硬件层屏蔽了 SMART 通道,得换直通模式或换卡
重点关注哪些 SMART 属性值
smartctl -A /dev/sda 输出里几十行属性,90% 可忽略。重点关注这四个 ID 及其原始值(RAW_VALUE),别信 VALUE 列——厂商编码逻辑不统一,有的越小越差,有的越大越差:
-
Reallocated_Sector_Ct(ID 5):>0 表示已有扇区被重映射,物理坏道已发生;持续上涨 = 盘在加速报废 -
Current_Pending_Sector(ID 197):>0 是红灯,说明有扇区读写不稳定,下次访问可能就触发重映射,或直接变硬错误 -
UDMA_CRC_Error_Count(ID 199):不是盘的问题,是线缆松动、供电不稳或主板 SATA 接口老化;反复上升先换线再测 -
Media_Wearout_Indicator(ID 233):仅 SSD 有效;数值越接近 100,剩余寿命越少
NVMe 和 SATA SSD 的参数差异必须分清
NVMe 和 SATA SSD 的 SMART 字段命名、单位、阈值逻辑完全不同,混看会误判:
- 对 NVMe 盘执行
smartctl -A /dev/nvme0n1会漏掉关键指标Percentage Used,必须用-a(不是-A) - 同样叫 “wear leveling”,SATA 盘用
Wear_Leveling_Count(原始值越大越好),而 NVMe 盘用Percentage Used(原始值越大越差) -
Temperature_Celsius在 SATA 盘里是标准字段,在 NVMe 里可能显示为Temperature: 35 C单行,不进表格
短自检和长自检到底该跑哪个
短自检(smartctl -t short /dev/sda)约 2 分钟,只扫 FAT 区、目录区等高频区域,适合日常巡检;长自检(smartctl -t long /dev/sda)遍历全部 LBA,在 HDD 上可能耗时数小时,期间 I/O 响应明显变慢甚至卡顿。
- 除非
Current_Pending_Sector > 0,否则别轻易跑长自检——它不会修复坏道,只把 pending 扇区逼出来,可能让盘当场掉线 - SSD 上长自检意义不大,耗时短但基本不触发重映射,重点看
Media_Wearout_Indicator和Available_Reserve_Space - 测试中查进度用
sudo smartctl -c /dev/sda;中断后台任务用sudo smartctl -X /dev/sda;结果必须用sudo smartctl -l selftest /dev/sda查日志,Status列为Completed without才算真正完成
最易被忽略的是:RAID 卡屏蔽、RAW_VALUE 和 VALUE 的混淆、NVMe 必须用 -a、以及 Current_Pending_Sector > 0 时强行跑长自检反而加速故障。这些点不手动验证,光看 PASSED 就等于没查。











