keepalived 通过自定义磁盘io健康检查脚本、vrrp_script权重调整和notify事件实现双机热备自愈:脚本每5秒检测await/队列长度,连续3次异常则降权30触发vip漂移,并在fault/backup/master状态执行对应自愈动作。

Keepalived 本身不直接监控磁盘 IO 状态,它核心职责是基于 VRRP 协议管理虚拟 IP(VIP)漂移,依赖外部脚本或服务提供健康检查能力。要实现“监控磁盘 IO 并触发双机热备自愈”,必须通过 自定义 health check 脚本 + notify 配合 + 合理的 failover 逻辑 来达成深度自愈效果。这不是开箱即用功能,但完全可工程化落地。
以下为关键实施路径,聚焦实用、可控、易维护:
1. 编写磁盘 IO 健康检查脚本
脚本需快速判断 IO 是否异常(如持续高延迟、队列堆积、IOPS 长期归零等),避免误切。推荐使用 `iostat` 或 `/proc/diskstats`,示例(保存为 `/opt/health_check_diskio.sh`):- 检查指定磁盘(如 `sda`)的平均等待时间(await)是否持续 ≥ 100ms(阈值按业务调优) - 检查 I/O 队列长度(avgqu-sz)是否连续 3 次 ≥ 5 - 若任一条件满足,退出码设为 1(表示故障),Keepalived 将触发降级 - 脚本加执行权限:chmod +x /opt/health_check_diskio.sh
2. 在 keepalived.conf 中集成该检查
使用 `vrrp_script` 定义检查项,并绑定到 `vrrp_instance`:- 在 `global_defs` 外添加:
vrrp_script chk_diskio {
script "/opt/health_check_diskio.sh"
interval 5
weight -30
fall 3
rise 2
}
- 在 `vrrp_instance VI_1` 内加入:
track_script {
chk_diskio
}
- 解释:每 5 秒执行一次;连续失败 3 次,本节点优先级减 30;若原 priority 是 100,则跌至 70,低于备机(如 90)时自动让出 VIP。
3. 配置 notify 脚本实现“深度自愈”动作
仅切换 VIP 不够——需同步处理 IO 故障衍生问题(如停 Nginx、卸载异常挂载点、触发磁盘诊断):- 编写 `/opt/notify_diskio.sh`,根据 `$1`(state:MASTER/BACKUP/FAULT)执行不同逻辑: - FAULT:记录日志、发送告警、尝试 `echo 1 > /proc/sys/vm/drop_caches`(谨慎)、调用 `smartctl -a /dev/sda` 收集磁盘健康数据 - BACKUP:确保本地服务(如 Nginx)已启动且监听 - MASTER:可启动 IO 监控守护进程(如 `iotop -b -o -d 2 | ...` 日志轮转) - 在 `vrrp_instance` 中添加:notify /opt/notify_diskio.sh
4. 必须规避的陷阱
- 不要启用 vrrp_strict:该模式禁用非标准 VRRP 包,会阻断自定义脚本触发的优先级动态调整 - 防火墙放行 VRRP 组播(224.0.0.18),否则心跳丢失导致误切换 - 磁盘 IO 检查脚本必须超时控制(如 `timeout 3s iostat -dx 1 1 | ...`),防止卡死影响 Keepalived 主循环 - 避免检查根分区 IO 导致雪崩:优先监控业务数据盘(如 `/data` 对应的 `/dev/nvme0n1p1`),而非 `/`
不复杂但容易忽略。核心是把磁盘 IO 从“被动指标”变成“主动决策因子”,再借 Keepalived 的权重机制和 notify 事件完成闭环。










