nginx高可用需确保故障转移可控、可测、可回退:健康检查须http级细粒度探测(如/healthz),vip漂移要防脑裂(nopreempt+动态降权)、快收敛(advert_int 1s+preempt_delay 30s),配置需统一审计;上线前必须验证kill进程、断网、arp刷新三场景。

生产环境里,Nginx 高可用不是“装两台 Nginx + Keepalived 就完事”,而是要让故障转移真正可控、可测、可回退。核心就三点:健康检查必须细粒度(不能只看进程是否存在),VIP 漂移必须快且防脑裂,配置必须可复用、可审计。下面给出经过线上验证的主备模式配置模板和关键实践要点。
健康检查脚本:检测 Nginx 服务真实可用性
仅靠 ps aux | grep nginx 判断进程存在是远远不够的——Nginx 进程可能卡死、端口未监听、配置加载失败但进程仍在。推荐使用 HTTP 级探测脚本:
- 脚本路径统一为 /opt/scripts/check_nginx.sh,两节点保持一致
- 脚本内容检测本地 127.0.0.1:80 的 HTTP 响应码是否为 200,超时设为 2 秒
- 执行权限设为 chmod +x /opt/scripts/check_nginx.sh,并确保 keepalived 用户可执行(避免因 SELinux 或权限拒绝导致检测失效)
- 在 keepalived.conf 中引用时,fall 2 rise 1 interval 2 是合理阈值:连续两次失败才触发降权,避免瞬时抖动误切
Keepalived 主备配置:防脑裂与快速收敛
主节点优先级设为 100,备节点为 90 —— 不建议用 100/80 这类过大差距,否则网络抖动易引发非预期抢占。关键配置项包括:
Linux 性能分析与调优专家,覆盖 CPU、内存、磁盘 I/O、网络、内核参数、编译优化、容器/K8s。适用场景:系统卡顿/高负载、内存不足/OOM/Swap 高、CPU 异常/iowait 高。
- state MASTER / BACKUP:角色明确,不可都设为 MASTER
- virtual_router_id 必须相同(如 51),且全网唯一:避免跨网段冲突或 VRRP 报文误收
- advert_int 1:VRRP 通告间隔设为 1 秒,配合 preempt_delay 30(主恢复后延迟 30 秒再抢 VIP),防止震荡
- authentication type PASS auth_pass 必须一致且长度 8 字符以内:Keepalived 要求严格,超长会静默忽略认证
- track_script 必须绑定 chk_nginx,且 weight 设为 -20(非 -30):保证一次失败后优先级仍高于备机,两次失败才低于备机触发切换
VIP 与网络适配:避免 ARP 缓存与网卡绑定问题
VIP(如 192.168.1.100/32)必须绑定在业务网卡(如 eth0 或 ens33),且需确认:
- 两节点所在交换机开启 ARP 代理或免费 ARP 广播支持,否则客户端无法及时更新 MAC 地址映射
- Linux 内核参数 net.ipv4.conf.all.arp_ignore = 1 和 net.ipv4.conf.all.arp_announce = 2 应启用,防止 VIP 响应非本机请求
- 防火墙放行 VRRP 协议(协议号 112)及 UDP 5353(部分环境用于 mDNS 辅助发现),CentOS 7+ 使用 firewall-cmd --add-protocol=vrrp --permanent
上线前必做三件事
配置完成不等于高可用就绪,必须验证闭环逻辑:
- 手动 kill -9 nginx worker 进程,观察 keepalived 日志(/var/log/messages)是否在 3–5 秒内完成状态切换,并确认 VIP 已迁移
- 拔掉主节点网线 10 秒后插回,验证 preempt_delay 是否生效,VIP 不会立即漂回,避免服务中断
- 用 arping -I eth0 -c 3 192.168.1.100 在客户端侧持续抓包,确认 VIP 的 MAC 地址变更时间 ≤ 2 秒










