nginx双机热备实现秒级切换需打通检测—判定—接管—感知全链路:调优keepalived心跳间隔与失败阈值、用/healthz接口真实探测业务就绪、主动广播免费arp加速客户端感知、nginx平滑重启并精简配置。

要让 Nginx 双机热备切换真正接近秒级,核心不是堆组件,而是打通“检测—判定—接管—感知”整条链路。Keepalived 负责 VIP 漂移,Nginx 负责业务承接,两者必须协同调优,否则任一环节卡顿都会拖慢整体切换。
缩短 Keepalived 故障识别窗口
默认每 1 秒发一次 VRRP 心跳、连续丢 3 次才切换,理论最短检测延迟为 3 秒。生产环境建议:
- 将 advert_int 设为 0.5(局域网稳定场景),心跳间隔压缩一半
- 同步把 fail_count 设为 2,即连续 2 次未收到心跳即触发降级
- 两节点配置必须完全一致,且禁用可能干扰的防火墙 INPUT 规则(尤其 DROP 未知 VIP 的规则)
让健康检查真实反映业务就绪状态
Keepalived 的 vrrp_script 不能只检查 nginx 进程是否存在,而应探测能代表服务能力的接口:
- 在 Nginx 中配置 location /healthz { return 200; },确保该路径不走 upstream、不限流、不鉴权
- vrrp_script 中用 curl -f http://127.0.0.1:80/healthz,返回非 200 立即判为异常
- 若 Nginx 代理后端应用,可改用轻量健康服务,或集成 ngx_http_upstream_check_module 做上游探测
加速 VIP 接管与客户端感知
VIP 绑定快不代表流量立刻通,下游设备需及时更新 ARP 表:
- 在备机升主脚本中加入 arping -U -c 3 -I eth0 $VIP,主动广播免费 ARP
- 系统层面执行:echo 1 > /proc/sys/net/ipv4/conf/all/arp_ignore 和 echo 2 > /proc/sys/net/ipv4/conf/all/arp_announce
- 客户端若直连 VIP,建议关闭 TCP 长连接复用或缩短 keepalive_timeout;若走 DNS,TTL 应设为 10 秒以内
避免 Nginx 自身成为切换瓶颈
主节点故障时,Nginx 若未平滑退出,会丢请求;备节点启动后若未快速就绪,也会拖慢恢复:
- 重载配置用 nginx -s reload,而非 stop/start;配合 worker_shutdown_timeout 3s 确保旧连接处理完
- 启用 reuseport 和 so_keepalive=on,提升新连接建立效率
- 关闭不必要的日志写入(如 access_log off)、禁用耗 CPU 功能(如 gzip on 仅对文本启用)
不复杂但容易忽略











