双机热备业务持续性测试需验证主节点故障时备机能否在≤1秒内无感知接管,确保零连接中断、无脑裂、服务自愈;须分层模拟nginx崩溃、假死、网络隔离三类故障,并通过客户端轮询、日志比对和关键日志分析闭环验证。

双机热备环境下的业务持续性测试,核心是验证主节点故障时,备用节点能否在无感知、低延迟前提下自动接管服务,保障客户端访问不中断。这不是“装完就完事”的配置验证,而是围绕真实故障场景展开的闭环检验。
明确测试目标与关键指标
测试不是为了“能切”,而是确认“切得准、切得快、切得稳”:
- 切换时间 ≤ 1 秒:从主 Nginx 进程终止到 VIP 完全漂移至备机并响应请求,整个过程应控制在 1 秒内(VRRP 默认 advert_int=1 + 健康检查间隔决定下限);
- 零连接中断:正在建立或已建立的 TCP 连接不应被主动 RST,新请求应 100% 路由至存活节点;
- 无脑裂现象:主备不能同时持有 VIP,否则会导致客户端请求随机失败或负载错乱;
- 服务状态自愈:主节点恢复后,若配置为非抢占模式(nopreempt),应保持备机继续提供服务;若为抢占模式,需验证 VIP 是否按优先级正确回切且不引发抖动。
模拟真实故障场景进行分层测试
仅 kill -9 nginx 进程是不够的——它绕过了 Keepalived 的健康检查逻辑,无法验证脚本监控机制是否生效。应覆盖三层典型故障:
-
Nginx 进程崩溃:执行
kill -9 $(pgrep nginx)或直接systemctl stop nginx,观察 keepalived 是否触发 chk_http_port 脚本并降权/退出; - Nginx 响应异常(假死):临时修改 nginx.conf 返回 503 或让 location 指向一个永远超时的 upstream,验证健康检查脚本能识别 HTTP 层不可用(如 curl -f http://127.0.0.1:80/health 返回非 0 状态码);
-
主机网络隔离:在主节点执行
iptables -A OUTPUT -p vrrp -j DROP或拔网线,测试 VRRP 心跳丢失后的选举行为,这是最贴近物理宕机的场景。
验证客户端访问连续性
不能只看 VIP 是否 ping 通或 curl 返回 HTML —— 需模拟真实用户行为:
- 使用
watch -n 0.2 'curl -sI http://192.168.x.130 | head -1'持续轮询 VIP 的 HTTP 状态码,切换瞬间应出现最多 1~2 次 timeout 或 connection refused,之后立即恢复 200; - 用浏览器 F5 刷新页面,或运行长连接测试工具(如
ab -n 1000 -c 50 http://VIP/),确认无请求失败; - 检查备机
nginx access.log中是否有连续请求记录,时间戳是否无缝衔接主节点日志末尾。
检查日志与状态输出定位问题
测试失败时,别猜,直接查三处关键日志:
-
journalctl -u keepalived -f:看 VRRP 状态变化(“Entering MASTER STATE” / “Entering BACKUP STATE”)、脚本执行结果(“Running check script…”)、认证失败或 virtual_router_id 冲突警告; -
ip addr show:实时确认 VIP 是否仅出现在一台机器的网卡上(如 eth0:1),避免脑裂; -
tail -f /var/log/nginx/access.log和error.log:确认请求是否真正到达 Nginx,而非被防火墙拦截或路由错误。
不复杂但容易忽略











