断网测试需精准模拟网络不可达而非服务假死,推荐iptables drop或network namespace隔离;vip漂移应≤3秒,连接中断窗口须抓包验证无异常rst。

断网是比进程崩溃更严苛的故障场景,它模拟的是网络设备故障、机房断电、安全组误封或跨网段通信中断等真实问题。测试 Nginx 故障转移在断网下的表现,重点不是看“能不能切”,而是验证 Keepalived 是否能准确识别“网络不可达”而非误判为“服务假死”,同时避免脑裂和切换延迟超标。
一、精准模拟断网:用 iptables 或 network namespace 隔离流量
不能只关网卡(如 ifconfig eth0 down),那会触发系统级链路检测,干扰 Keepalived 的 VRRP 判断逻辑。推荐两种可控方式:
-
iptables DROP 方式(推荐):在主节点上执行:
iptables -I INPUT -d <vip> -j DROP</vip>iptables -I OUTPUT -s <vip> -j DROP</vip>
这样 VIP 仍绑定在主节点,但所有进出该 VIP 的包都被丢弃,VRRP 通告发不出去,备机能真实感知“心跳丢失” - network namespace 模拟隔离(更彻底):创建独立网络空间,把 Nginx 和 Keepalived 移入其中,再切断该 namespace 与宿主机的 veth 连接,完全复现网络分区(Network Partition)
二、关键指标必须实测,不能只看日志
Keepalived 日志显示 “Transition to MASTER” 只代表状态变更,不代表业务已恢复。需同步验证:
-
VIP 漂移耗时:在客户端执行
watch -n 0.2 'curl -I -s -m 1 http://<vip>/healthz -o /dev/null && echo ok || echo fail'</vip>,记录从首次 fail 到连续 ok 的间隔,应 ≤ 3 秒(advert_int=1 + 2 次 missed) -
连接中断窗口:用
tcpdump -i any host <vip></vip>抓包,观察 FIN/RST 是否出现在切换过程中;理想情况是旧连接自然关闭,新连接无 RST,仅偶有 SYN 超时( -
ARP 收敛是否及时:在同网段另一台机器上执行
arp -a | grep <vip></vip>,确认 VIP 对应的 MAC 地址在 2 秒内更新为备机网卡地址
三、防脑裂强化验证项
断网极易引发脑裂——主节点因收不到备机心跳,误以为自己仍是 MASTER;备机也因收不到主节点通告,升为 MASTER。必须检查以下防护是否生效:
- 主备节点是否都配置了
vrrp_strict(启用严格模式,禁用非标准 VRRP 包) - 是否启用单播通信(
unicast_src_ip+unicast_peer),避免多播包在断网时被交换机泛洪或过滤 - 健康检查脚本中是否含
ip addr show | grep "inet.*<vip>"</vip>校验,防止 VIP 残留导致双主 - 主节点恢复网络后,若配置
nopreempt,应保持备机继续提供服务;若未设,则 VIP 回切过程不得出现二次中断或抖动
四、配合后端验证端到端可用性
Nginx 切换成功只是第一层。还需确认下游是否真正承接流量:
- 在备机 Nginx 的 access_log 中,搜索
upstream_addr字段,确认请求已打到本地 upstream server,而非空转或 fallback 到 backup 组 - 若 upstream 后端也部署在同机房,建议提前将其中一台后端服务器也断网,验证 Nginx 的
max_fails/fail_timeout是否能在 10 秒内将其剔除,并将流量导向异地集群(需配置 backup 或多地域 upstream) - 用
nginx -T | grep -A5 "upstream"快速核对当前生效配置,防止 reload 后未生效的配置干扰判断











