keepalived基于vrrp协议实现vip自动漂移与主备切换:master绑定vip并发送组播心跳,backup监听超时后接管;需配置一致virtual_router_id、同子网vip、健康检查脚本及arp_ignore/announce内核参数,并通过ip addr、tcpdump等验证生效。

Keepalived 利用 VRRP 协议实现主备切换和虚拟 IP(VIP)自动漂移,本质是让两台或多台服务器在局域网内“竞选”一个对外服务的 IP 地址。谁当选 Master,谁就把 VIP 绑定到自己的网卡上;一旦它失联或服务异常,Backup 节点立刻接替,整个过程对客户端完全透明。
主备角色与 VIP 绑定机制
VIP 不是配置在物理网卡上的固定地址,而是由 Keepalived 动态添加/删除的别名(如 eth0:1)。主节点运行时,VIP 出现在它的 ip addr 输出中;备节点不持有该地址,也不响应针对 VIP 的 ARP 请求。VRRP 通过组播(默认目的地址 224.0.0.18,IP 协议号 112)发送心跳报文,超时未收到即触发切换。
- 主节点
state MASTER,备节点state BACKUP - 双方
virtual_router_id必须相同(1–255 整数),且在同一二层网络中全局唯一 - VIP 必须与节点真实 IP 在同一子网,且不能被其他设备占用
- 网卡名(如
ens33或eth0)需在主备机上一致,否则 VIP 无法正确绑定
健康检查必须绑定真实服务状态
只检测 Keepalived 进程是否存活远远不够。Nginx、Apache 或后端应用挂了,但 Keepalived 还在跑,VIP 就会继续留在故障节点——这就是典型的脑裂。必须通过脚本探测服务可用性:
- 写一个检测脚本(如
/etc/keepalived/check_nginx.sh),用curl -f http://127.0.0.1/health或pgrep -f nginx判断 - 在
vrrp_script块中定义该脚本,设置interval 3、fall 2(连续失败 2 次才降权) - 用
weight -20降低优先级,确保降权后低于备节点原始 priority(例如主 100 → 80,备 90 → 仍高于 80) - 在
vrrp_instance中引用track_script,使 VIP 切换真正由服务健康度驱动
防脑裂与稳定切换的关键配置
主备都抢 VIP 是最危险的故障形态。避免它需要网络层和配置层双重保障:
- 防火墙必须放行协议号 112(不是端口!),或明确允许组播地址
224.0.0.18 - 禁用 NetworkManager,防止它干扰 Keepalived 对 IP 别名的管理
- 生产环境建议启用
nopreempt,避免主节点恢复后立即抢回 VIP 导致短暂中断 - 若需自动回切,改用
preempt_delay 5,等服务稳定后再接管 - 内核参数
net.ipv4.conf.all.arp_ignore=1和arp_announce=2必须生效,防止错误 ARP 响应
验证是否真正生效
启动 Keepalived 后,不要只看服务状态,要逐层确认:
- 执行
ip addr show:VIP 只出现在当前 MASTER 节点的网卡下 - 执行
systemctl status keepalived:确认 active (running),无 failed 日志 - 执行
tcpdump -i eth0 ip proto 112 -n:主备节点都应持续收发 VRRP 报文 - 手动停掉主节点的 Nginx 或 Keepalived,观察备节点是否在 3–5 秒内获得 VIP 并发出免费 ARP










