nginx高可用环境中的平滑停机与动态扩容依托master-worker架构和信号机制实现零中断:平滑停机用nginx -s quit令worker优雅退出,动态扩容通过修改upstream后nginx -s reload热加载配置,新增节点即时接入且连接不丢。

在高可用 Nginx 环境中,平滑停机和动态扩容不是“停服务再操作”,而是靠信号控制、进程协作与配置热加载完成的连续性动作。核心前提是 Nginx 的 master-worker 架构和 POSIX 信号机制,所有操作都围绕“旧进程不强杀、新进程不抢连、连接不丢、请求不拒”展开。
平滑停机:让旧节点优雅退出
适用于维护、下线某台 Nginx LB 节点,或整个集群滚动维护。
- 先确认该节点是否已从上游调度器(如 Keepalived、LVS 或 DNS 权重)摘除流量;若未摘,直接停机将导致部分请求失败
- 执行 nginx -s quit —— 向 master 发送 QUIT 信号,它会通知所有 worker 完成当前请求后退出,不接受新连接
- 观察 ps aux | grep nginx,直到只剩 master 进程(无 worker),说明已完全静默;若仍有 worker 存活,可加 -t 5 参数等待超时,或检查是否有长连接(如 WebSocket、HTTP/2 流)未关闭
- 最后用 kill -QUIT $(cat /var/run/nginx.pid) 确保 master 也退出,避免残留
动态扩容:新增后端节点零感知接入
这是横向扩展最常用场景,不改 Nginx 二进制,只更新 upstream 配置即可生效。
- 在 upstream 块中追加新 server,例如:
server 192.168.10.104:8080 max_fails=2 fail_timeout=5s; - 运行 nginx -t 校验语法,重点检查 IP/端口格式、分号结尾、模块是否启用(如 health_check 需 stream 模块)
- 执行 nginx -s reload,master 收到 SIGHUP 后启动新 worker,旧 worker 处理完存量请求后退出
- 验证方式:
– 查 curl http://localhost/upstream_status(需启用 stub_status)看新节点是否出现在列表中
– 抓包或日志中观察请求是否开始命中新 IP
高可用集群中的协同要点
单台 Nginx 做得好还不够,多节点环境要避免“配置不同步”或“状态不一致”引发雪崩。
- 所有 Nginx LB 节点使用统一配置仓库(如 Git + Ansible),每次 reload 前自动 diff 配置差异
- 配合健康检查(max_fails/fail_timeout 或 health_check 指令),异常后端自动剔除,无需人工干预摘机
- 若用 Keepalived 实现 VIP 高可用,确保主备节点 reload 或 quit 操作错开时间(如间隔 30 秒),防止 VIP 抢占冲突导致瞬断
- 扩容后建议触发一次轻量压测(如 ab -n 1000 -c 100),验证新节点能正常承接、负载分布合理
回滚与兜底策略
任何动态操作都要预设失败路径。
- reload 失败卡住时,立刻查 nginx -t 输出,常见原因是 listen 端口被占用、SSL 证书路径错误、resolver 解析失败
- 若已启新 master 但旧 worker 未退尽,可用 kill -WINCH $(cat /var/run/nginx.pid) 强制旧 worker 逐步退出
- 升级二进制失败时,保留旧版 binary(如 /usr/sbin/nginx.old),用 kill -QUIT 停新 master,再手动启旧版:/usr/sbin/nginx.old -c /etc/nginx/nginx.conf
- 所有关键操作前,快照当前配置与 pid 文件位置,便于快速还原











