排查nginx加权轮询流量倾斜,核心是验证$upstream_addr实际分发是否匹配权重比例,并排除健康检查、keepalive复用、ip_hash覆盖等干扰;需结合stub_status、禁用重试的短连接测试及debug日志交叉验证。

排查 Nginx 加权轮询(Weighted Round Robin)导致的流量倾斜,核心是验证实际请求分发是否与配置权重严格匹配,并排除后端响应、连接复用、缓存等干扰因素。
确认 upstream 配置权重是否生效
检查 upstream 块中各 server 的 weight 值是否正确设置,且未被其他指令覆盖(如 max_fails、fail_timeout 或 down 状态)。Nginx 默认 weight=1,若某节点未显式写 weight,容易误以为“没设权重”而实际是默认 1。
- 使用
nginx -T输出完整生效配置,搜索 upstream 块,确认最终解析的 weight 值 - 注意:weight 只在一轮轮询中起比例作用,不是每请求都按权重概率随机选;它是“累积计数器+最大权重归零”的确定性算法,不等于实时百分比分流
- 例如:server A(weight=3)、B(weight=1),理论分配序列为 A→A→A→B→A→A→A→B……共 4 请求为一周期,A 占 75%;但若 B 响应极慢或超时,Nginx 可能临时跳过它,打破周期
观察真实请求分发比例
仅看 access log 中的 $upstream_addr 不够——它可能包含重试地址(如第一次发给 B 超时,自动重试 A,则日志记为 “B, A”),造成统计偏差。应单独记录首次转发目标。
- 在 log_format 中添加
$upstream_list(需 patch)不可行,推荐改用$upstream_addr+ 过滤重试(用$upstream_http_x_request_id或自定义 header 标识首转) - 更可靠方式:开启 Nginx stub_status 模块(需编译含
--with-http_stub_status_module),配合upstream_zabbix等模块或自研 Lua 脚本,在每个 upstream server 上打标并统计命中次数 - 简单验证法:用 ab / wrk 发起大量短连接请求(禁用 keepalive),关闭后端健康检查,避免 failover 干扰,观察 access log 中各 backend IP 出现频次是否趋近 weight 比例
排查影响权重行为的隐性因素
即使权重配置无误,以下情况也会导致表观倾斜:
- 连接复用(keepalive):客户端复用 TCP 连接,Nginx 可能将后续请求持续发往同一后端(尤其使用 proxy_pass + keepalive 池时),掩盖轮询效果
-
健康检查失败:某节点短暂超时或返回非 2xx,触发
max_fails机制进入 fail_timeout,期间完全不参与轮询,权重失效 -
IP Hash / Cookie 等会话保持:若 upstream 同时启用了
ip_hash或hash $cookie_jsessionid consistent;,加权轮询会被完全忽略 - 请求体大小或耗时差异:大文件上传或长耗时接口会阻塞 worker 进程,间接降低该 backend 在单位时间内的承接请求数,形成“伪倾斜”
快速定位建议步骤
按顺序执行可快速缩小问题范围:
- 停用所有健康检查(注释掉
max_fails和fail_timeout),用 curl 循环调用,观察首转地址分布 - 临时关闭 keepalive:在 upstream 中加
keepalive 0;,并在 location 中设proxy_http_version 1.0;+proxy_set_header Connection ''; - 检查是否有其它负载策略覆盖:搜索配置中是否出现
ip_hash、hash、least_conn等指令,它们优先级高于 weight - 启用 debug 日志(
error_log /path/to/debug.log debug;),过滤关键词 “upstream round robin”,查看 Nginx 内部如何选择 server











