nginx负载均衡的连接超时重试非默认自动开启,需显式配置proxy_next_upstream(如error timeout http_502-504)、proxy_next_upstream_tries与timeout,并依赖upstream多节点及max_fails/fail_timeout健康检查协同实现被动容错。

Nginx 负载均衡中的连接超时重试不是默认开启的“自动重发”,而是一套需手动协同配置的被动容错机制。它只在满足特定失败条件、有备用节点、且配置明确允许时,才切换上游服务器重试一次请求。关键在于把「连接超时」和「重试行为」两件事配对打通。
明确哪些连接失败会触发重试
Nginx 默认只对 error(连接被拒绝、重置、无法建立)和 timeout(含 proxy_connect_timeout 超时)触发重试,但必须显式启用:
-
proxy_next_upstream error timeout是基础组合; - 如果后端在连接建立后返回 502/503/504,这些 HTTP 状态码不会自动重试,需额外加上:
http_502 http_503 http_504; - 避免加入
http_404或http_500:前者多是路径错误,后者可能是业务异常,重试无意义; - 绝对不要加
non_idempotent——它会让 POST 请求也重试,极易造成重复下单、扣库存等严重问题。
设置连接超时与重试边界要匹配
单次连接超时和整体重试窗口必须协调,否则重试根本来不及执行:
-
proxy_connect_timeout 3s:TCP 连接建立上限,设太长会拖慢故障感知; -
proxy_next_upstream_tries 2:最多尝试 2 台服务器(含首次),即最多换 1 次; -
proxy_next_upstream_timeout 10s:从第一次请求发出起计时,10 秒内所有重试必须完成; - 注意:若
proxy_connect_timeout是 3s,而proxy_next_upstream_timeout只有 5s,那最多只能重试一次(3s + 3s > 5s),第二次连接都发不出去。
确保 upstream 具备可重试的前提
重试不是魔法,它依赖真实可用的备用节点:
-
upstream块里至少定义 2 台server,且不能全部处于down或连续失败状态; - 推荐搭配健康检查参数:
max_fails=2 fail_timeout=30s,即某节点连续失败 2 次后,30 秒内不参与调度; - 若只配了 1 台后端,无论怎么调
proxy_next_upstream,重试都无效——没“下一个”可切。
典型安全配置示例
upstream backend {
server 10.0.1.10:8080 max_fails=2 fail_timeout=30s;
server 10.0.1.11:8080 max_fails=2 fail_timeout=30s;
}
location / {
proxy_pass http://backend;
proxy_connect_timeout 3s;
proxy_send_timeout 5s;
proxy_read_timeout 8s;
proxy_next_upstream error timeout http_502 http_503 http_504;
proxy_next_upstream_tries 2;
proxy_next_upstream_timeout 12s;
}
这套配置下,如果第一台服务器 3 秒连不上,Nginx 会立即换第二台;若第二台也连不上或返回 502,且总耗时未超 12 秒,就返回最终错误(如 502)。整个过程非阻塞,不影响其他请求处理。











