要让后端节点故障时请求“无感切换”,关键在于合理配置 proxy_next_upstream:仅对 error、timeout 及明确的网关错误(502/503/504)重试,避免 404/403 和盲目 500;设 tries=3 和 timeout=6s 成对生效;配合 max_fails=3/fail_timeout=30s 被动健康检查及可选主动探活;get/head 可安全重试,post/put/delete 需幂等保障。

要让后端节点故障时请求“无感切换”,关键不是堆配置,而是让 proxy_next_upstream 在正确时机、以可控方式换节点——它本身不预测故障,只在失败发生后快速兜底。
明确哪些错误真正值得重试
默认只对 error(连接拒绝、断连等)和 timeout(超时)触发重试。生产中建议显式补充:
-
http_502/http_503/http_504:网关类错误,大概率是后端瞬时不可用,适合换节点重试 - 不加
http_404或http_403:这类是业务逻辑结果,重试不会改变结果,反而可能放大问题 - 避免盲目加
http_500:除非确认是后端偶发异常(如 GC 暂停),否则应先排查日志,而非依赖重试掩盖问题
限制重试的次数和总耗时
proxy_next_upstream_tries 和 proxy_next_upstream_timeout 必须成对设置,缺一不可:
-
proxy_next_upstream_tries 3:表示最多尝试 3 个不同节点(含首次),不是“重试 3 次” -
proxy_next_upstream_timeout 6s:从第一次请求发出开始计时,6 秒内无论试了几个节点,超时即返回错误 - 若单次请求 P95 耗时约 3 秒,设为 6 秒既能覆盖一次重试,又防止长尾拖累整体响应
让重试真正落在健康节点上
光靠重试不行,得配合被动健康检查,避免反复打坏节点:
- 在
upstream中为每个server设置max_fails=3 fail_timeout=30s:连续 3 次失败(包括重试触发的失败)后,该节点 30 秒内不再参与调度 - 可选加
backup节点:仅当所有主节点被标记为不可用时才启用,作为最后一道防线 - 若使用 Nginx Plus 或编译了
upstream_check_module,建议启用主动健康检查:health_check interval=3 fails=2 passes=2,比被动等待更早发现故障
区分请求类型,守住幂等底线
重试安全的前提是“重复执行无副作用”:
-
GET/HEAD请求可放心启用重试,天然幂等 -
POST/PUT/DELETE默认不重试,Nginx 有安全机制保护 - 若业务层已严格保障幂等(如通过
X-Request-ID+ Redis 记录处理状态),且日志可追溯,才考虑谨慎开启;否则宁可让客户端重试或返回明确错误











