优化nginx tcp负载均衡需基于连接状态分布选择算法与参数:数据库用least_conn,im服务用consistent_hash,异构集群用加权最少连接,并调优超时、健康检查及keepalive,结合监控实现动态响应。

部署 Nginx 动态流负载均衡来优化 TCP 连接性能,核心不是堆参数,而是让 Nginx 真正感知连接状态、匹配业务行为、并能动态响应后端变化。重点在 stream 模块配置、算法选型、连接生命周期控制和可观测性闭环。
启用 stream 模块并构建基础 TCP 负载池
必须先确认 Nginx 已编译或加载 stream 模块(1.9.0+ 默认支持):
- 主配置中添加 load_module modules/ngx_stream_module.so;(若未静态编译)
- 在顶层配置块中定义 stream { ... },不能嵌套在 http 块内
- upstream 块需显式声明 zone(如 zone tcp_cluster 64k;),用于跨 worker 共享连接状态和健康检查结果
- 每个 server 行可带 max_conns=2048 防止单节点过载,带 weight=3 适配异构硬件,带 backup 提供故障兜底
按业务连接特征选择调度算法
TCP 是长连接协议,轮询无法反映真实负载,必须按场景选算法:
- 数据库(MySQL/PostgreSQL)、缓存(Redis)类服务:用 least_conn; —— 它看的是当前 ESTABLISHED 连接数,能避免新连接继续打到已堆积大量空闲长连接的节点上
- IM、WebSocket 等会话敏感服务:禁用 ip_hash(NAT 下失效),改用 hash $remote_addr consistent; 或更稳妥的 hash $upstream_http_x_session_id;(需客户端透传 token)
- 混合新旧服务器集群:组合使用,例如 least_conn; + server 10.0.1.1:6379 weight=5; —— 在最少连接基础上叠加权重,兼顾均衡与能力差异
精细控制连接生命周期与健康反馈
超时和健康检查不是“设个数”,而是要对齐后端行为:
- proxy_connect_timeout 1s;:确保快速失败,配合 max_fails=3 fail_timeout=30s 实现秒级摘除
- proxy_timeout 300s;:必须略大于后端最长业务耗时(如 Redis 批量操作可能达 240s),但不宜超过 600s,否则故障连接滞留太久
- 启用主动健康检查:health_check interval=3s fails=2 passes=2;,再配 match 块验证 TCP 连通性或简单协议响应(如发送 PING 收到 PONG)
- 开启 tcp_nodelay on; 减少小包延迟,对高频交互型 TCP(如实时信令)效果明显
打通监控与调优闭环
没有度量就谈不上优化,需建立轻量但有效的观测链路:
- 用 log_format tcp_log "$remote_addr [$time_local] $upstream_addr $connection $upstream_connect_time"; 记录连接归属和建连耗时
- 定期执行 ss -s | grep -i established 和 netstat -tn | awk '$NF ~ /ESTABLISHED/ {print $5}' | cut -d: -f1 | sort | uniq -c | sort -nr 查看连接分布热点
- 结合 /proc/net/nf_conntrack(若启用)观察 TIME_WAIT 峰值,判断是否需调大 net.ipv4.ip_local_port_range 或启用 net.ipv4.tcp_tw_reuse
- 当发现某 IP 占用连接数异常高(如 >500),需排查是爬虫、客户端 bug 还是合法长连,再决定限速或限连











