nginx自身无并发连接实时告警能力,需通过vts模块暴露/status接口获取active等连接指标,再经脚本采集、阈值比对(如连续3次超2000触发),最终集成邮件/webhook/prometheus+alertmanager实现告警。

Nginx 本身不内置并发连接实时告警能力,VTS(Nginx Virtual Host Traffic Status)模块可提供细粒度的连接、请求、流量等指标统计,但其本身也不含报警功能。要实现“异常并发连接→阈值触发→实时报警”,需将 VTS 的监控数据导出,再由外部系统完成采集、判断与告警。以下是可行且生产环境验证过的轻量级方案:
1. 启用 VTS 模块并暴露连接数指标
VTS 通过 /status 接口(如 http://127.0.0.1:8080/status)以 JSON 格式返回虚拟主机级实时状态。关键字段包括:
- active:当前活跃连接数(即正在处理的请求连接,含 keepalive 空闲连接)
-
reading / writing / waiting:Nginx 连接所处状态数,其中
waiting通常代表空闲 keepalive 连接 - conn_total:历史总连接数(非实时判断依据)
确保 Nginx 编译时已启用 VTS(如使用 vozlt/nginx-module-vts),并在配置中添加:
location /status {<br> vhost_traffic_status_display;<br> vhost_traffic_status_display_format json;<br>}
2. 定期采集 active 连接数并做阈值比对
用轻量脚本(如 Bash + curl + jq)每 5–10 秒拉取一次 /status,提取各 server 或 upstream 的 active 值,与预设阈值比较。示例逻辑:
- 设定全局阈值(如 2000)或按 upstream 单独设(如 api_backend > 800 触发)
- 连续 3 次超阈值才判定为“异常并发”,避免瞬时毛刺误报
- 记录时间、host、active 值、持续次数到本地日志或临时文件
命令片段示例:
curl -s http://127.0.0.1:8080/status | jq -r '.servers[] | select(.server == "example.com") | .connections.active'
3. 集成告警通道(邮件 / Webhook / Prometheus+Alertmanager)
检测到异常后,立即调用通知接口:
- 发邮件:用
mail或sendmail命令(适合小规模) - 推企业微信/钉钉:构造 JSON POST 请求,带标题、服务器 IP、active 数、发生时间
- 对接 Prometheus:用 nginxlog-exporter 不合适(它解析 access log),应改用 nginx-lua-prometheus + VTS 数据桥接,或写一个简单 exporter 把 VTS JSON 转为 Prometheus metrics endpoint
推荐组合:Bash 脚本采集 → 写入本地 metrics 文件 → node_exporter 的 textfile collector 加载 → Prometheus 抓取 → Alertmanager 配置 absent(active_connections > 1500) 类规则。
4. 补充建议:区分真实异常与合法高峰
单纯看 active 易误判。建议交叉验证:
- 检查
waiting / active比值:若 > 90%,大概率是大量空闲长连接,非攻击 - 同步看
request_counter和响应时间:QPS 突增 + avg_response_time 上升 → 业务负载高;QPS 平稳 + active 暴涨 → 可能存在慢连接攻击或客户端未断连 - 结合系统层指标:用
ss -s或netstat -an | grep :80 | wc -l对比,确认是否真达内核连接上限
不复杂但容易忽略。











