在grafana中为nginx配置钉钉告警需确保prometheus采集真实指标(如nginx-prometheus-exporter或vts模块)、在prometheus rules.yml中定义错误率>3%、流量突增3倍等规则并设for:2m,grafana通过内置alerting对接钉钉webhook,消息模板嵌入server、错误率、时间及跳转链接。

要在 Grafana 中为 Nginx 设置流量突增或错误率超标告警,并推送到钉钉,核心不是“在 Grafana 里点几下”,而是确保数据链路通、指标可算、告警逻辑准、通知能发出去。Grafana 自身不负责指标采集和长期规则评估,它依赖 Prometheus 做计算和 Alertmanager(或内置 alerting)做判定;钉钉通知则靠 Webhook 实现。
确保 Prometheus 能拿到真实可用的 Nginx 指标
没有准确指标,再强的告警也是空谈。推荐两种稳定方式:
-
用 nginx-prometheus-exporter:轻量独立进程,支持从 stub_status 或 access_log 解析指标。启动时指定
--nginx.scrape-uri=http://127.0.0.1:8080/stub_status(需先在 Nginx 开启stub_status on;),默认暴露:9113/metrics -
用 nginx-module-vts:编译进 Nginx,原生支持
/metrics?format=prometheus,指标更全(含 vhost、upstream 维度),例如:nginx_vts_server_requests_total{server="api.example.com",code="502"}
验证方式:直接 curl http://nginx-ip/metrics 或 curl http://exporter-ip:9113/metrics,看到带 label 的计数器即成功。
在 Prometheus 中定义关键告警规则
Grafana 告警本质是调用 Prometheus 的 rule evaluation 结果,所以规则必须写在 Prometheus 的 rules.yml 中(或通过 Prometheus Operator 管理):
-
错误率超标:5 分钟内 5xx 占比超过 3%
(rate(nginx_vts_server_requests_total{code=~"5.."}[5m]) / rate(nginx_vts_server_requests_total[5m])) > 0.03 -
流量突增:相比前一小时,当前请求速率翻 3 倍以上(防毛刺可加 min_over_time 过滤)
rate(nginx_vts_server_requests_total[5m]) / min_over_time(rate(nginx_vts_server_requests_total[5m])[1h:5m]) > 3 -
上游失败集中爆发:某 upstream 在 2 分钟内 502/503 请求超 100 次
sum by (upstream) (rate(nginx_vts_upstream_requests_total{code=~"50[23]"}[2m])) > 100
每条规则需配 for: 2m 防抖,标签中建议加 severity: warning 或 critical,方便后续路由。
配置 Grafana 告警渠道为钉钉 Webhook
Grafana 8.0+ 内置 Alerting,无需 Alertmanager 也能直连钉钉:
- 进入 Alerting → Notification policies → Contact points,点击 “Add contact point”
- Type 选 DingDing,填入钉钉群机器人 Webhook 地址(末尾带
access_token=xxx) - Message format 选 Markdown,模板里可插入变量,例如:
### Nginx 异常告警<br>**域名**: {{ $labels.server }}<br>**错误率**: {{ $value | printf "%.2f%%" }}<br>**时间**: {{ $time | date "2006-01-02 15:04:05" }} - 保存后,在任意面板的 Alert 标签页新建告警,Query 选择对应 Prometheus 数据源,条件设为 “IS ABOVE”,阈值填
0(因规则已在 Prometheus 计算好,这里只做触发)
注意:Grafana 告警查询不能含模板变量(如 $__rate_interval),需用固定区间,例如 rate(nginx_vts_server_requests_total{code=~"5.."}[5m])。
让告警信息真正有用
只写“错误率高”没意义,运维需要立刻知道“哪来的、影响谁、多严重”:
- 在 Prometheus 规则 labels 中加入可识别字段:
server="{{ $labels.server }}", upstream="{{ $labels.upstream }}" - 钉钉消息里展示关键上下文:域名、上游地址、错误码分布、最近 5 分钟错误请求数(用
sum by(...) (rate(...))计算) - 加跳转链接:在消息末尾加 Grafana 面板 URL,例如
[查看实时趋势](https://grafana.example.com/d/nginx-vts/nginx-vts-dashboard?from=now-1h&to=now&var-server={{ $labels.server }})
这样收到钉钉消息后,点链接就能直达问题域名的实时监控视图,不用再手动筛选。











