直接用prometheus实现linux资源异常告警的核心是编写告警规则文件(.yml),确保node exporter正常采集、prometheus加载规则、alertmanager正确分发,不依赖grafana插件;需先验证node exporter运行及指标可查、prometheus配置抓取任务并加载规则文件;推荐规则包括节点离线(up==0持续1分钟)、cpu使用率过高(100-(avg by(instance)(irate(node_cpu_seconds_total{mode="idle"}[5m]))100)>85持续2分钟)、内存不足((node_memory_memavailable_bytes/node_memory_memtotal_bytes)100

直接用 Prometheus 实现 Linux 资源异常告警,核心是写好 告警规则文件(.yml),并确保 Node Exporter 正常采集指标、Prometheus 加载规则、Alertmanager 正确接收和分发告警。不依赖 Grafana 告警插件,避免其单实例记录缺陷。
确认基础组件已就绪
告警规则再准,也得有数据支撑。先验证三件事:
- Node Exporter 在每台目标机器上运行,端口 9100 可访问,且
curl http://IP:9100/metrics | grep node_cpu_seconds_total能返回指标 - Prometheus 的
prometheus.yml中已配置抓取任务,scrape_configs包含对应job_name: 'node_exporter'和 targets - Prometheus 启动时加载了规则文件路径,例如配置中含
rule_files: ["rules.d/*.yml"],且文件权限可读
编写实用的资源告警规则
规则要贴合真实运维场景,避免“一刀切”阈值。以下为推荐配置逻辑(存为 /etc/prometheus/rules.d/linux-alerts.yml):
Linux 性能分析与调优专家,覆盖 CPU、内存、磁盘 I/O、网络、内核参数、编译优化、容器/K8s。适用场景:系统卡顿/高负载、内存不足/OOM/Swap 高、CPU 异常/iowait 高。
-
节点离线:用
up == 0判断,持续 1 分钟即告,适用于快速发现宕机或 exporter 崩溃 -
CPU 使用率过高:计算非 idle 时间占比,表达式建议用
100 - (avg by(instance)(irate(node_cpu_seconds_total{mode="idle"}[5m])) * 100) > 85,持续 2 分钟触发,避免短时峰值误报 -
内存严重不足:关注可用内存比例,
(node_memory_MemAvailable_bytes / node_memory_MemTotal_bytes) * 100 ,持续 2 分钟,比单纯看使用率更能反映真实压力 -
磁盘空间告急:区分“使用率高”和“剩余空间少”。前者用
100 * (1 - node_filesystem_avail_bytes / node_filesystem_size_bytes) > 90;后者更实用——node_filesystem_avail_bytes / 1024 / 1024 / 1024 (剩余不足 5GB),尤其对日志盘、数据盘很关键 -
根分区只读:加一条
node_filesystem_readonly{mountpoint="/"} == 1,瞬间触发,这是典型故障前兆
设置合理标签与注释
标签(labels)决定告警怎么路由,注释(annotations)决定通知内容是否可操作:
- 必须带
severity标签,如critical、warning,Alertmanager 可据此分流 - 在
annotations中加入runbook链接,指向内部排错文档;dashboard指向 Grafana 对应仪表盘,点击就能查上下文 - 用
{{ $labels.instance }}和{{ $value }}动态填充,让每条告警自带机器名和具体数值,不靠人工查
验证与调试告警是否生效
写完规则别急着上线,按步骤验证:
- 执行
promtool check rules /etc/prometheus/rules.d/linux-alerts.yml检查语法 - 重启 Prometheus 或调用
curl -X POST http://localhost:9090/-/reload热加载 - 访问
http://prometheus:9090/alerts,看规则状态是否为 “Active”,且 “State” 显示 “Pending” 或 “Firing” - 手动触发测试:临时停掉一台机器的 Node Exporter,观察是否在 1 分钟后出现
InstanceDown告警










