Prometheus 监控系统的健康检查与自监控实现

舞夢輝影

舞夢輝影

2026-07-27

924人浏览

原创

prometheus自身具备自监控能力,通过/metrics接口暴露全部内部指标,只需在prometheus.yml中配置job_name: "prometheus"抓取localhost:9090即可实现;关键指标如prometheus_target_sync_length_seconds、prometheus_tsdb_head_series等用于健康判断,kubernetes中可结合/-/readyz做就绪探针。

prometheus 监控系统的健康检查与自监控实现

Prometheus 本身具备完善的自监控能力,其所有内部指标都通过 /metrics 接口暴露,只需将其自身纳入采集目标,就能实现对监控系统自身的健康检查与运行状态追踪。

启用 Prometheus 自身的指标采集

Prometheus 默认就将自己作为第一个 scrape target(即 localhost:9090/metrics),只要配置中没有显式禁用或覆盖 scrape_configs 中的 job_name: "prometheus",该采集就会生效。确认方法是访问 http://<prometheus-host>:9090/targets</prometheus-host>,查看 prometheus job 下的目标是否为 UP 状态。

  • 若未启用,可在 prometheus.ymlscrape_configs 中添加标准配置:

scrape_configs:<br>  - job_name: "prometheus"<br>    static_configs:<br>      - targets: ["localhost:9090"]

有道智云AI开放平台
有道智云AI开放平台

有道智云AI开放平台

下载
  • 注意:如果 Prometheus 运行在容器或远程节点上,“localhost”需替换为实际可访问的地址(如宿主机 IP 或服务名)
  • 重启 Prometheus 后,可通过查询 up{job="prometheus"} 验证目标是否在线

关键自监控指标与健康判断逻辑

以下指标直接反映 Prometheus 核心组件的运行状况,建议配置告警和看板:

  • prometheus_target_sync_length_seconds:抓取同步耗时,持续高于 1s 可能预示性能瓶颈或网络延迟
  • prometheus_tsdb_head_series:当前内存中时间序列数,突增可能意味标签爆炸或采集配置异常
  • prometheus_tsdb_storage_blocks_bytes:持久化 block 占用磁盘空间,配合 rate(prometheus_tsdb_head_truncate_failures_total[1h]) 可识别存储写入问题
  • prometheus_notifications_alertmanagers_discovered:发现的 Alertmanager 数量,为 0 表示通知链中断
  • process_resident_memory_bytesgo_memstats_heap_inuse_bytes:内存使用趋势,结合 GC 频率(go_gc_duration_seconds_count)判断是否内存泄漏

构建轻量级健康检查端点(/health)

Prometheus 原生不提供 HTTP 健康检查接口(如 /health),但可通过简单方式补充:

  • 使用 node_exportertextfile 收集器 + 定时脚本,定期写入 prometheus_health_status 1(成功)或 0(失败)
  • 更推荐方式:部署一个反向代理(如 nginx),对 /health 路径做健康探测——例如转发请求到 /api/v1/status/config 并检查 HTTP 200 + JSON 解析成功
  • Kubernetes 环境下,可直接使用 readiness probe 调用 /-/readyz(Prometheus v2.35+ 支持)或 /api/v1/status/runtimeinfo

避免自监控盲区的实践要点

自监控容易忽略的几个关键点:

  • Alertmanager 未被 Prometheus 监控:必须单独配置 job_name: "alertmanager" 抓取其 /metrics,否则告警发送失败无法感知
  • 服务发现组件(如 Consul、Kubernetes SD)本身故障会导致 target 失联,但 Prometheus 进程仍 UP —— 需监控 prometheus_sd_discovered_targets 变化趋势
  • 远程写(remote_write)失败不会影响本地采集,但数据已丢失,应关注 prometheus_remote_storage_queue_lengthprometheus_remote_storage_failed_samples_total
  • rule evaluation 耗时过长会阻塞后续 rule 执行,用 prometheus_rule_evaluation_duration_seconds 的 99 分位判断是否异常

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Grafana重置admin密码
Grafana重置admin密码

本专题整合了grafana admin密码相关教程,阅读专题下面的文章了解更多详细内容。

2025.09.02

578

12

Grafana admin密码
Grafana admin密码

本专题整合了Grafana密码相关教程,阅读专题下面的文章了解更多详细内容。

2025.12.09

622

9

墨刀AI提示词教学
墨刀AI提示词教学

本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

2026.08.04

9

21

墨刀AI完整入门
墨刀AI完整入门

PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

2026.08.04

6

20

墨刀AI进阶技巧
墨刀AI进阶技巧

本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

2026.08.04

8

14

火山引擎实名认证失败怎么办
火山引擎实名认证失败怎么办

火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

2026.08.04

4

10

火山引擎域名备案流程详解
火山引擎域名备案流程详解

火山引擎域名备案适合需要在火山引擎云服务器、对象存储、CDN或网站服务上绑定域名的用户参考。本专题整理备案入口、账号实名认证、备案类型选择、主体信息填写、网站信息提交、资料上传、初审核验、管局审核和备案失败排查,帮助用户完成网站上线前的备案流程。

2026.08.04

0

10

火山引擎DNS解析配置步骤
火山引擎DNS解析配置步骤

使用火山引擎DNS解析网站域名时,需要确认域名已完成管理接入,并正确配置服务器IP、CNAME地址或验证记录。本专题整理域名添加、记录类型选择、TTL设置、解析状态检查、备案和访问测试等流程,适合新手搭建网站时参考。

2026.08.04

3

10

火山引擎对象存储使用教程
火山引擎对象存储使用教程

火山引擎对象存储适合用于网站图片、视频文件、备份数据、静态资源和应用附件管理。本专题整理TOS控制台入口、存储桶创建、地域选择、权限设置、文件上传、访问链接生成、CDN加速、费用查看和常见上传或访问失败问题,帮助用户快速掌握对象存储基础操作。

2026.08.04

1

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.4万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 131.8万人学习