prometheus scrape 超时根本原因是服务端未暴露 /metrics 端点或被拦截,且其默认 10s 硬编码超时不可配;需确保 promhttp.handler() 正确注册、监听地址可达、避免 handler 耗时操作,并用 curl 验证响应是否秒回且含 # type。

Go 里用 prometheus.ClientGolang 拉取指标时,为什么 scrape 总是超时?
根本原因常是服务端没暴露 /metrics 端点,或中间有反代/防火墙拦截了 GET 请求。Prometheus 默认每 15s 发一次 GET /metrics,超时时间硬编码为 10s(不可配),一旦响应慢于这个值就报 context deadline exceeded。
- 确认你的 Go 服务已注册
http.Handle("/metrics", promhttp.Handler()),且监听地址可被 Prometheus 访问(别只绑127.0.0.1) - 若走 Nginx,检查是否透传了
Accept和User-Agent头(某些配置会过滤掉非浏览器 UA) - 避免在
/metricshandler 里做耗时操作(如查 DB、调远程 API),它必须是纯内存快照 - 本地调试可用
curl -v http://localhost:8080/metrics看是否秒回、返回内容是否含# TYPE行
用 github.com/prometheus/alertmanager/client/api 推送告警时,PostAlerts 返回 400 怎么办?
Alertmanager v0.24+ 对告警 payload 格式更严格,常见错误是字段类型错、时间戳非法或缺少必要字段。它不接受空数组、nil 字段,也不容忍 startsAt 晚于 endsAt。
- 确保每个
alert对象包含labels(map[string]string)、annotations(map[string]string)、startsAt(RFC3339 格式,如"2024-05-20T10:30:00Z") -
startsAt必须早于当前时间(Alertmanager 会拒收未来时间),endsAt可为空(表示未解决) - 别手动拼 JSON,用官方 client 的
api.Alert结构体赋值后调client.PostAlerts(),避免字段名大小写错误(比如写成StartsAt而非startsAt) - 测试时先用
curl -X POST http://am:9093/api/v2/alerts -H "Content-Type: application/json" -d @alert.json验证 payload 合法性
自己写采集器(collector)时,Describe 和 Collect 方法总被调两次?
这是 Prometheus client 的正常行为:启动时调一次 Describe 获取指标定义,每次 scrape 时再调 Collect 填充样本。但如果你在 Collect 里做了副作用(比如发 HTTP 请求、读文件),就会重复执行,导致性能抖动或状态错乱。
-
Describe只负责输出*prometheus.Desc,不能有 IO;Collect才负责取数,但应尽量轻量 - 高频采集(如每 5s)时,考虑加一层内存缓存(比如用
sync.Map存上次结果 + 时间戳),在Collect中判断是否需刷新 - 避免在
Collect中 new 大量对象,复用prometheus.Metric实例或直接用Set/Inc等方法更新已有指标 - 用
prometheus.NewRegistry()替代全局 registry 测试 collector,防止其他模块干扰
通知发不出去,查日志看到 failed to notify alertmanager: context canceled
这不是网络问题,而是 Go 的 context 在请求发出前就被取消了——通常因为调用方设置了过短的 timeout,或父 context 已结束(比如 HTTP handler 返回、goroutine 退出)。
- 发送告警的代码必须用带 timeout 的 context:
ctx, cancel := context.WithTimeout(context.Background(), 5*time.Second),别直接传context.Background() - 如果告警逻辑嵌在 HTTP handler 里,别用
r.Context()(它随 response 结束而 cancel),应派生新 context - Alertmanager client 的
PostAlerts不支持重试,出错后需业务层捕获并决定是否降级(如写本地日志、发邮件) - 线上环境建议把告警发送包装成异步 goroutine,并加简单队列(如
chan api.Alert)防阻塞主流程
事情说清了就结束。真正难的不是调通接口,而是让指标采集不拖慢业务、告警不误发不漏发、上下文生命周期和超时控制刚好卡在临界点上。
golang免费学习笔记(深入):立即使用
在学习笔记中,你将探索golang的核心概念和高级技巧!











