用grafana做prometheus监控大屏的核心是让指标讲清业务状态,关键在于:一、正确配置prometheus数据源;二、选取贴合业务的指标并规范命名;三、按顶部kpi、中部趋势、底部诊断分区布局;四、设置自动刷新、固定时间范围、角色化视图及json备份。

直接用 Grafana 做 Prometheus 监控大屏,核心不是堆图表,而是让指标讲清楚业务状态。关键在三点:数据源对得准、指标选得对、布局看得懂。
一、先连上 Prometheus 数据源
这是所有看板的起点。进 Grafana →「Configuration」→「Data Sources」→「Add data source」→ 选 Prometheus → 填写 URL(通常是 http://prometheus-host:9090)。测试连通后保存。注意:如果 Prometheus 开了 Basic Auth 或跑在容器里,要填对认证信息和网络可达地址,否则后面查不到任何数据。
二、挑真正有用的指标来画图
别一上来就拉 CPU 和内存——要看你监控的是什么。比如:
- 监控 AI 模型服务:重点是
api_latency_seconds(P99 耗时)、request_total{status=~"5.."}(错误率)、gpu_utilization(GPU 使用率) - 监控动态线程池:必须有
threadpool_active_threads{pool_name="xxx"}、threadpool_rejected_tasks_total、threadpool_resize_events_total{action="scale_up"} - 监控电商下单链路:要叠加
http_requests_total{path="/order/submit"}和服务器node_load1,才能看出高并发是否压垮了机器
每个图表标题建议写成“动词+对象+条件”,例如:“API 平均耗时(最近1小时)”或“订单提交失败率(过去5分钟)”,而不是“rate(http_request_duration_seconds_sum[5m])”这种原始表达式。
一款AI工具,主要用于使用 CodexBar CLI 本地成本使用情况,按模型汇总 Codex 或 Claude 的使用量,包括当前(最新)模型或完整的模型分解,适合需要提升相关任务效率的用户。
三、分区布局,一眼抓住重点
大屏不是越多图越好,推荐按逻辑分区块:
- 顶部横幅区:放 3–4 个核心 KPI 卡片(如 QPS、成功率、P99 延迟、错误数),字体放大,带颜色预警(绿色正常 / 黄色预警 / 红色告警)
- 中间趋势区:2–3 个主时间序列图,宽度占满,Y 轴统一单位(如毫秒、百分比),X 轴默认显示最近 1 小时
- 底部诊断区:放 TopN 排名图(如“延迟最高的 5 个 API”)、实例对比图(如多台机器的 CPU 并排柱状图)、或日志关键词频次热力图
所有图表右上角打开「Legend」并设为「Right」,避免遮挡曲线;启用「Tooltip」设为「Shared」,悬停时能横向对齐看同一时刻各指标值。
四、让大屏真正可用
部署后容易忽略但影响实际使用的细节:
- 设置自动刷新(Dashboard Settings → Refresh → 选 30s 或 1m),不然数据永远“慢半拍”
- 开启「Time range」固定为「Last 1 hour」或「Last 5 minutes」,避免有人误点成“今天”导致图表空白
- 给不同角色建不同视图:运维看资源+错误,算法同学看延迟+准确率,老板只看 KPI 卡片页
- 导出 JSON 备份看板配置,升级 Grafana 或重装时可一键恢复










