配置 prometheus 监控看板的核心是让 grafana 正确连接 prometheus 数据源并构建反映业务真实状态的可视化面板:先确认 prometheus 服务运行且可访问 http://[ip]:9090;在 grafana 中通过 configuration → data sources 添加 prometheus 类型数据源,填入地址(如 http://localhost:9090),选 get 请求,点击 save & test 验证连通;再从 grafana.com/dashboards 导入匹配业务的模板(如 s2-pro、vllm),选择该数据源并保存;最后适配实例标签、指标名、时间范围等参数,并可补充自定义 promql 面板提升业务洞察。

配置 Prometheus 监控看板,核心是让 Grafana 正确连接 Prometheus 数据源,并加载或构建能反映业务真实状态的可视化面板。它不是单纯“画图”,而是把指标语义、采集逻辑和运维关注点串起来的过程。
确认 Prometheus 数据源已就绪
这是所有可视化的前提。Grafana 本身不采集数据,只负责展示。
- 确保 Prometheus 服务正在运行,且可通过浏览器访问 http://[IP]:9090(默认端口)
- 在 Grafana 中添加数据源:进入 Configuration → Data Sources → Add data source → Prometheus
- 填入 Prometheus 地址(如
http://localhost:9090),HTTP Method 选 GET,点击 Save & test 确认连通 - 若提示“Failed to fetch”,检查防火墙、网络策略,或确认 Prometheus 是否监听了外部 IP(非仅 127.0.0.1)
导入或创建适用的看板模板
从成熟模板起步,比从零搭建更高效、更可靠。
- 访问 https://grafana.com/grafana/dashboards/,按关键词搜索(如 node exporter、GPU、s2-pro、vLLM)
- 找到匹配你服务类型的模板(例如语音合成用 s2-pro,大模型推理用 vLLM),复制其 ID 或下载 JSON 文件
- 在 Grafana 中进入 Dashboard → New → Import,粘贴 ID 或上传 JSON
- 选择刚配置好的 Prometheus 数据源,命名看板并保存
- 首次加载若无数据,先确认 Prometheus 已成功抓取目标(访问
/targets页面查看状态是否为 UP)
调整面板参数以匹配实际环境
模板是通用的,你的环境是具体的。关键字段常需手动适配。
-
实例筛选:多数模板含变量(如
$instance),需确认 Prometheus 抓取到的目标标签是否匹配(比如 targets 是localhost:8000,但模板默认查host.docker.internal:8000) -
指标名称校验:检查 PromQL 表达式中的指标名是否与导出器实际暴露的一致(如
s2_pro_requests_totalvsstructbert_requests_total) - 时间范围与刷新:右上角设置自动刷新(如 30s),避免手动刷新遗漏瞬时异常
- 告警联动(可选):可在面板中嵌入 Alert Rule 链接,或为关键指标(如响应延迟 >2s)直接配置阈值高亮
补充自定义面板提升业务洞察力
标准模板覆盖基础设施,业务层指标需自己定义。
- 在 Grafana 中新建面板,选择 Query 模式,输入 PromQL(如
rate(s2_pro_requests_total[5m])查每秒请求数) - 用 Gauge 展示当前活跃 worker 数,用 Graph 展示过去一小时错误率趋势
- 添加 Stat 面板突出显示最大响应时间、成功率等摘要值
- 对多服务场景,可利用 Variable 创建下拉菜单,动态切换监控对象(如不同模型版本、不同 GPU 节点)











