☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
若无法实时掌握gpu显存占用与核心温度,需构建grafana监控面板;可选路径包括:一、nvidia-gpu-exporter+prometheus+grafana标准链路;二、dcgm-exporter替代方案(适配ampere及更新架构);三、轻量级脚本+pushgateway(免prometheus集群);四、集成至大模型服务自身http接口(零额外组件)。
如果您已部署本地大模型服务,但无法实时掌握gpu显存占用、核心温度等关键运行状态,则可能是由于缺乏统一的指标采集与可视化通道。以下是为本地大模型构建grafana显存/温度监控面板的多种实施路径:
一、使用nvidia-gpu-exporter + Prometheus + Grafana标准链路
该方法通过NVIDIA官方兼容的exporter暴露GPU硬件指标,由Prometheus拉取并持久化,再由Grafana按需渲染图表,具备高精度、低侵入、可长期回溯的特点。
1、在宿主机或Docker环境中拉取并运行nvidia-gpu-exporter容器,确保其能访问/dev/nvidia0等设备节点及nvidia-smi二进制文件。
2、配置Prometheus的scrape_configs,添加target指向exporter暴露的HTTP端点(默认9101),设置抓取间隔为15秒。
3、启动Grafana服务,添加Prometheus为数据源,URL填写http://prometheus-host:9090。
4、导入社区GPU监控模板ID(如12107或18608),或手动创建Panel,使用PromQL查询:nvidia_gpu_duty_cycle{job="gpu-exporter"}表示利用率,nvidia_gpu_memory_used_bytes{job="gpu-exporter"}表示已用显存,nvidia_gpu_temperature_celsius{job="gpu-exporter"}表示核心温度。
二、基于dcgm-exporter替代方案(适用于Ampere及更新架构)
当使用RTX 4090、A100或H100等支持DCGM的GPU时,nvidia-dcgm-exporter提供更底层、更稳定的指标,包括显存带宽、ECC错误、XID事件等,且对多卡拓扑识别更准确。
1、安装NVIDIA Data Center GPU Manager(DCGM)工具包,并启用dcgm-exporter服务。
2、确认dcgm-exporter监听端口(默认9400),并验证curl http://localhost:9400/metrics可返回文本格式指标。
3、修改Prometheus配置,将job名称设为"dcgm",target指向http://host:9400/metrics。
4、在Grafana中新建Dashboard,添加折线图Panel,查询表达式使用:dcgm_gpu_temp{gpu_type=~".*"} 获取各卡温度,dcgm_fb_used{gpu_type=~".*"} 获取帧缓冲显存用量。
三、轻量级单机脚本+Pushgateway方式(无Prometheus集群场景)
适用于仅有一台开发机、不希望维护Prometheus服务的用户。通过Python或Bash定时执行nvidia-smi,将结果推送到Pushgateway,再由Grafana从Pushgateway拉取最新快照。
将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。
1、部署Pushgateway服务(docker run -d -p 9091:9091 prom/pushgateway)。
2、编写shell脚本,每30秒调用nvidia-smi --query-gpu=temperature.gpu,utilization.gpu,memory.used --format=csv,noheader,nounits,解析后构造指标字符串并curl POST至http://pushgateway:9091/metrics/job/gpu_monitor。
3、在Prometheus中配置static_configs指向Pushgateway地址,job为gpu_monitor。
4、Grafana中配置对应数据源后,使用查询:max by(instance) (gpu_temperature_celsius{job="gpu_monitor"})显示最高温度,sum by(instance) (gpu_memory_used_bytes{job="gpu_monitor"})汇总显存用量。
四、集成至大模型服务自身HTTP接口(零额外组件)
若本地大模型服务(如vLLM、Ollama、Text Generation WebUI)支持自定义健康检查端点或中间件注入,可直接在推理请求处理链中嵌入GPU状态采集逻辑,并以JSON形式暴露于/health/gpu路径。
1、在服务启动时初始化pynvml或GPUtil库,绑定GPU设备句柄。
2、在/health/gpu路由响应中返回结构化JSON,包含"gpu_temp": 67, "gpu_memory_used_gb": 18.2, "gpu_util_percent": 83等字段。
3、部署一个轻量Exporter(如Prometheus client_python的exposition模块),将该JSON自动转换为Prometheus格式指标并暴露于/metrics端点。
4、Prometheus配置scrape目标为此服务的/metrics路径,Grafana中即可使用gpu_health_temperature_celsius等自定义指标名进行绘图。










