直接通过监控工具跟踪 docker 容器生命周期指标,关键在于采集容器状态变更事件及其持续时间,并与资源使用数据对齐;docker 不原生提供状态持续时长,但可通过 docker events 实时捕获 start/stop/die 事件,结合 journalctl 追溯原因,接入 loki+grafana 告警,用 cadvisor 和 docker 27 的 metrics 构建 container_status_phase、docker_container_state 等布尔指标,promql 计算存活时长,叠加健康检查状态(container_health_status)实现闭环判断,并在 grafana 中用堆叠图可视化各状态占比以识别异常模式。
直接通过监控工具跟踪 docker 容器生命周期指标,关键在于采集容器状态变更事件(如 created、running、paused、exited)及其持续时间,并与资源使用数据对齐。docker 本身不暴露“状态持续时长”这类指标,但可通过组合原生接口 + 监控栈实现秒级感知。
用 docker events 实时捕获状态流转
这是最轻量、最直接的方式,无需额外部署组件:
- 运行 docker events --filter 'event=start' --filter 'event=stop' --filter 'event=die' --format '{{.Time}} {{.Actor.Attributes.name}} {{.Status}}',可实时打印容器启动、停止、退出事件
- 配合 journalctl -u docker.service -f 可追溯 daemon 层触发原因(如 OOMKilled、健康检查失败)
- 将输出接入日志系统(如 Loki + Grafana),设置告警规则:连续 3 分钟无
start事件 → 服务未自愈
在 Prometheus 中建模生命周期阶段
cAdvisor 和 Docker 27 内置 metrics 均提供状态维度标签,可构造布尔型指标:
- container_status_phase{phase="running"}:值为 1 表示该容器当前处于 running 状态(cAdvisor 暴露)
- docker_container_state{state="exited", exit_code="137"}:Docker 27 的 /metrics 端点中,exited 容器仍保留该指标,exit_code 明确是否被 OOM 终止
- 用 PromQL 计算存活时长:time() - container_start_time_seconds{job="cadvisor"},单位为秒,适用于分析平均运行寿命或异常短命容器
结合 health check 与状态做闭环判断
仅看 state 字段不够可靠(例如容器进程卡死但状态仍为 running)。必须叠加健康检查结果:
- Docker 原生命令 docker inspect --format='{{.State.Health.Status}}'
返回 healthy/unhealthy/starting - cAdvisor 将其映射为 container_health_status{status="unhealthy"},类型为 Gauge(0 或 1)
- 告警规则示例:count by (name) (container_health_status{status="unhealthy"} == 1) > 0 and on(name) (container_status_phase{phase="running"} == 1) → 正在运行却健康异常,需立即介入
可视化生命周期热力图(Grafana)
在 Grafana 中用 Time Series 面板展示容器状态随时间变化的堆叠图:
- 查询语句:sum by (state) (rate(container_status_phase[1h]))
- X 轴为时间,Y 轴为每种状态(created/running/paused/exited)的归一化占比
- 出现长时间
created→ 启动失败积压;exited突增 → 批处理任务异常退出或资源争抢











