docker守护进程的/var/run/docker.sock unix套接字是对接监控系统最轻量、最原生的方式,无需容器内agent,直接从运行时层获取真实实时的容器生命周期与资源状态。

直接通过 Docker 守护进程的 /var/run/docker.sock Unix 套接字暴露的 HTTP 接口,是对接外部监控系统最轻量、最原生的方式。它不需要在容器内安装额外 agent,也不依赖容器内部应用暴露指标,而是从运行时层获取真实、实时的容器生命周期与资源状态。
确认 Docker 守护进程已启用监控接口
Docker 默认就提供本地 Unix socket 接口(unix:///var/run/docker.sock),但需确保:
- Docker 服务正在运行:
sudo systemctl status docker - 套接字文件存在且权限可读:
ls -l /var/run/docker.sock,监控程序所在用户(如prometheus)需属于docker用户组,或通过sudo usermod -aG docker prometheus加入 - 若需远程访问(不推荐生产环境),需修改
/lib/systemd/system/docker.service中的ExecStart,添加-H tcp://0.0.0.0:2375并禁用 TLS 认证——但更安全的做法是仅限本地 socket + 反向代理或 sidecar 封装
使用 Prometheus 自动发现容器并抓取指标
Prometheus 本身不直接解析 Docker socket,而是借助 cAdvisor(采集容器级指标)和 Docker 服务发现(动态识别容器元数据)协同工作:
-
cAdvisor 必须以特权模式运行,并挂载宿主机关键路径:
docker run -d --name=cadvisor --privileged -v /:/rootfs:ro -v /var/run:/var/run:ro -v /sys:/sys:ro -v /var/lib/docker/:/var/lib/docker:ro -p 8080:8080 gcr.io/cadvisor/cadvisor:v0.49.1 - 在
prometheus.yml中配置docker_sd_configs,让 Prometheus 主动发现所有容器:- job_name: 'docker-containers' docker_sd_configs: - host: unix:///var/run/docker.sock refresh_interval: 15s relabel_configs: - source_labels: [__meta_docker_container_name] regex: '/(.*)' target_label: container_name - source_labels: [__meta_docker_container_status] target_label: status - 注意:Docker socket 挂载进 Prometheus 容器时,需加
--privileged或显式授权cap_add: [SYS_ADMIN](取决于内核版本)
对接 SIEM 或自定义告警系统(非 Pull 模式)
如果目标系统不支持 Pull 拉取(如某些日志平台或安全分析引擎),可通过监听 Docker 事件流实现准实时响应:
- 执行
curl --unix-socket /var/run/docker.sock http://localhost/events?since=2026-05-01T14:00:00获取指定时间后的容器启停、OOM、健康检查失败等事件 - 用轻量脚本(如 Python +
docker-py)长连接/events接口,过滤关键事件并转发至 webhook、Kafka 或 Syslog:
例如检测到status=kill且reason=oom,立即触发告警 - eBPF 方案可在此基础上增强:用 BCC 工具(如
opensnoop或自定义 tracepoint)捕获容器内异常系统调用,再与 Docker 事件关联,实现“容器启动 → 进程崩溃 → 内核 OOM killer 触发”全链路归因
安全与稳定性注意事项
直接访问 Docker socket 权限极高,相当于宿主机 root 权限,必须严格管控:
- 避免将 socket 挂载到不可信容器中;生产环境建议用 containerd CRI 插件 或 Podman 的 API 网关 做一层鉴权代理
- 限制事件监听频率,避免高频
GET /containers/json请求拖慢守护进程(尤其容器数 >500 时) - 对采集到的容器名、镜像标签等元数据做脱敏处理,防止敏感信息(如含密码的 ENV)泄露至监控后端
- 建议搭配
node-exporter补充主机维度指标(CPU、磁盘 I/O、网络丢包),避免只看容器而忽略底层资源争抢











