docker compose健壮性依赖健康检查替代depends_on、分层网络隔离、环境变量配置、统一日志与资源约束。例如postgresql用pg_isready做healthcheck,上游服务通过service_healthy等待;划分internal/public/infra网络实现通信边界;.env文件管理敏感配置;json-file日志+on-failure:5+内存cpu限制保障自愈与稳定性。

要让 Docker Compose 编排的分布式服务体系真正健壮,不能只靠“能跑起来”,关键在于服务间可靠通信、就绪等待、故障隔离和可观测性。它不是堆砌容器,而是构建有韧性的协作系统。
用健康检查替代 depends_on
depends_on 只控制启动顺序,不保证服务已就绪——比如 PostgreSQL 容器启动了,但数据库初始化可能还没完成,此时 user-service 就会连接失败并崩溃。
- 为每个依赖服务添加
healthcheck,例如 PostgreSQL:
postgres:<br> image: postgres:15-alpine<br> environment:<br> POSTGRES_DB: userdb<br> POSTGRES_PASSWORD: devpass<br> volumes: ["pg-data:/var/lib/postgresql/data"]<br> healthcheck:<br> test: ["CMD-SHELL", "pg_isready -U postgres -d userdb"]<br> interval: 30s<br> timeout: 10s<br> retries: 5<br> start_period: 40s
- 在依赖它的服务中,用
condition: service_healthy显式等待:
user-service:<br> build: ./user-service<br> depends_on:<br> postgres:<br> condition: service_healthy<br> redis:<br> condition: service_healthy
网络与服务发现按职责隔离
所有服务共用一个默认网络虽方便,但会模糊边界、增加干扰风险。健壮体系应分层划分通信范围:
- 定义多个自定义网络:如
internal(业务服务间私有通信)、public(仅网关暴露给宿主机)、infra(数据库/缓存等基础设施) - 每个服务只加入它真正需要的网络。例如:
gateway:<br> build: ./gateway<br> ports: ["80:8080"]<br> networks: ["public", "internal"]<br><br>user-service:<br> build: ./user-service<br> networks: ["internal", "infra"]<br><br>postgres:<br> image: postgres:15-alpine<br> networks: ["infra"]
- 这样,user-service 可通过
postgres主机名访问数据库,但外部或网关无法直接连入infra网络,天然形成安全隔离
配置外置 + 环境感知启动
把敏感信息(密码、密钥)和环境差异(开发/测试/预发)硬编码进 docker-compose.yml 是健壮性的最大隐患。
- 使用
env_file分离配置,不同环境加载不同文件:
services:<br> user-service:<br> build: ./user-service<br> env_file:<br> - .env.${ENVIRONMENT:-dev}<br> environment:<br> - SPRING_PROFILES_ACTIVE=${ENVIRONMENT:-dev}- 配合
.env.dev和.env.prod,启动时指定:ENVIRONMENT=prod docker-compose up -d - 数据库连接 URL、Redis 地址等全部由环境变量注入,镜像本身无状态、可复用
日志、重启与资源约束三位一体
健壮性体现在服务异常时能否自愈,以及失控时能否及时刹车。
- 统一日志驱动,避免日志丢失或轮转混乱:
user-service:<br> build: ./user-service<br> logging:<br> driver: "json-file"<br> options:<br> max-size: "10m"<br> max-file: "3"
- 设置合理重启策略与资源限制,防止单个服务拖垮整台宿主机:
user-service:<br> restart: on-failure:5<br> mem_limit: 512m<br> mem_reservation: 256m<br> cpus: 0.5
-
on-failure:5表示连续失败 5 次后停止尝试,避免疯狂重启掩盖真实问题;mem_reservation配合mem_limit实现弹性内存管理











