cgroup失效本质是底层资源控制机制未挂载或初始化,导致容器失去内存/cpu硬限制,可能触发oom killer(退出码137)、卡顿或docker崩溃;需依次验证/sys/fs/cgroup目录状态、/proc/cgroups启用情况、docker info中驱动与版本一致性,并匹配内核≥4.18、加载必要模块、修正启动参数及挂载配置。

内核版本不匹配导致 cgroup 失效,本质是底层资源控制机制无法正常挂载或初始化,进而让容器失去内存、CPU 等硬性限制能力——此时看似“资源充足”,实则容器可无约束抢占宿主机资源,最终触发 OOM Killer 杀进程(退出码 137)、系统卡顿甚至 Docker 守护进程崩溃。
确认 cgroup 是否真正失效
不要仅凭容器异常就断定是 cgroup 问题。先验证基础状态:
- 运行 ls /sys/fs/cgroup:目录为空或仅含少量子目录(如只有
init.scope),说明 cgroup v1 未挂载;若存在unified目录但无memory、cpu等子系统,说明 cgroup v2 启用不全 - 检查 /proc/cgroups:该文件应列出各子系统及其启用状态(
hierarchy列非 0,enabled列为 1);若文件不存在或全为 0,cgroup 功能已不可用 - 执行 docker info | grep -i cgroup:查看输出中
Cgroup Driver和Cgroup Version是否与宿主机实际一致(如内核支持 v2,但 Docker 配置为cgroupfs驱动,就会不兼容)
匹配内核版本与 Docker 运行时要求
Docker 对内核有明确底线:64 位系统需 ≥ 3.10,但实际生产环境建议 ≥ 4.18(尤其使用 overlay2 + cgroup v2)。低版本内核常见缺陷包括 memory.kmem 泄漏、userns 初始化失败、cgroup.memory=nokmem 参数无效等。
- 查当前内核:uname -r;若低于 3.10,必须升级(如 Ubuntu 16.04 默认 4.4,CentOS 7 默认 3.10.0-1160,均满足;老旧 CentOS 6 或某些定制嵌入式系统易踩坑)
- 确认关键模块已加载:lsmod | grep -E "overlay|cgroup|memory";缺失则手动加载:sudo modprobe overlay && sudo modprobe memory
- 检查内核启动参数是否禁用关键功能:运行 cat /proc/cmdline,避免出现
cgroup_disable=memory、systemd.unified_cgroup_hierarchy=0(在 v2 环境下)等冲突项
修复 cgroup 挂载与驱动配置
cgroup 不是“装了就能用”,必须正确挂载且 Docker 驱动与其对齐。
- 若系统启用 cgroup v2(
stat /sys/fs/cgroup/unified存在),但 Docker 报错cgroup mountpoint does not exist,需统一驱动:编辑 /etc/docker/daemon.json,添加"cgroup-manager": "systemd",重启 Docker - 若坚持用 cgroup v1(如旧版 systemd 或容器运行时不兼容 v2),确保子系统挂载完整:运行 sudo mkdir -p /sys/fs/cgroup/{cpu,cpuacct,memory,devices,pids},再逐个挂载,例如:
sudo mount -t cgroup -o memory none /sys/fs/cgroup/memory - 验证挂载结果:mount | grep cgroup 应显示至少 memory、cpu、pids 等关键子系统;find /sys/fs/cgroup -maxdepth 1 -type d | wc -l 建议 ≥ 8
堵住资源溢出的直接入口
即使 cgroup 恢复,旧内核 bug 可能仍导致内存泄漏(如 slab 中堆积大量 cgroup_memory)。不能只依赖默认配置。
- 强制禁用易出问题的 kmem 跟踪:在 GRUB 启动参数中加入
cgroup.memory=nokmem(不是swapaccount=1),更新 grub 并重启;验证方式:cat /proc/cgroups | grep memory 中enabled列为 1,但memory.kmem不再出现 - 容器启动时务必设硬限制:--memory=2g --memory-swap=2g --oom-score-adj=-500;不设
--memory等同于放弃防护 - 检查共享内存:docker run --rm -it alpine df -h /dev/shm,默认 64MB 对多数应用过小;加 --shm-size=1g 再试











