关键是要通过多层机制协同收窄攻击面:以非root用户运行、--cap-drop=all并按需加回、启用seccomp白名单、--read-only根文件系统、--tmpfs临时存储、网络与资源硬隔离。

Docker 容器要配置真正可用的安全隔离沙箱环境,关键不是“开个容器”,而是通过多层机制协同收窄攻击面——既要切断危险能力,又要限制资源、隔离视图、降权运行。以下是生产级可落地的配置要点:
用最小权限用户运行
容器默认以 root 启动是最大隐患之一。必须显式切换为非 root 用户:
- Dockerfile 中添加:
RUN addgroup -g 1001 -f sandbox && \ adduser -S sandbox -u 1001 USER sandbox:sandbox - 运行时强制指定(覆盖镜像配置):
docker run --user 1001:1001 ...
这样即使代码被劫持,也无法执行需要 root 权限的操作(如挂载设备、修改系统时间、写入 /etc)。
禁用全部 Linux capabilities 并按需加回
Capabilities 是 root 权限的“切片”,默认保留太多。应先全关,再只开必需项:
-
--cap-drop=ALL:移除所有 capability -
--cap-add=NET_BIND_SERVICE:仅当需要绑定 1024 以下端口时加回 - 避免
--privileged或--cap-add=ALL,这是沙箱失效的常见原因
启用 Seccomp 白名单策略
Seccomp 能拦截危险系统调用,比如 ptrace(用于调试逃逸)、mount(突破文件系统隔离)、unshare(绕过命名空间)。
- 使用 Docker 内置精简 profile:
--security-opt seccomp=unconfined→ 改为默认或自定义白名单 - 推荐做法:基于
builtinprofile 修改,只保留约 120 个安全 syscall(如open,read,execve,socket,write),屏蔽init_module,setuid,process_vm_readv等高危调用 - 配置文件可通过
docker inspect查看是否生效:.HostConfig.SecurityOpt应含seccomp:/path/to/profile.json
强制只读根文件系统 + 受控临时存储
防止恶意代码篡改自身或持久化 payload:
-
--read-only:根目录/挂载为只读 - 对需写的路径单独挂载读写卷:
-v /host/data:/app/data:rw - 用
tmpfs提供受控临时空间:--tmpfs /tmp:rw,size=10m,mode=1777
这样既满足程序运行需求,又避免写入磁盘留下痕迹或耗尽空间。
网络与资源硬隔离
- 网络:若无需外联,用
--network=none;需有限访问则建自定义 bridge 并禁用 IP 伪装和端口映射 - 内存:
--memory=512m(超限时触发 OOM Killer) - 进程数:
--pids-limit=100(防 fork bomb) - CPU:
--cpus=0.5或--cpu-quota=50000 --cpu-period=100000
这些配置组合起来,才能让容器从“轻量虚拟机”真正变成一个行为受限、资源可控、权限收敛的沙箱。不是加得越多越安全,而是每一条都应有明确依据——删掉一个没用的能力,比加十个没审过的权限更有效。











