命名空间本身不直接限制物理存储访问,它只提供“视图隔离”——让进程在自己的 mount 命名空间里看到不同的文件系统层次;真正实现存储访问限制,必须结合 mount namespace 与绑定挂载、只读标记、userns 和 cgroups io 控制。

命名空间本身不直接限制物理存储访问,它只提供“视图隔离”——让进程在自己的 mount 命名空间里看到不同的文件系统层次。真正实现存储访问限制,必须结合 Mount Namespace 与 绑定挂载(bind mount)+ 只读/不可绑定标记,再辅以 用户命名空间(UserNS) 和 cgroups 的 io 子系统 才能达成应用级的物理存储控制。
1. 创建独立挂载视图(Mount Namespace)
这是隔离存储访问的第一步:让目标进程看不到宿主机的完整文件系统树。
- 用
unshare --mount启动新命名空间,或在 clone() 中指定CLONE_NEWNS - 进入后立即执行
mount --make-rprivate /—— 这是关键一步,防止后续挂载传播到父命名空间 - 此时可安全地进行 bind mount 或 tmpfs 挂载,所有变更仅限本命名空间可见
2. 精确控制可访问路径(Bind Mount + 权限修饰)
不是“禁止访问某路径”,而是“只显式暴露必要路径”,并严格限定访问权限:
- 只挂载应用真正需要的目录:
mount --bind /data/app-config /mnt/config - 设为只读防止篡改:
mount -o remount,ro /mnt/config - 禁用子挂载传播:
mount -o bind,remount,ro,nosuid,nodev,noexec /mnt/config - 对敏感路径(如
/etc、/usr)不挂载,或挂载空目录覆盖(mount -t tmpfs tmpfs /etc)
3. 阻断绕过挂载的访问路径(UserNS + 文件系统标记)
仅靠 mount namespace 不足以防逃逸。需叠加用户命名空间和底层文件系统保护:
- 启用 User Namespace:
unshare --user --map-root-user,使容器内 root 映射为宿主机非特权用户 - 确保宿主机文件系统启用
user_xattr和noexec挂载选项(尤其对/tmp、/var/tmp) - 对关键目录设置
chattr +d(如果使用 ext4),阻止通过硬链接或 bind mount 绕过
4. 限制底层 I/O 行为(cgroups v2 io controller)
命名空间管“看什么”,cgroups 管“能读写多少”:
- 创建 io cgroup:
mkdir /sys/fs/cgroup/io-limit - 限制磁盘带宽:
echo "8:0 rbps=10485760 wbps=5242880" > /sys/fs/cgroup/io-limit/io.max(对应主硬盘设备号) - 将进程 PID 写入:
echo $PID > /sys/fs/cgroup/io-limit/cgroup.procs - 配合
io.weight控制相对优先级,避免单个应用耗尽 I/O 资源











