优化du命令遍历大目录的核心是减少无效i/o和元数据开销:用--exclude跳过/proc、/sys等虚拟路径及.git等无价值目录,结合--max-depth限制递归深度,辅以find或ls初筛提速,并针对nfs、overlay2等场景采取适配策略。

大目录遍历慢,本质是 du 默认逐文件 stat + 读取元数据,尤其在含海量小文件、硬链接多、或 NFS/overlay2 等特殊文件系统上更明显。优化不是换命令,而是减少无效 I/O 和元数据开销。
跳过不需要的子树和文件类型
用 --exclude 直接过滤掉已知无价值路径,比遍历后再筛快得多。常见可跳过的包括:
-
/proc、/sys、/dev—— 虚拟文件系统,du 会卡住或报错 -
/run、/var/run—— 运行时临时文件,生命周期短且不占持久空间 -
.git、node_modules、__pycache__—— 开发环境高频大目录,若非排查代码问题可跳过 -
*.log.*.gz、*.tmp—— 用通配符排除归档日志和临时文件(注意 shell 展开,建议加引号)
示例:du -sh --max-depth=1 --exclude={'/proc','/sys','/dev','node_modules','.git'} / | sort -hr
限制深度与提前剪枝
深层嵌套目录(如容器镜像层、日志归档)往往只有最外层目录有意义。用 --max-depth=N 控制递归层级,避免钻进百万级小文件目录。
-
--max-depth=1:只看一级子目录,适合快速定位“谁占得最多” -
--max-depth=2:再下一层确认,比如/var/log/journalvs/var/log/nginx - 配合
--threshold=100M(较新 du 支持):只统计大于 100MB 的项,小文件直接跳过
用更轻量的替代方案初筛
du 是准确但重;ncdu 是交互友好但依然要全扫;真正要提速,先用更快的工具缩小范围:
-
find /path -xdev -type d -exec du -s {} + 2>/dev/null | sort -n | tail -20:按磁盘块数排序,-xdev防止跨文件系统误入 -
ls -lS /path | head -20:只看顶层大目录(不递归),秒出结果 -
ncdu -x /path:-x参数确保不跨挂载点,避免意外进入 /boot 或 /home 等其他分区
避开元数据瓶颈场景
某些情况下慢不是因为文件多,而是文件系统本身响应慢:
- NFS/CIFS 挂载点:du 会触发大量 getattr 请求,建议在服务端执行,或改用
df -h+ls -lR | wc -l估数量 - Docker overlay2:直接查
/var/lib/docker/overlay2/*/diff效率低,优先用docker system df -v - ext4 上大量硬链接:du 默认去重计数,加
--no-dereference可略过链接解析(慎用,可能高估)











