用 find + awk 统计当前目录下所有文件的扩展名数量,命令为:find . -type f -name "." | awk -f. '{print tolower($nf)}' | sort | uniq -c | sort -nr,可忽略大小写、跳过无扩展名文件。

用 find + awk 统计当前目录下所有文件的扩展名数量
直接在终端执行这条命令就能得到按扩展名分组的文件数量,忽略大小写、跳过无扩展名文件:
find . -type f -name "*.*" | awk -F. '{print tolower($NF)}' | sort | uniq -c | sort -nr
关键点在于:find 找出所有含点的文件(-name "*.*"),awk -F. 以点为分隔符取最后一段(即扩展名),tolower() 统一小写避免 .JPG 和 .jpg 被算作两种类型。uniq -c 计数前必须 sort,否则会漏统计。
- 如果要包含隐藏文件(如
.gitignore),把find改成find . -type f,但注意这会把纯点开头无扩展名的文件(如.bashrc)也纳入,此时$NF取出来是空或整个文件名,需额外过滤 - 想排除某些目录(如
node_modules),加-not -path "./node_modules/*" -
sort -nr是按数字逆序排,让数量多的排前面,更直观
处理没有扩展名的文件(比如脚本、配置文件)
很多重要文件根本没有点和后缀,例如 Dockerfile、Makefile、configure,它们会被上面的 *.* 模式直接跳过。要用 file 命令靠内容识别类型:
find . -type f -exec file --mime-type {} \; 2>/dev/null | awk -F: '{gsub(/^ +| +$/, "", $2); print $2}' | sort | uniq -c | sort -nr | head -20
这条命令用 file --mime-type 获取 MIME 类型(如 text/x-shellscript、application/json),再清洗掉空格和冒号前的部分。缺点是慢(每个文件都要读内容),且 MIME 类型粒度比扩展名粗(多个扩展名可能映射到同一个 MIME 类型)。
- 如果只想看“疑似文本类”但无扩展名的文件,可加
grep "text/"过滤 -
file在某些嵌入式或最小化系统里可能没装,先确认which file - 对二进制文件(如
ELF可执行文件),file返回的是application/x-executable,无法还原原始命名习惯
用 shell 数组快速统计指定扩展名(适合写脚本)
如果你只关心几个关键类型(比如 .py、.js、.md),用数组 + glob 更轻量、更可控:
exts=(py js md json ts); for e in "${exts[@]}"; do c=$(ls *."$e" 2>/dev/null | wc -l); echo "$e: $c"; done | sort -k2nr
这里利用了 shell 的通配符展开:当没有匹配文件时,*.py 会原样保留,导致 ls 报错,所以用 2>/dev/null 屏蔽错误;wc -l 统计行数即文件数。注意它不递归,只查当前目录。
- 要递归统计,把
ls *.$e换成find . -name "*.$e" | wc -l - 变量名
e和数组名exts都得用<code>包裹,否则解析失败 - 如果文件名含空格,这个写法会出错;生产环境建议改用
while read -r循环 +find -print0
常见误判和边界情况
扩展名统计最常翻车的地方不是命令写错,而是对“什么是扩展名”理解太机械。比如 archive.tar.gz,多数人认为它是 .gz,但实际压缩包惯例把它当作 .tar.gz;又比如 config.yaml.bak,是 .bak 还是 .yaml.bak?没有标准答案,取决于你统计目的。
-
basename默认只切最后一个点,basename archive.tar.gz .gz得到archive.tar,不是你想要的“去掉压缩后缀” - 有些文件扩展名是大小写混合的(如
.Xresources),tolower()能解决,但若需保留原始大小写做审计,就得换逻辑 - 符号链接指向的文件不会被
find -type f统计到,除非加-follow,但可能引发循环引用
真正难的从来不是命令怎么敲,而是你想清楚:你要的是用户视角的“文件类型”,还是系统视角的“MIME 类型”,还是开发视角的“语言/格式归属”。三者重合度不高,选错就白忙活。










