path.rglob()是专为递归遍历设计的现代方案,语义清晰、性能不输、跨平台一致;它返回path对象,自动处理符号链接与权限异常,支持惰性生成和大小写自适应匹配。

直接用 Path.rglob(),别写递归函数,也别混用 os.walk() —— 它专为这事设计,语义清晰、性能不输、跨平台一致。
为什么 rglob() 比手写 os.walk() 更合适
很多人习惯先用 os.walk() 遍历再手动过滤后缀,但容易漏掉符号链接处理、路径拼接错误,且代码冗长。而 Path.rglob() 是 pathlib 原生支持的惰性生成器,底层调用系统级目录遍历(如 Linux 的 scandir()),不额外建列表,内存友好。
- 匹配
.py文件只需一行:list(Path(".").rglob("*.py")) - 它自动跳过权限不足的子目录(抛
PermissionError,可捕获) - 返回的是
Path对象,不是字符串,后续调用.stem、.read_text()等更自然 - Windows 下大小写不敏感匹配(如
"*.PY"也能命中main.py),Linux 下区分——这点和 shell 行为一致,不用额外适配
rglob() 的通配符陷阱与正确写法
常见错误是写成 rglob("*.py") 却没意识到:这个模式只匹配**当前层级及以下的文件名**,不会穿透到子目录的隐藏文件夹(如 .git/)里找——但这其实是预期行为;真正容易翻车的是路径分隔和多后缀写法。
- 要匹配多个后缀,不能写
"*.py|*.md"(rglob()不支持正则),得用两次再合并:[p for p in Path(".").rglob("*") if p.suffix in {".py", ".md"}] - 想排除
__pycache__目录?rglob()本身不支持排除,得靠生成器表达式过滤:(p for p in Path(".").rglob("*.py") if "__pycache__" not in p.parts) - 注意
"**/*.py"和"*.py"效果一样,因为rglob()默认就是从调用点开始递归;但写成"./**/*.py"反而可能在某些旧版 Python(
大项目下如何避免卡死或权限中断
真实项目常遇到 /proc、Docker 挂载点、加密目录等导致 rglob() 抛 PermissionError 或阻塞。它不会自动跳过,必须显式处理。
- 最简健壮写法:
def safe_rglob(root: Path, pattern: str): try: return list(root.rglob(pattern)) except PermissionError: return [] paths = safe_rglob(Path("."), "*.py") - 如果需精细控制(比如跳过特定目录名),改用
Path.iterdir()+ 手动递归,但仅当真有必要——多数场景rglob()加try/except足够 - 性能提示:匹配百万级小文件时,
rglob("*.py")比rglob("*")+ 后缀判断快 3–5 倍,因为内核层就做了文件名过滤
真正麻烦的不是语法,而是隐式行为:比如 rglob() 会跟随符号链接(除非文件系统禁用),而 os.walk() 默认不跟;还有 Windows 上长路径(>260 字符)可能静默失败——这些都得结合具体环境验证,不能只看文档示例。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











