用 zipfile.zipfile.namelist() 获取zip内所有文件名,注意编码和路径分隔符差异;推荐用 pureposixpath 统一路径后 glob 匹配,或正则归一化后匹配;大文件优先用 name in z.namelist() 快速判断存在性。

直接用 zipfile 配合 glob 或正则就能查,但要注意编码和路径分隔符——Windows 打包的 ZIP 在 Linux 里常因 \ 导致匹配失败。
用 zipfile.ZipFile.namelist() 获取所有文件名
这是最基础也最可靠的入口。ZIP 文件内部不存“目录结构”,namelist() 返回的是扁平字符串列表,含完整路径(如 "data/logs/app.log" 或 "config\settings.ini")。
- 必须先打开 ZIP:用
with zipfile.ZipFile(path, "r") as z:,避免资源泄漏 -
namelist()不递归、不过滤,返回全部条目,包括空目录(以/结尾的字符串) - 某些老工具打包时用
\作分隔符,即使在 Unix 系统解压后仍保留——不能直接拿os.path.join()拼接匹配
按通配符搜索(类似 shell 的 *.py)
别自己写字符串 endswith(),用 pathlib.PurePosixPath 统一路径风格再配合 glob 最稳:
from zipfile import ZipFile
from pathlib import PurePosixPath
with ZipFile("archive.zip") as z:
paths = [PurePosixPath(n) for n in z.namelist()]
matches = [str(p) for p in paths if p.match("src/**/*.py")]
-
PurePosixPath强制把\和/都转成/,match()才能跨平台生效 -
**支持递归匹配,但注意match()不是正则,?匹配单字符,*匹配非斜杠字符 - 如果只需简单后缀,
[n for n in z.namelist() if n.endswith(".txt")]更快,不用构造 Path 对象
用正则精确控制匹配逻辑
当需要忽略大小写、提取版本号、或排除特定模式时,正则更灵活:
import re
from zipfile import ZipFile
pattern = re.compile(r"^(?:docs|examples)/.*.(md|rst)$", re.IGNORECASE)
with ZipFile("pkg.zip") as z:
matches = [n for n in z.namelist() if pattern.match(n)]
- 正则作用于原始
namelist()字符串,所以得自己处理分隔符差异——建议先用.replace("\", "/")归一化 - ZIP 中文件名本质是字节流,若遇到乱码(比如中文用 GBK 打包),
namelist()可能返回bytes;此时需用z.filelist+.filename.decode("gbk")手动解码 - 避免在循环里反复编译正则,提前用
re.compile()缓存
性能与边界情况提醒
大 ZIP(>1GB)里调 namelist() 很快,但后续过滤若逻辑重,可能卡住——不是 ZIP 解压慢,是 Python 列表遍历+正则开销大。
- 如果只关心是否存在某文件,用
name in z.namelist()比全量过滤快得多(底层是哈希查找) -
z.getinfo(name)能获取单个文件元数据,但name必须完全匹配,且对不存在的 name 会抛KeyError - ZIP64、加密 ZIP、跨卷 ZIP 不被标准
zipfile支持,会直接报BadZipFile或NotImplementedError
真正麻烦的从来不是“怎么写”,而是“为什么在测试机上能匹配,上线后就漏掉几个文件”——八成是打包端用了非 UTF-8 编码,或者路径里混用了 / 和 \,得先打印 repr(namelist()) 看真实字符串。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











