shutil.unpack_archive可解压zip、tar等常见格式,但存在路径穿越风险,须指定目标目录并校验路径合法性,防止../../等恶意路径写入系统关键位置。

用 shutil.unpack_archive 解压常见格式但要注意路径安全
shutil.unpack_archive 能直接处理 .zip、.tar、.tar.gz、.tgz、.tar.bz2 和 .tar.xz,不用手动判断后缀。但它默认解压到当前目录,且不校验归档内路径——如果压缩包含 ../../etc/passwd 这类路径,会直接写到系统关键位置。
必须显式指定解压目标目录,并启用路径净化:
import shutil
import os
<p>def safe_unpack(archive_path, extract_to):</p><h1>强制创建目标目录</h1><pre class="brush:python;toolbar:false;">os.makedirs(extract_to, exist_ok=True)
# 先解压到临时目录,再检查路径合法性
temp_dir = os.path.join(extract_to, "_temp_unpack")
os.makedirs(temp_dir, exist_ok=True)
shutil.unpack_archive(archive_path, temp_dir)
# 遍历临时目录中所有文件,拒绝含 ".." 的路径
for root, _, files in os.walk(temp_dir):
for f in files:
full_path = os.path.join(root, f)
rel_path = os.path.relpath(full_path, temp_dir)
if ".." in rel_path.split(os.sep):
raise ValueError(f"Unsafe path detected: {rel_path}")
# 安全后才移动到目标目录
for item in os.listdir(temp_dir):
src = os.path.join(temp_dir, item)
dst = os.path.join(extract_to, item)
if os.path.exists(dst):
raise FileExistsError(f"Target conflict: {dst}")
os.replace(src, dst)
os.rmdir(temp_dir)
用 zipfile 和 tarfile 手动控制压缩并保留目录结构
批量压缩时,shutil.make_archive 简单但无法跳过特定子目录或过滤文件;真正需要精细控制(比如只压 src/ 下内容、排除 __pycache__)就得用底层模块。
zipfile 默认保留相对路径,但要注意:传给 write() 的 arcname 必须是相对于归档根的路径,否则顶层目录会暴露出来:
import zipfile
import os
<p>def zip_dir(src_dir, zip_path):
with zipfile.ZipFile(zip_path, "w", zipfile.ZIP_DEFLATED) as zf:
for root, dirs, files in os.walk(src_dir):</p><h1>过滤掉不想打包的目录</h1><pre class="brush:python;toolbar:false;"> dirs[:] = [d for d in dirs if d != "__pycache__"]
for file in files:
file_path = os.path.join(root, file)
# 计算归档内的相对路径,去掉 src_dir 前缀
arcname = os.path.relpath(file_path, src_dir)
zf.write(file_path, arcname)
tarfile 同理,但需注意 add() 的 arcname 参数行为一致,且 filter 参数可更早拦截(比如跳过符号链接):
import tarfile <p>def tar_dir(src_dir, tar_path): with tarfile.open(tar_path, "w:gz") as tf: tf.add(src_dir, arcname=os.path.basename(src_dir), filter=lambda ti: None if ti.islnk() else ti)</p>
识别归档格式不能只看后缀,得靠 magic bytes
用户可能把 .zip 文件重命名为 .txt,或用 7z 打的 .7z 文件硬改后缀成 .zip。仅靠 os.path.splitext() 判断格式会出错。
用 python-magic(libmagic 绑定)读取文件头:
import magic
<p>def detect_archive_type(path):
try:
mime = magic.from_file(path, mime=True)
if mime == "application/zip":
return "zip"
elif mime.startswith("application/x-tar"):
return "tar"
elif mime == "application/gzip" and path.endswith(".gz"):</p><h1>需结合后缀判断是否为 tar.gz</h1><pre class="brush:python;toolbar:false;"> return "tar.gz"
elif mime == "application/x-bzip2":
return "tar.bz2"
elif mime == "application/x-xz":
return "tar.xz"
else:
return None
except Exception:
return None
注意:python-magic 在 Windows 上需额外安装 python-magic-bin,macOS/Linux 需系统级 libmagic。若环境受限,至少加一层后缀 fallback:
-
.zip,.jar→zip -
.tar,.tgz,.tar.gz,.tar.bz2,.tar.xz→ 对应 tar 格式 - 其他 → 报错或跳过
批量处理时别忽略编码和权限问题
Windows 打的 .zip 常用 GBK 编码存中文文件名,Linux/macOS 默认用 UTF-8 解压会乱码;tar 归档在 Linux 打包的执行权限(如 0o755)在 Windows 解压后会丢失。
zipfile 无原生编码参数,得手动 decode:
with zipfile.ZipFile(path) as zf:
for info in zf.filelist:
try:
name = info.filename.encode("cp437").decode("utf-8")
except UnicodeDecodeError:
name = info.filename.encode("cp437").decode("gbk", errors="ignore")
# 再用 name 构造安全路径...
tarfile 可设 encoding 参数,但权限需显式还原:
for member in tf.getmembers():
if member.isfile():
tf.extract(member, path=extract_to)
# 恢复权限(仅限 POSIX)
if os.name == "posix":
os.chmod(os.path.join(extract_to, member.name), member.mode)
跨平台批量处理时,这些细节不处理,解压出来的文件名就不可读,脚本生成的可执行文件也无法运行。
路径净化、编码适配、权限还原——这三处不是“锦上添花”,而是解压动作成立的前提。漏掉任意一个,都可能让整个批量流程在某台机器上静默失败。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











