
本文介绍如何利用 PySpark 的通配符路径匹配功能,无需循环遍历,直接加载多级嵌套目录(如 /folder1/.../folder4/*/year=2023/*.csv)下所有符合年份条件的 CSV 文件。
本文介绍如何利用 pyspark 的通配符路径匹配功能,无需循环遍历,直接加载多级嵌套目录(如 `/folder1/.../folder4/*/year=2023/*.csv`)下所有符合年份条件的 csv 文件。
在实际数据工程场景中,常见将结构化数据按分区(如 Year=2023)组织在深层嵌套目录中。若需高效读取某一年份下所有 CSV 文件,不应使用 Python for 循环逐一拼接路径并多次调用 spark.read.csv()——这不仅性能低下,还会引发重复 Schema 推断、任务调度开销等问题。
PySpark 原生支持 Unix 风格通配符(*, [abc], ?),可直接在 spark.read.csv() 的路径参数中使用,实现“一键式”批量读取。针对您的目录结构:
/folder1/folder2/folder3/folder4/folder41/year=2023/,
/folder1/folder2/folder3/folder4/folder42/year=2023/,
…
推荐以下三种路径写法(按推荐优先级排序):
✅ 最推荐(语义清晰 + 兼容性强):
path = "/folder1/folder2/folder3/folder4/*/year=2023"
df = spark.read.option("header", "true").option("inferSchema", "true").csv(path)
* 可匹配任意子目录名(如 folder41, folder42),简洁且跨平台兼容性好。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
✅ 次选(精确匹配数字后缀):
path = "/folder1/folder2/folder3/folder4/folder4[1-9]*/year=2023"
适用于子目录命名有规律(如 folder41, folder42, folder410),但注意 [1-9]* 不匹配 folder40;若需包含 0,应写为 [0-9]*。
⚠️ 注意事项:
- PySpark 默认不递归匹配子目录,因此 year=2023 后*无需加 `/**(除非该目录下还存在子文件夹);CSV 文件应直接位于year=2023/目录下。若文件在更深层级(如year=2023/part-00000.csv`),路径仍有效。
- 若 CSV 无表头,务必显式设置 .option("header", "false");若需自动推断 Schema,启用 .option("inferSchema", "true")(生产环境建议预先定义 Schema 以提升性能和稳定性)。
- 路径中的斜杠 / 必须与底层文件系统(本地、HDFS、S3 等)一致;访问云存储时,需确保 Spark 已正确配置对应文件系统驱动(如 s3a://bucket/path/)。
- 通配符仅支持 *, ?, [...],不支持正则表达式语法(如 .*, \d+),切勿混淆。
总结:善用 PySpark 的路径通配符是处理分区数据的关键技巧。它让代码更简洁、执行更高效,并天然支持分布式并行读取——Spark 会自动将匹配到的所有文件分片调度至各 executor,无需人工干预。










