Dask 中高效合并多个 ZIP 文件内同名 CSV 的完整实践指南

冬静大大_6077

冬静大大_6077

2026-03-29

200人浏览

原创

本文详解如何使用 Dask 与 fsspec 正确读取并拼接多个 ZIP 文件中同名 CSV(如所有 a.csv),解决通配符跨 ZIP 失效问题,并提供可复用的自动化方案。

本文详解如何使用 dask 与 fsspec 正确读取并拼接多个 zip 文件中同名 csv(如所有 `a.csv`),解决通配符跨 zip 失效问题,并提供可复用的自动化方案。

在使用 Dask 处理大规模结构化数据时,一个常见但易被忽视的挑战是:fsspec 的 glob 机制不支持跨多个 ZIP 文件进行通配匹配。例如,你期望 zip://a.csv::foo*.zip 能自动遍历 foo1.zip、foo2.zip、foo3.zip 并分别提取其中的 a.csv 后拼接——但实际仅返回首个 ZIP 中的文件。这是因为 fsspec 将每个 ZIP 视为独立的“子文件系统”,其通配逻辑(*)仅作用于 ZIP 内部路径,而非 ZIP 文件名本身;而 Dask 的 dd.read_csv() 在单次调用中也只绑定一个底层文件系统实例,无法动态切换 ZIP 源。

因此,必须采用显式构造多路径 + 手动拼接的策略。以下是推荐的生产级实现:

✅ 正确做法:显式生成 ZIP 内路径列表 + 并行读取 + 拼接

import dask.dataframe as dd
import glob
import os

# 步骤 1:获取所有匹配的 ZIP 文件路径(支持通配)
zip_files = sorted(glob.glob("foo*.zip"))  # 如 ['foo1.zip', 'foo2.zip', 'foo3.zip']

# 步骤 2:为指定 CSV 文件名(如 'a.csv')构建完整的 fsspec URL 列表
csv_name = "a.csv"
file_urls = [f"zip://{csv_name}::{os.path.abspath(zf)}" for zf in zip_files]

# 步骤 3:并行读取每个 ZIP 中的 CSV(Dask 自动处理延迟计算)
dfs = [
    dd.read_csv(
        url,
        delimiter=";",
        header=0,
        index_col=False,
        assume_missing=True,  # 建议启用,兼容列缺失场景
        blocksize=None       # 对小 CSV 可设 None;大文件建议指定(如 "64MB")
    )
    for url in file_urls
]

# 步骤 4:沿行方向拼接(保持分区逻辑,避免立即 compute)
ddf = dd.concat(dfs, interleave_partitions=False, ignore_index=True)

# ✅ 最终计算(仅在此刻触发实际 I/O 和计算)
result = ddf.compute()
print(f"成功合并 {len(zip_files)} 个 ZIP 中的 '{csv_name}',总计 {len(result)} 行")

⚠️ 关键注意事项

  • 路径必须绝对化:os.path.abspath(zf) 避免相对路径导致 fsspec 解析失败(尤其在非工作目录运行时);
  • 不要提前 .compute():对每个 dd.read_csv() 单独调用 .compute() 会丧失 Dask 的延迟执行优势,大幅降低性能;
  • interleave_partitions=False 是关键参数:确保 dd.concat 不尝试重排分区,仅做简单垂直拼接,避免冗余 shuffle;
  • 内存与性能权衡:若 ZIP 数量极大(如数百个),建议分批处理或使用 dask.delayed 控制并发粒度;
  • 错误容错增强(可选):可在列表推导中加入 try/except 包裹 dd.read_csv,跳过损坏 ZIP 或缺失 CSV 的文件。

? 扩展:批量处理多个 CSV 名称(a.csv, b.csv, c.csv)

for csv_name in ["a.csv", "b.csv", "c.csv"]:
    file_urls = [f"zip://{csv_name}::{os.path.abspath(zf)}" for zf in zip_files]
    dfs = [dd.read_csv(url, delimiter=";", header=0, index_col=False) for url in file_urls]
    ddf = dd.concat(dfs, ignore_index=True)
    # 保存中间结果或直接参与后续 merge
    ddf.to_parquet(f"merged_{csv_name.replace('.csv', '')}.parquet", write_index=False)

该方案完全规避了 fsspec 的 glob 限制,充分利用 Dask 的惰性计算与并行 I/O 能力,是处理跨 ZIP 同名文件合并任务的稳健范式。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1691

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4304

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1689

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

25077

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3067

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3087

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2383

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习