gzip.open(..., "wt")可直接配合csv.writer逐行写入压缩csv,避免oom;需用with管理文件、compresslevel=6平衡性能,注意数据编码与csv语法合法性。

gzip.open() 适合流式压缩但必须配文本模式
直接用 gzip.open() 写 CSV 不会报错,但默认二进制模式下 csv.writer 会抛 TypeError: a bytes-like object is required, not 'str'。关键不是换模块,而是开对模式:gzip.open(..., "wt")(注意 t)才能传字符串。
-
"wt"模式自动处理编码(默认 utf-8),csv.writer可直写 - 避免用
"wb"+io.TextIOWrapper套娃,易出编码或换行符问题 - 大文件场景下,不建议先生成完整字符串再压缩——内存爆掉
逐行写入比一次性读完更安全
超大 CSV 往往来自数据库游标、API 分页或文件迭代器,别用 pandas.read_csv().to_csv() 全载入内存。真实压测中,10GB 原始 CSV 在 4GB 内存机器上,逐行处理耗时略增但不会 OOM。
- 用
csv.writer配合gzip.open(..., "wt")直接写入,每行即压即刷 - 显式调用
writer.writerow(),别依赖writer.writerows()传巨量列表 - 若源数据是字典,用
csv.DictWriter,字段名需提前声明,否则首行可能漏列
压缩级别和缓冲区影响 I/O 效率
默认 compresslevel=9 是最慢最省空间的,对百 GB 级 CSV 来说,实际收益常不到 5%,但 CPU 占用翻倍。多数场景用 compresslevel=6 是性价比拐点。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
- 设置
buffering=8192(或更大)可减少系统调用次数,尤其在机械硬盘上明显 - 不要设
buffering=1(行缓冲)——gzip 压缩本质是块操作,行缓冲无意义还拖慢 - 若后续要分片传输,考虑加
mtime=0让每次压缩结果确定(避免时间戳导致 hash 不同)
错误:gzip 文件损坏或无法被其他工具解压
常见于未正确关闭文件句柄,或异常中断后残留半截 gzip 流。Linux gunzip -t 会直接报 unexpected end of file。
- 务必用
with语句管理gzip.open(),确保close()被调用 - 避免在循环中反复打开/关闭同一文件——gzip 头尾元数据会重复写入,解压失败
- 如果必须中途退出,手动调用
fileobj.flush()后再close(),但不如with可靠
真正卡住的往往不是压缩逻辑,而是原始数据里混了没转义的换行符、双引号,或者编码不一致——gzip 只管字节流,不管 CSV 语法是否合法。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










