chunksize参数通过分块读取避免oom,返回textfilereader迭代器,推荐起点chunksize=10000,需配合ignore_index=true合并、避免循环concat,并注意编码、bom及末块行数不足问题。

用 pandas.read_csv() 的 chunksize 参数流式读取
直接 pd.read_csv('huge.csv') 会把整个文件加载进内存,超千万行就大概率触发 OOM。改用 chunksize 是最常用且有效的破局方式——它返回一个可迭代的 TextFileReader 对象,每次只载入指定行数。
实操建议:
-
chunksize=10000是较稳妥的起点,可根据你机器内存(如 16GB)和单行平均字节数微调;行宽越大,chunk 越小 - 别在循环里反复拼接
pd.concat([chunk for chunk in reader]),这又会回到内存爆炸的老路 - 优先对每个
chunk做过滤、聚合或写入新文件,例如:for chunk in pd.read_csv('data.csv', chunksize=5000): filtered = chunk[chunk['value'] > 100] filtered.to_csv('output.csv', mode='a', header=False, index=False) - 注意:
chunksize不保证每块严格等于该行数(末尾块可能更少),也不影响列类型推断——若某列前几万行全是数字,后面突然出现字符串,仍可能报ValueError
用 csv 模块手动逐行解析,彻底绕过 pandas 开销
当只需要提取几列、做简单条件计数或清洗,且数据格式规整(无嵌套引号、换行符等),原生 csv 模块比 pandas 轻量十倍以上,内存占用常稳定在几 MB 级。
实操建议:
- 用
csv.DictReader按字段名访问,比csv.reader更安全(避免列序错位) - 所有字符串处理尽量用内置方法(
.strip(),.split()),避免引入正则或 pandas 函数 - 示例:统计某列非空值数量
count = 0 with open('huge.csv') as f: reader = csv.DictReader(f) for row in reader: if row.get('status') not in (None, '', 'N/A'): count += 1 - 遇到含双引号、逗号的字段时,
csv模块能自动处理,但若文件编码不是 UTF-8(比如 GBK),必须显式传encoding='gbk',否则抛UnicodeDecodeError
用 dask.dataframe 替代 pandas,实现“懒计算”
当你仍想用类似 pandas 的 API(如 .groupby(), .merge()),又不愿拆逻辑写 chunk 循环,dask.dataframe 是折中选择。它不立刻执行,只建计算图,最后 .compute() 才真正跑。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
实操建议:
- 安装后直接
import dask.dataframe as dd,读取接口几乎一致:df = dd.read_csv('huge.csv') - 所有中间操作(
df[df.x > 0].y.mean())都不耗内存,只有调.compute()时才触发实际计算并返回 pandas 对象 - 注意分区(partition)大小:
blocksize='64MB'可控,默认可能过大;太小则调度开销上升 - 不支持全部 pandas 方法(如
.pivot_table()某些参数),报NotImplementedError时得退回 chunk 或原生 csv 方案
预处理阶段就砍掉无效列和行,减少后续负载
很多 OOM 其实源于读了根本不用的列(比如日志 CSV 里的完整 JSON 字段)或历史归档行(status == 'deleted')。与其让 pandas 吃进去再吐出来,不如前置过滤。
实操建议:
- 用
awk或sed在 shell 层先筛列:awk -F',' '{print $1,$3,$5}' huge.csv > slim.csv(Linux/macOS;Windows 可用 WSL 或 Python 脚本替代) - 用
grep -v快速剔除固定模式的脏行(如含'ERROR'的日志行) - 如果原始文件是压缩的(
.csv.gz),pandas.read_csv()和csv模块都支持直接读,无需解压——省磁盘空间也省 IO 时间 - 别忽略 BOM 头:Windows 生成的 UTF-8 CSV 常带
\ufeff,会导致第一列名异常(如'id'),用encoding='utf-8-sig'可自动剥离
真正卡住人的往往不是“怎么读”,而是“读完立刻想用 pandas 做复杂变换”。chunksize 和 dask 都要求你重新思考计算路径——聚合类操作尽量在 chunk 内完成,跨块逻辑(如全局 top-k)需要额外合并步骤。这点容易被忽略,直到跑出一半才发现结果不对。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










