直接用pd.read_csv()加载超大csv易触发memoryerror,因pandas默认全量加载且不优化dtype和usecols;正确做法是用chunksize配合迭代、指定dtype/usecols、流式处理每块并及时释放内存。

直接用 pd.read_csv() 加载超大 CSV 文件,99% 的情况会触发 MemoryError —— 不是因为你机器内存小,而是 pandas 默认行为本身就在制造内存浪费。
chunksize 不是开关,是手动档:必须显式迭代才能真正分块
pd.read_csv(filename, chunksize=N) 返回的是 TextFileReader 对象,它只是一个可迭代器,不是 DataFrame。很多人写了这行就以为“已经分块了”,结果后续代码没触发读取,或者误调 .shape 报错,甚至漏掉第一块数据。
- 错误写法:
reader = pd.read_csv('x.csv', chunksize=5000); print(reader.head())→AttributeError - 正确写法:
for chunk in pd.read_csv('x.csv', chunksize=5000): process(chunk) - 想预览又不破坏迭代?
first_chunk = next(pd.read_csv('x.csv', chunksize=5000)),之后再用新迭代器循环 - 别把
TextFileReader存变量后反复用 —— 它是一次性消耗品,用完即失效
dtype 和 usecols 不是优化项,是内存底线
不指定 dtype,pandas 会把整数列推成 int64、字符串列全塞进 object 类型;不加 usecols,300 列日志里你只用 3 列,却仍加载全部。这两点加起来能让单块内存翻 2–4 倍。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
- 常见降内存组合:
dtype={'user_id': 'category', 'score': 'float32', 'status': 'uint8'} - 高基数字符串列(如
user_agent)慎用category,优先试string或pyarrow引擎 -
usecols=['id', 'ts', 'event']能直接砍掉 80%+ 的列加载开销 - 含空值的整数列,不指定
dtype就会被强制升格为float64,单列内存翻倍
别攒 chunk,处理完立刻丢引用
用 list.append(chunk) 或 pd.concat(all_chunks) 累积所有块,等于在内存里重建原始文件 —— 第 3–5 块后必爆。真正的流式处理,是每个 chunk 都闭环:过滤 → 计算 → 写磁盘/数据库,不保留中间 DataFrame。
- 写 CSV:
chunk.to_csv('out.csv', mode='a', header=first_write),首次header=True,后续mode='a' - 写数据库:
chunk.to_sql('table', con, if_exists='append', index=False),确保con是带连接池的 SQLAlchemy 引擎 - 聚合统计?每块只存标量:
sums.append(chunk['val'].sum()),而不是存整个chunk - 大文件下建议加
del chunk和gc.collect(),尤其当 chunk 含长文本或大量重复字符串时
chunksize 值不能拍脑袋,得按实际内存反推
chunksize=10000 在别人机器上跑得动,在你这儿可能单块就占 2GB —— 因为你的 CSV 有 200 字符的描述字段、或上万种城市名。真正靠谱的做法是先测再设。
- 先试读:
df_sample = pd.read_csv('x.csv', nrows=5000) - 算内存:
df_sample.memory_usage(deep=True).sum() / 1024**2(单位 MB) - 若占 120MB,目标单块内存 ≤ 500MB,则合理
chunksize ≈ (500 / 120) * 5000 ≈ 20000 - chunksize 太小(如 100)会导致 I/O 和解析开销暴涨,CPU 100% 卡住;太大则失去分块意义
最易被忽略的一点:跨块逻辑没法自动做。比如全文件 groupby 或 merge,pandas 分块后默认只在当前 chunk 内运算。真要全局聚合,得自己维护状态(如累计 sum 和 count),或提前收集所有唯一键再分批处理——这时候,dask 或 polars 往往比硬改 pandas 更省事。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










