如何使用Python处理大规模CSV文件并避免内存溢出报错?

秋强小哥_2716

秋强小哥_2716

2026-07-18

355人浏览

原创

直接用pd.read_csv()加载超大csv易触发memoryerror,因pandas默认全量加载且不优化dtype和usecols;正确做法是用chunksize配合迭代、指定dtype/usecols、流式处理每块并及时释放内存。

如何使用python处理大规模csv文件并避免内存溢出报错?

直接用 pd.read_csv() 加载超大 CSV 文件,99% 的情况会触发 MemoryError —— 不是因为你机器内存小,而是 pandas 默认行为本身就在制造内存浪费。

chunksize 不是开关,是手动档:必须显式迭代才能真正分块

pd.read_csv(filename, chunksize=N) 返回的是 TextFileReader 对象,它只是一个可迭代器,不是 DataFrame。很多人写了这行就以为“已经分块了”,结果后续代码没触发读取,或者误调 .shape 报错,甚至漏掉第一块数据。

  • 错误写法:reader = pd.read_csv('x.csv', chunksize=5000); print(reader.head()) → AttributeError
  • 正确写法:for chunk in pd.read_csv('x.csv', chunksize=5000): process(chunk)
  • 想预览又不破坏迭代?first_chunk = next(pd.read_csv('x.csv', chunksize=5000)),之后再用新迭代器循环
  • 别把 TextFileReader 存变量后反复用 —— 它是一次性消耗品,用完即失效

dtype 和 usecols 不是优化项,是内存底线

不指定 dtype,pandas 会把整数列推成 int64、字符串列全塞进 object 类型;不加 usecols,300 列日志里你只用 3 列,却仍加载全部。这两点加起来能让单块内存翻 2–4 倍。

python-script-generator
python-script-generator

快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。

下载
  • 常见降内存组合:dtype={'user_id': 'category', 'score': 'float32', 'status': 'uint8'}
  • 高基数字符串列(如 user_agent)慎用 category,优先试 string 或 pyarrow 引擎
  • usecols=['id', 'ts', 'event'] 能直接砍掉 80%+ 的列加载开销
  • 含空值的整数列,不指定 dtype 就会被强制升格为 float64,单列内存翻倍

别攒 chunk,处理完立刻丢引用

用 list.append(chunk) 或 pd.concat(all_chunks) 累积所有块,等于在内存里重建原始文件 —— 第 3–5 块后必爆。真正的流式处理,是每个 chunk 都闭环:过滤 → 计算 → 写磁盘/数据库,不保留中间 DataFrame。

  • 写 CSV:chunk.to_csv('out.csv', mode='a', header=first_write),首次 header=True,后续 mode='a'
  • 写数据库:chunk.to_sql('table', con, if_exists='append', index=False),确保 con 是带连接池的 SQLAlchemy 引擎
  • 聚合统计?每块只存标量:sums.append(chunk['val'].sum()),而不是存整个 chunk
  • 大文件下建议加 del chunk 和 gc.collect(),尤其当 chunk 含长文本或大量重复字符串时

chunksize 值不能拍脑袋,得按实际内存反推

chunksize=10000 在别人机器上跑得动,在你这儿可能单块就占 2GB —— 因为你的 CSV 有 200 字符的描述字段、或上万种城市名。真正靠谱的做法是先测再设。

  • 先试读:df_sample = pd.read_csv('x.csv', nrows=5000)
  • 算内存:df_sample.memory_usage(deep=True).sum() / 1024**2(单位 MB)
  • 若占 120MB,目标单块内存 ≤ 500MB,则合理 chunksize ≈ (500 / 120) * 5000 ≈ 20000
  • chunksize 太小(如 100)会导致 I/O 和解析开销暴涨,CPU 100% 卡住;太大则失去分块意义

最易被忽略的一点:跨块逻辑没法自动做。比如全文件 groupby 或 merge,pandas 分块后默认只在当前 chunk 内运算。真要全局聚合,得自己维护状态(如累计 sum 和 count),或提前收集所有唯一键再分批处理——这时候,dask 或 polars 往往比硬改 pandas 更省事。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1651

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4104

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1649

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

23717

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2907

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2947

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1143

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2283

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程