怎样实现Python对千万级大数据的快速去重_基于Pandas的drop_duplicates

梦强小哥_1505

梦强小哥_1505

2026-05-02

797人浏览

原创

drop_duplicates在千万行上卡住是因为默认全字段哈希+全内存索引构建,引发哈希冲突、内存碎片及object类型逐元素比较;应先压缩dtype、裁剪列、规整字符串、转category,或改用分块+set、pyarrow、polars等高效方案。

怎样实现python对千万级大数据的快速去重_基于pandas的drop_duplicates

drop_duplicates 为什么在千万行上会卡住

直接调用 df.drop_duplicates() 处理千万级 DataFrame 时,内存暴涨、耗时几分钟甚至 OOM,根本不是函数“慢”,而是它默认走全字段哈希 + 全内存索引构建。Pandas 底层用 Python dict 做去重键,一旦行数超 500 万,哈希冲突和内存碎片就会明显拖慢速度,且无法流式处理。

常见错误现象:MemoryError、CPU 占满但进度条不动、df.drop_duplicates(subset=['id']) 比预期慢 10 倍以上。

  • 别对未设置索引的宽表(列 > 50)直接去重,列越多哈希键越长,内存开销指数上升
  • keep='last' 比 keep='first' 多一次完整扫描,千万行下差 2–3 倍时间
  • 字符串列若含空值或长文本(如 JSON 片段),drop_duplicates 会触发 object 类型的逐元素比较,彻底失去向量化优势

先用 dtype 和列裁剪压低内存水位

去重前不压缩数据类型,等于拿 8 字节 int64 存 ID、用 object 存纯数字字符串——这会让哈希表体积翻 3–5 倍。必须在 read_csv 或构造 DataFrame 阶段就控制住。

实操建议:

  • 读取时强制指定 dtype:ID 列用 pd.Int32Dtype() 或 uint32,布尔列用 boolean,避免默认 object
  • 删掉去重无关列:df = df[['id', 'email']].copy(),别留着 20 列只用其中 2 列
  • 字符串列提前规整:df['email'] = df['email'].str.strip().str.lower(),避免因空格/大小写导致本该去重的没去成
  • 对重复率高的列(如状态码、分类标签),可转为 category 类型:df['status'] = df['status'].astype('category')

分块读取 + set 增量去重更稳

当内存确实扛不住单次加载(比如机器只有 16GB RAM,数据占 12GB+),硬靠 Pandas 内存去重就是死路。这时应放弃“一个 DataFrame 走到底”的思路,改用文件流式 + Python 原生 set 记录已见 key。

核心逻辑:按固定 chunksize 读 CSV → 提取去重字段元组 → 判重并写入新文件 → 跳过重复行。

seen = set()
with open('output.csv', 'w') as fout:
    for chunk in pd.read_csv('input.csv', chunksize=50000):
        for _, row in chunk.iterrows():
            key = (row['id'], row['email'])  # 注意类型一致,None 会报错
            if key not in seen:
                seen.add(key)
                fout.write(','.join(map(str, row)) + '\n')

注意点:

Python Testing
Python Testing

Python 测试速查:运行 pytest、使用 mock/patch、参数化、fixtures、异步、覆盖率测试。

下载
  • key 必须是不可变类型,list 不行,tuple 才行;含 NaN 的字段要先 fillna('NULL')
  • seen 集合最终会吃掉约 1.5× 去重后 key 的内存(Python set 有负载因子),千万级唯一 key 约占 500MB+
  • 不要用 chunk.drop_duplicates() 后拼接——块间重复仍存在,得全局判重

真要强依赖 Pandas,就换 backend:PyArrow + Polars

如果业务强绑定 Pandas API(比如后续链路全是 .groupby、.merge),又卡在 drop_duplicates,可以临时切 backend:用 PyArrow 表做去重,再转回 Pandas。

原因:PyArrow 的 distinct() 是 C++ 实现,支持零拷贝哈希,千万行去重通常在 10 秒内完成,且内存峰值比 Pandas 低 40%+。

import pyarrow as pa
import pyarrow.compute as pc
<p>table = pa.Table.from_pandas(df)</p><h1>只对 id 和 email 去重,保持原始顺序(keep='first')</h1><p>unique_table = table.group_by(['id', 'email']).first()
df_unique = unique_table.to_pandas()
</p>

或者一步到位用 Polars(语法更接近 Pandas):

import polars as pl
df_pl = pl.from_pandas(df)
df_unique = df_pl.unique(subset=['id', 'email'], keep='first').to_pandas()

注意:

  • PyArrow group_by(...).first() 默认不保序,如需严格等价 keep='first',得加 maintain_order=True(Polars 默认保序)
  • Polars 对字符串去重比 Pandas 快 3–5 倍,但对混合类型列(如 string + list)支持弱,得先 flatten
  • 别在 Pandas DataFrame 上直接调 .to_arrow() 再操作——序列化开销大,应从源头读取时就用 pa.csv.read_csv()

实际去重最耗神的往往不是算法本身,而是你没意识到哪些列真正参与判重、哪些空值正在悄悄破坏哈希一致性、以及内存是否真的被 dtype 和冗余列无声吃掉。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1631

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3964

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1629

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

22777

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2787

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2847

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1123

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2203

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程