Pandas怎么去重_drop_duplicates(subset, keep)删除重复数据行

夜伟大大_3858

夜伟大大_3858

2026-04-05

1031人浏览

原创

drop_duplicates() 默认保留第一次出现的行,按原始顺序从上往下扫描并删除后续重复行;keep='last'保留最后一次出现的行,keep=false则删除所有重复行。

pandas怎么去重_drop_duplicates(subset, keep)删除重复数据行

drop_duplicates() 默认行为到底删哪一行

不指定 keep 参数时,drop_duplicates() 会保留**第一次出现的行**,把后面所有重复的都删掉。这不是“留最新”也不是“留最后”,就是按原始顺序从上往下扫,遇到重复就扔后面的。

常见错误现象:df.drop_duplicates(subset=['user_id']) 后发现用户最新一条记录没了——因为数据是按时间倒序排的,第一条反而是最老的记录。

  • 想留最新(比如按时间排序后最后一版),先用 sort_values() 把关键列(如 'updated_at')升序或降序排好,再调 drop_duplicates()
  • keep='first' 和默认行为一样;keep='last' 留最后一次出现的;keep=False 则把所有重复行全删光(一个都不留)
  • 如果 subset 指定多列,比如 ['user_id', 'product_id'],那只有这两列值完全一致才算重复

subset 里混了 NaN 怎么办

NaN 在 pandas 里不等于自己,所以 drop_duplicates(subset=['col_a']) 遇到多个 NaN 时,默认会把它们全当成“不同值”,结果就是这些带 NaN 的行全被保留下来——看起来像没去重。

使用场景:清洗用户表,'phone' 列大量为空,你本意是“手机号相同的只留一条”,但空值全留下来了,数量没变。

  • 加参数 keep='first' 不解决 NaN 比较问题,得先处理缺失值
  • 稳妥做法是提前填充或标记:比如 df['phone'].fillna('MISSING') 再去重
  • 或者用 df.drop_duplicates(subset=['col_a'], ignore_index=True) 并不管 NaN,但逻辑已偏离原意——别依赖这个“绕过”

性能差?可能是 subset 列没建索引或类型太杂

drop_duplicates() 内部靠哈希比对,列数据类型和是否含 object 类型影响很大。比如 subset=['user_name'] 是字符串列,且长度差异大、内容随机,哈希开销就高;而 ['user_id'] 是 int64,快得多。

参数差异:subset 越长、越宽(尤其含长文本、嵌套 dict/list),内存占用和耗时增长越明显。

  • 确认 subset 列的数据类型:用 df.dtypes 看,把能转成 category 或 int 的先转了
  • 避免用 subset=['col_a', 'col_b', 'col_c', ...] 拉太多列,只放真正决定“重复”的最小字段集
  • 大数据量(千万行以上)时,考虑先 df.sort_values(subset).drop_duplicates(subset, keep='last'),有时比直接去重更快(利用排序局部性)

inplace=True 是不是更省内存

不是。pandas 0.25+ 版本起,inplace=True 已被标记为弃用,且它并不真正节省内存——底层仍是生成新对象再赋值,只是语法上省了个 =。

容易踩的坑:写 df.drop_duplicates(inplace=True) 后接着链式调用,比如 .reset_index(),会报错,因为返回的是 None。

  • 统一用 df = df.drop_duplicates(...),语义清晰,调试也方便
  • 如果真卡内存,优先检查 subset 是否合理、数据类型是否可压缩,而不是迷信 inplace
  • 注意 drop_duplicates() 返回的是视图还是副本?答案是:总是新 DataFrame(除非空操作),原 df 不变

最常被忽略的一点:去重逻辑是否该由 pandas 承担?比如业务上“相同 user_id + 相同 order_time 视为同一单”,但时间字段带毫秒、数据库写入有延迟,直接按原值去重可能漏掉本该合并的行——这时候得先做时间对齐(如截断到秒级),再 drop_duplicates。

keep
keep

Keep是一款健身安排,无论是想减肥塑形或增肌,还是寻找健身跑步瑜伽计步等训练计划,你可以随时随地选择课程进行训练!权威教练视频教学,健身干货自由分享!有需要的小伙伴快来保存下载体验吧!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1651

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4124

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

23857

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2927

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2947

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1143

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2283

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习