duplicated()默认只标记后续重复行(首行为false),需keep=false标出全部;drop_duplicates()默认保留首行,可用keep='last'或keep=false调整;去重前须统一数据类型、处理空格/nan、校验精度。

用 duplicated() 找出重复行,但默认只标记后续出现的副本
直接调用 df.duplicated() 返回的是布尔 Series,True 表示该行是重复项(且不是第一次出现)。这意味着第一遍出现的行永远是 False,哪怕它后面跟着 10 个一模一样的行。如果你要标出所有重复行(包括首行),得加参数 keep=False。
- 只标记重复副本(默认):
df[df.duplicated()] - 标出全部重复行(含首次):
df[df.duplicated(keep=False)] - 按某几列判断重复:
df.duplicated(subset=['col_a', 'col_b']) - 注意:空值(
NaN)在重复判断中被视作彼此相等,这和==行为不同
用 drop_duplicates() 删除重复,但默认保留第一次出现的行
drop_duplicates() 不会原地修改 DataFrame,必须显式赋值或加 inplace=True。它默认保留每组重复中的第一条,但你可以用 keep='last' 保留最后一条,或 keep=False 全删(即只留完全不重复的行)。
- 删除重复、保留首行:
df_clean = df.drop_duplicates() - 保留末行:
df.drop_duplicates(keep='last') - 全删重复行(只留唯一行):
df.drop_duplicates(keep=False) - 指定列去重:
df.drop_duplicates(subset=['id', 'timestamp']) - 性能提示:大数据集上,
subset越窄越快;若列含大量NaN,可能影响哈希效率
检测时发现“看似重复却没被识别”,大概率是数据类型或空白字符问题
字符串前后空格、大小写不一致、数字与字符串混用(如 '1' 和 1)、时间戳精度差异(datetime64[ns] vs datetime64[s])都会导致 duplicated() 判定失败。
- 统一字符串:先
df[col].str.strip().str.lower() - 转类型:如
df['id'] = df['id'].astype(str)或pd.to_numeric(df['score'], errors='coerce') - 对齐时间:用
df['time'] = pd.to_datetime(df['time']).dt.floor('S')统一到秒级 - 检查实际值:用
df.loc[[i, j], :].values.tolist()对比两行原始内容,别只看 print 输出
一次性查删+反馈,避免误操作
别直接 drop_duplicates(inplace=True) 就完事。先确认重复数量、抽样查看,再执行删除,并保留原始行数用于验证。
- 统计重复量:
dup_count = df.duplicated().sum() - 预览重复样本:
df[df.duplicated(keep='first')].head(3) - 安全删除并验证:
df_orig_len = len(df)<br>df_clean = df.drop_duplicates()<br>print(f"删了 {df_orig_len - len(df_clean)} 行") - 如果业务要求保留最新记录,记得先按时间排序再去重:
df.sort_values('updated_at').drop_duplicates(subset='key', keep='last')
真正麻烦的不是函数调用,而是重复的定义本身——你得先说清“什么算重复”,再让代码照做。类型、空值、精度、业务逻辑,漏掉任何一环,duplicated() 和 drop_duplicates() 都只会忠实地执行你写的规则,而不是你心里想的规则。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











