
本文介绍如何使用 Pandas 对数据按 Code 分组后,识别同一组内 Date 完全相同的行,并将对应 Same_Month 列统一设为 'Yes',其余保持空白——适用于清洗多源异构日期格式下的重复业务事件。
本文介绍如何使用 pandas 对数据按 `code` 分组后,识别同一组内 `date` 完全相同的行,并将对应 `same_month` 列统一设为 `'yes'`,其余保持空白——适用于清洗多源异构日期格式下的重复业务事件。
在实际数据分析中,常需标记具有相同业务编码(如 Code)且发生时间(Date)完全一致的记录,例如识别同一产品代码下同一天发生的多笔订单、同一工单号的重复提交等。本教程以一个典型场景为例:对 DataFrame 按 Code 分组,若组内存在两个或以上完全相同的 Date 值,则将这些行的 'Same_Month' 字段统一更新为 'Yes';否则保留原值(空字符串)。
关键在于:不是判断“是否在同一月份”,而是判断“是否在完全相同的日期(年-月-日)”,且该判断必须在 Code 组内进行——即仅当 Code 相同 且 Date 相同时才触发标记。这不同于简单的全局去重或按月截取,需精准控制分组粒度与时间精度。
✅ 正确实现步骤
- 统一日期格式:原始数据中 Date 列混用 YYYY-MM-DD HH:MM:SS、MM/DD/YYYY 和 DD/MM/YYYY 等格式,直接比较会导致错误。应先使用 pd.to_datetime(..., format='mixed') 自动解析(Pandas 2.0+ 支持),确保所有日期转为标准 datetime64[ns] 类型:
df['Date'] = pd.to_datetime(df['Date'], format='mixed')
⚠️ 注意:若数据中存在无法解析的异常日期(如 '2023-02-30'),可添加 errors='coerce' 参数将错误值转为 NaT,避免中断。
- 识别组内重复日期:使用 duplicated(subset=['Code', 'Date'], keep=False) 标记所有在 Code 和 Date 联合维度上出现 ≥2 次的行(keep=False 保证所有重复项均被标记为 True):
duplicates = df.duplicated(['Code', 'Date'], keep=False)
此步逻辑等价于“按 Code 分组后,在每组内检查 Date 是否有重复”,但无需显式 groupby().apply(),性能更优、代码更简洁。
- 批量赋值:利用布尔索引,仅对满足重复条件的行更新 Same_Month:
df.loc[duplicates, 'Same_Month'] = 'Yes'
最终结果中,只有 Number 为 1/2(同为 01/02/2023)、3/5(同为 01/16/2023)、6/7/8(同为 02/13/2023)、9/10/11/12(同为 26/11/2018)的记录被标记为 'Yes';而 Number=4(唯一 01/17/2023)、13(唯一 05/11/2018)、14(唯一 09/11/2018)因无同码同日伙伴,Same_Month 保持为空。
? 验证与扩展建议
- 验证逻辑:可通过 df.groupby(['Code', 'Date']).size().reset_index(name='count') 查看各 (Code, Date) 组的实际频次,确认标记覆盖完整性。
- 区分大小写/空格:若 Code 列含首尾空格或大小写不一致,建议预处理:df['Code'] = df['Code'].str.strip()。
- 扩展语义:如需标记“同月”(非同日),可改用 df['Date'].dt.to_period('M') 提取年月周期后再做 duplicated 判断。
- 性能提示:对千万级数据,duplicated() 比 groupby().transform('size') > 1 更高效,推荐优先使用。
该方法简洁、健壮、可读性强,是 Pandas 中实现“组内精确重复标记”的标准实践。










