
本文介绍如何使用 Pandas 对数据按 Code 分组后,识别同一组内 Date 完全相同的多条记录,并将对应行的 Same_Month 列统一设为 'Yes';仅当某 Date 在该 Code 组内出现≥2次时才标记,否则留空。
本文介绍如何使用 pandas 对数据按 `code` 分组后,识别同一组内 `date` 完全相同的多条记录,并将对应行的 `same_month` 列统一设为 `'yes'`;仅当某 `date` 在该 `code` 组内出现≥2次时才标记,否则留空。
在实际数据分析中,常需根据业务逻辑对重复模式进行标记——例如:同一产品编码(Code)下,若多个订单发生在完全相同的日期(注意:不是“同月”,而是精确到日),则标记为 'Yes'。本教程提供一种简洁、高效且可扩展的实现方式,核心在于跨分组识别全局重复项,而非逐组循环。
✅ 正确解法:利用 duplicated(..., keep=False)
关键在于理解:我们需要的是「在相同 Code 下,Date 值出现不止一次的所有行」,这等价于对 ['Code', 'Date'] 两列联合去重判断。Pandas 的 duplicated() 方法配合 keep=False 参数,能一次性返回所有重复行的布尔索引,完美契合需求。
以下是完整可运行代码:
import pandas as pd
# 构建示例数据
df = pd.DataFrame([
[1,'2023-01-02 00:00:00','01','2023',''],
[2,'2023-01-02 00:00:00','01','2023',''],
[3,'01/16/2023','01','2023',''],
[4,'01/17/2023','01','2023',''],
[5,'01/16/2023','01','2023',''],
[6,'02/13/2023','02','2023',''],
[7,'02/13/2023','02','2023',''],
[8,'02/13/2023','02','2023',''],
[9,'26/11/2018','11','2018',''],
[10,'26/11/2018','11','2018',''],
[11,'26/11/2018','11','2018',''],
[12,'26/11/2018','11','2018',''],
[13,'05/11/2018','11','2018',''],
[14,'09/11/2018','11','2018',''],
], columns=['Number','Date','Code','year','Same_Month'])
# 步骤1:统一日期格式(关键!避免解析歧义)
df['Date'] = pd.to_datetime(df['Date'], format='mixed') # Pandas 2.0+ 推荐;旧版本可用 infer_datetime_format=True
# 步骤2:标记所有在相同 Code + 相同 Date 组合下出现≥2次的行
duplicates = df.duplicated(subset=['Code', 'Date'], keep=False)
# 步骤3:批量赋值
df.loc[duplicates, 'Same_Month'] = 'Yes'
# 查看结果(仅展示关键列)
print(df[['Number', 'Date', 'Code', 'year', 'Same_Month']])
? 输出说明:第 4 行(01/17/2023)、第 13–14 行(05/11/2018, 09/11/2018)因各自 Date 在对应 Code 组内唯一,Same_Month 保持为空字符串;其余重复日期组合均被准确标记为 'Yes'。
⚠️ 注意事项与最佳实践
- 日期标准化是前提:原始数据中混用 YYYY-MM-DD、MM/DD/YYYY、DD/MM/YYYY 等格式,必须先转为 datetime64[ns] 类型。format='mixed' 可自动适配多数常见格式;若存在明确歧义(如 05/11/2018 可能被误读为 May 11 或 Nov 5),建议显式指定 dayfirst=True 或预清洗。
- 勿用 groupby().apply() 循环:虽然逻辑直观,但性能差且易出错(如 apply 返回 Series 长度不匹配)。duplicated() 是向量化操作,效率高、代码简、语义清晰。
- 空值处理:若 Date 或 Code 存在缺失值(NaN),duplicated() 默认将 NaN 视为相等,可能产生非预期标记。如有需要,可先执行 df.dropna(subset=['Code','Date']) 或使用 df.fillna() 预处理。
- 扩展性提示:若后续需支持“同月不同日也标记”,只需将 Date 替换为 Date.dt.to_period('M') 后再参与 duplicated 判断。
通过这一方法,你不仅能精准解决当前问题,还能掌握 Pandas 中“跨维度重复识别”的通用范式——它同样适用于标记同一客户多次下单、同一设备重复告警等典型场景。










