
本文介绍如何在 pandas 中对分组数据进行“跨行填充 + 保序去重”,在确保字段一致性(如 col2 的 b/c 组合不被拆散)的前提下,为每个用户生成所有合法的非冲突行组合。
本文介绍如何在 pandas 中对分组数据进行“跨行填充 + 保序去重”,在确保字段一致性(如 col2 的 b/c 组合不被拆散)的前提下,为每个用户生成所有合法的非冲突行组合。
在实际数据清洗中,常遇到类似场景:同一用户的数据分散在多行,每行仅填充部分字段(如 col1, col2, col3 各有缺失),且某些列存在多个互斥值(如用户 b 在 col2 中同时有 'B' 和 'D')。目标不是简单地用 first() 或 ffill() 合并成单行,而是生成所有语义一致的完整行组合——即保持原始值配对关系(如 'B' 与 'C' 原本同属一行,就应保留在同一输出行中),同时填充缺失值、去除冗余重复。
核心思路分三步:
- 按 user 分组后,对每列独立处理:标记并屏蔽重复值(x.mask(x.duplicated())),避免将不同含义的值错误覆盖;
- 排序时将非空值前置、空值后置(sort_values(key=pd.isna)),再前向填充(ffill()),确保每个字段的“主值”能传播到该用户所有行;
- 全局去重(drop_duplicates()),消除因填充产生的完全重复行。
以下是完整实现代码:
import pandas as pd
import numpy as np
# 构造示例数据(注意:原始数据中空字符串需转为 NaN)
df = pd.DataFrame({
'user': ['a', 'a', 'a', 'b', 'b', 'b'],
'col1': ['X', np.nan, np.nan, 'A', np.nan, np.nan],
'col2': [np.nan, 'Y', np.nan, np.nan, 'B', 'D'],
'col3': [np.nan, np.nan, '6', np.nan, 'C', np.nan]
})
# 关键处理链式操作
out = (df.set_index('user')
.groupby('user')
.transform(lambda x: x.mask(x.duplicated()).sort_values(key=pd.isna).ffill())
.reset_index()
.drop_duplicates(ignore_index=True)
)
print(out)
输出结果:
user col1 col2 col3 0 a X Y 6 1 b A B C 2 b A D C
✅ 效果说明:
- 用户 a 的三行被合并为唯一一行:col1='X'(首行)、col2='Y'(次行)、col3='6'(末行),全部填充完成;
- 用户 b 生成两行:第一行继承 col2='B' 与 col3='C' 的原始配对,col1='A' 全局填充;第二行保留 col2='D'(因与 'B' 不重复而未被屏蔽),col3 仍为 'C'(因 'C' 未在该列重复出现,且排序后位于 'D' 前,故 ffill 使其延续)。
⚠️ 注意事项:
- 若某列中存在多个非空值且不应相互覆盖(如 col3 对用户 b 实际应为 'C' 和 np.nan,而非强制统一为 'C'),则需移除 .ffill(),改用 dropna(how='all') 清理全空行(见答案中的 EDIT 部分);
- 确保输入数据中空字符串已转为 np.nan(可用 df.replace('', np.nan) 预处理);
- transform 保证输出形状与原 DataFrame 一致,是实现“分组内逐列对齐填充”的关键;
- 此方法天然保持原始行内字段关联性,无需手动枚举组合,适用于任意多列、多值场景。
该方案兼顾准确性与可扩展性,是处理稀疏分组数据的标准范式之一。










