
本文介绍如何对 dataframe 中某字符串列(以逗号分隔)逐行解析为集合,计算任意两行间的元素交集大小,进而找出每行与其他所有行的最大匹配数及对应行 id 列表。
本文介绍如何对 dataframe 中某字符串列(以逗号分隔)逐行解析为集合,计算任意两行间的元素交集大小,进而找出每行与其他所有行的最大匹配数及对应行 id 列表。
在实际数据处理中,常需评估文本型字段(如标签、类别组合、关键词列表)的相似性。本教程以 Col1 列为例——其值为逗号分隔的字符串(如 'AA,AC,BC,DE'),目标是:对每一行,将其拆分为唯一元素集合,与其余所有行做集合交集,统计交集元素个数;最终为每行输出两个关键指标:
- max_matching#:该行与其他所有行交集大小的最大值(若无匹配则为 0);
- Rowid:所有达到该最大交集数的其他行的 rowid,以英文逗号拼接(如 '2,4')。
以下为完整实现步骤(基于 pandas 和 scipy):
✅ 步骤 1:预处理字符串为集合
import pandas as pd
from scipy.spatial.distance import pdist, squareform
data = [[1, 'AA,AC,BC,DE'], [2, 'AA,AD,BC,D'], [3, 'A,C,BC,E'], [4, 'AA,AC,BC,DEEE'], [5, 'KK']]
df = pd.DataFrame(data, columns=['rowid', 'Col1'])
# 将每行 Col1 拆分为 set,去除重复和空格(如有)
s = df['Col1'].apply(lambda x: set(x.split(',')))
⚠️ 注意:若原始字符串含空格(如 'AA, AC, BC'),建议改用 set(x.replace(' ', '').split(',')) 避免因空格导致匹配失败。
✅ 步骤 2:定义交集距离函数并计算全配对矩阵
def compare(a, b):
return len(a[0] & b[0]) # a[0], b[0] 分别是两行对应的 set
# 构建对称交集计数矩阵(行/列索引均为 rowid)
dist_matrix = pd.DataFrame(
squareform(pdist(s.to_frame(), compare)),
index=df['rowid'],
columns=df['rowid'].rename('Rowid')
)
该矩阵的 (i, j) 元素表示第 i 行与第 j 行的共同元素数量(对角线为 0,因不与自身比较)。
✅ 步骤 3:筛选非自匹配、非零交集,并聚合结果
# 展平矩阵 → 过滤掉 self-comparison (rowid == Rowid) 和零匹配
matches = (dist_matrix
.stack()
.reset_index(name='count')
.query('(rowid != Rowid) & (count > 0)'))
# 对每行 groupby,取最大交集数,并收集所有对应 Rowid
result = (matches
.groupby('rowid', as_index=False)
.agg({
'count': 'max',
'Rowid': lambda x: ','.join(x.astype(str))
})
.rename(columns={'count': 'max_matching#'}))
# 与原 df 左连接,补全无匹配的行(max_matching#=0, Rowid=NaN)
out = df.merge(result, on='rowid', how='left')
out['max_matching#'] = out['max_matching#'].fillna(0).astype(int)
out['Rowid'] = out['Rowid'].fillna('NA')
✅ 最终输出示例
| rowid | Col1 | max_matching# | Rowid |
|---|---|---|---|
| 1 | AA,AC,BC,DE | 3 | 4 |
| 2 | AA,AD,BC,D | 2 | 1,4 |
| 3 | A,C,BC,E | 1 | 1,2,4 |
| 4 | AA,AC,BC,DEEE | 3 | 1 |
| 5 | KK | 0 | NA |
? 说明:第 1 行 'AA,AC,BC,DE' 与第 4 行 'AA,AC,BC,DEEE' 有 {'AA','AC','BC'} 3 个共同元素(注意 'DE' 与 'DEEE' 不等价),故 max_matching# = 3,且仅第 4 行达到该值,因此 Rowid = '4'。
? 扩展提示
- 若需保留所有达到最大匹配数的行 ID(而非仅部分),请确保注释掉 .loc[...] 行(原答案中已标注);
- 时间复杂度为 O(n²),适用于中小规模数据(n );超大规模建议改用 MinHash 或 Faiss 加速近似检索;
- 可进一步封装为函数,支持自定义分隔符、忽略大小写(.str.upper())、或启用模糊匹配(如 rapidfuzz)。
通过本方法,你可在结构化数据中快速实现基于集合相似度的“最近邻”行识别,为去重、推荐、异常检测等场景提供可靠基础。










