
本文介绍如何高效地为 pandas dataframe 添加新列,该列根据某字段(如 name)在多个预定义列表中的归属关系,自动赋值对应的层级编号(如 tier 1、tier 2),适用于中等规模数据(数百行)与多组分类列表场景。
本文介绍如何高效地为 pandas dataframe 添加新列,该列根据某字段(如 name)在多个预定义列表中的归属关系,自动赋值对应的层级编号(如 tier 1、tier 2),适用于中等规模数据(数百行)与多组分类列表场景。
在实际数据分析中,常需将原始数据按业务规则划分为若干逻辑层级(例如 VIP 等级、用户分群、资质分级等),而这些层级往往以多个独立列表形式预先定义。例如,tier1 = ['Tom', 'Patrick'] 和 tier2 = ['Lamar'] 表示不同层级的成员名单。目标是:对 DataFrame 中的 'name' 列逐行判断其所属层级,并将层级编号(而非列表本身)写入新列 'tier'。
最直观的思路是循环遍历每行并嵌套检查各列表,但 pd.iterrows() 效率低下,且代码冗长易错。更优解是构建反向映射字典(reverse lookup dict):将每个姓名映射到其对应的层级编号,再通过 .map() 向量化赋值——这既简洁又充分利用了 Pandas 的底层优化。
具体实现分三步:
-
构造层级映射字典
使用字典推导式,遍历所有层级列表(放入一个大列表中),对每个列表按索引编号(从 1 开始),再展开其中每个元素,建立 姓名 → 层级号 的一对一映射:
tier1 = ['Tom', 'Patrick']
tier2 = ['Lamar']
tier_lists = [tier1, tier2]
# 构建映射:{'Tom': 1, 'Patrick': 1, 'Lamar': 2}
tier_dict = {name: idx + 1 for idx, names in enumerate(tier_lists) for name in names}
-
应用映射生成新列
直接调用 df['name'].map(tier_dict),Pandas 会自动对 'name' 列每个值查找字典键,返回对应层级编号;若某姓名未匹配任何列表,则结果为 NaN(可选处理):
df['tier'] = df['name'].map(tier_dict)
-
完整示例与验证
import pandas as pd
d = {'name': ['Tom', 'Patrick', 'Lamar'], 'rating': [100, 97, 95]} df = pd.DataFrame(d)
tier1 = ['Tom', 'Patrick'] tier2 = ['Lamar'] tier_lists = [tier1, tier2]
tier_dict = {name: idx + 1 for idx, names in enumerate(tier_lists) for name in names} df['tier'] = df['name'].map(tier_dict)
print(df)
输出:
name rating tier
0 Tom 100 1
1 Patrick 97 1
2 Lamar 95 2
✅ **优势说明**: - 时间复杂度 O(n + m),n 为总姓名数,m 为 DataFrame 行数;远优于嵌套循环的 O(n×k)(k 为层级数); - 无需显式循环或 `apply()`,避免 Python 层开销; - 易于扩展:新增 `tier3 = [...]` 只需将其加入 `tier_lists` 即可; - 支持重复姓名检查(字典自动覆盖,若需报错可先校验)。 ⚠️ **注意事项**: - 确保所有层级列表中的元素类型与 DataFrame 对应列一致(如均为字符串); - 若存在未覆盖的姓名,`.map()` 返回 `NaN`,可通过 `df['tier'].fillna(0)` 或 `df['tier'].isna().any()` 检查缺失; - 如需严格保证无遗漏,建议提前校验:`set(df['name'])










