
本文介绍在pandas中快速从字典类型列中按行提取指定键(来自另一列)对应值的多种方法,重点对比性能并推荐最优解——列表推导式,兼顾简洁性、可读性与执行效率。
本文介绍在pandas中快速从字典类型列中按行提取指定键(来自另一列)对应值的多种方法,重点对比性能并推荐最优解——列表推导式,兼顾简洁性、可读性与执行效率。
在实际数据分析中,常遇到一种结构:DataFrame 中一列存储关键词(如 words),另一列存储与之对应的字典(如 dict1),需根据每行的关键词,从其同行字典中提取对应值,生成新列(如 value)。虽然 df.apply(lambda row: row['dict1'][row['words']], axis=1) 能实现目标,但其性能极差——尤其在数十万行以上数据时,因 apply(axis=1) 本质是 Python 级别逐行循环,并伴随大量 Series 构造开销,成为典型性能瓶颈。
✅ 推荐首选:列表推导式 + dict.get()
最简洁、最高效且健壮的方案是使用原生 Python 列表推导式配合 zip 和 dict.get():
df['value'] = [d.get(w) for w, d in zip(df['words'], df['dict1'])]
该写法直接遍历两列的对应元素对,调用字典的 .get(key) 方法(自动处理缺失键,返回 None;若字典中键存在但值为 NaN,也如实保留),全程无 Pandas 开销,底层由 C 优化的迭代器驱动。实测在 40 万行数据上仅耗时约 127ms,速度比 apply 快 20 倍以上。
⚠️ 注意事项:
- dict.get(w) 比直接 d[w] 更安全:当 words 中某值不在对应字典键中时,前者返回 None(可后续统一转为 np.nan),后者将抛出 KeyError;
- 若需将 None 统一转为 NaN(保持数值列一致性),可链式处理:
import numpy as np df['value'] = pd.Series([d.get(w) for w, d in zip(df['words'], df['dict1'])]).replace({None: np.nan})
? 备选方案(适用于特殊场景)
-
json_normalize + 向量化索引(中等性能):适合字典结构高度一致、且需复用中间归一化结果的场景。先将字典列展开为 DataFrame,再按 words 列做列名索引:
from pandas import json_normalize import numpy as np idx, cols = pd.factorize(df['words']) df['value'] = (json_normalize(df['dict1']) .reindex(cols, axis=1) .to_numpy()[np.arange(len(df)), idx])耗时约 811ms,灵活性较低,且对含 NaN 的字典键兼容性需额外处理。
-
groupby().transform()(次优):利用分组后对每组内字典批量取值,避免显式循环:
df['value'] = df.groupby('words')['dict1'].transform(lambda x: x.str[x.name])耗时约 237ms,语义清晰但依赖 str 访问器,对非字符串键或复杂嵌套字典支持有限。
? 总结建议
- 95% 场景下,请无条件选择列表推导式:代码短、易懂、极速、健壮;
- 彻底规避 apply(axis=1),它应被视为性能反模式;
- 所有方案均天然支持 NaN 值(字典中值为 NaN 时,结果仍为 NaN),无需额外清洗;
- 若字典列含大量重复字典,可预先缓存 dict.get 绑定函数进一步微优化,但收益通常有限。
性能排序(快 → 慢):列表推导式 ≫ groupby.transform > json_normalize + indexing > apply。抓住“向量化思维”的本质——优先利用底层 C 迭代(如 zip),而非 Pandas 的高层抽象接口。










