pd.pivot() 要求 index+columns+values 组合唯一,否则报错;日常应优先用 pd.pivot_table()(支持聚合);melt() 是宽转长起点,非 pivot 严格逆操作。

pd.pivot() 用不了?先看这三件事
绝大多数人卡在 pd.pivot() 报错,不是语法写错,而是没满足它的硬性前提:索引列 + 列名列 + 值列必须构成唯一组合。一旦某组 index 和 columns 对应多个 values,直接抛 ValueError: Index contains duplicate entries, cannot reshape。
- 它只做“严格重塑”,不聚合、不降维,像把一张扁平表按行列切好后严丝合缝地铺开
- 适用场景极窄:原始数据本身已是“宽表雏形”,比如实验记录中每个
subject_id+timepoint只有一条measurement - 如果数据有重复(比如同一用户多次下单),必须先用
pd.pivot_table()或先groupby().agg()聚合,再 pivot
pd.pivot_table() 才是日常主力
pd.pivot_table() 是带聚合能力的 pivot,解决 90% 的“想透视但数据不干净”问题。核心区别在于它默认用 np.mean 聚合重复值,且允许你指定任意聚合函数。
- 必须显式传
values、index、columns,aggfunc建议明确写出来,别依赖默认值(避免误用 mean 统计计数类字段) - 遇到缺失值,默认填
NaN;加fill_value=0可批量补零,但注意这会掩盖真实空值逻辑 - 性能上,比纯
pivot()慢一点,但换来的是鲁棒性——只要列名对得上,基本不会崩
示例:pd.pivot_table(df, values='sales', index='region', columns='product', aggfunc='sum', fill_value=0)
melt() 不是 pivot 的反向操作,而是宽转长的起点
pd.melt() 的作用很单纯:把多列“变量”压成一列“变量名”+一列“值”。它不关心你后续怎么处理,也不做任何聚合。很多人以为 melt 是 pivot 的逆过程,其实只有在原始数据完全规则、无缺失、无重复时才可逆。
- 关键参数是
id_vars(保留不变的标识列)和value_vars(要融掉的列),不指定value_vars就默认融掉所有非id_vars列 - 生成的
variable和value列名可自定义,用var_name和value_name参数,避免后续 merge 时重名冲突 - 如果原始宽表里混着指标列和属性列(比如既有
2022_q1又有customer_type),melt 前务必先分离,否则融出来的结构会混乱
该用哪个?看你的输入和目标
别纠结名字,盯住两件事:原始数据形状、你要的结果形状。
- 输入是长表(如日志、交易明细),目标是宽表汇总 → 用
pd.pivot_table(),不是pivot() - 输入是宽表(如 Excel 表头为年份/季度),目标是长表便于分组统计 → 用
pd.melt(),之后大概率接groupby() - 输入是干净无重复的长表,且确定每组 index+columns 只对应一个 value → 才考虑
pd.pivot(),否则就是给自己埋雷
最常被忽略的一点:pivot 类操作本质是重塑索引结构,一旦中间用了 reset_index() 或修改了 index,就可能让后续 melt/pivot 对不上轴——保持 index 清晰、避免链式赋值覆盖原 df,比选对函数更重要。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











