corr() 默认使用皮尔逊(pearson)相关系数,要求变量近似线性且数据大致正态,对异常值敏感;会跳过含nan的行,全常数列返回nan,字符串/布尔列被静默排除。

corr() 默认用什么方法计算相关系数
corr() 默认使用皮尔逊(Pearson)相关系数,要求变量间近似线性关系且数据大致服从正态分布。它对异常值敏感,如果列中存在明显离群点,结果可能严重失真。
实际用时要注意:
- corr() 会自动跳过含 NaN 的行(pairwise deletion),但不会警告你删了多少数据
- 若两列全是常数(如全为 5),corr() 返回 NaN,不是 0
- 字符串列或布尔列会被静默排除,不报错也不提示
如何指定 spearman 或 kendall 相关系数
非线性、单调关系或小样本时,spearman 更稳健;kendall 对小样本一致性更敏感,但计算慢。
调用方式很简单:
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
df.corr(method='spearman') df.corr(method='kendall')
注意:
- method 参数只接受字符串 'pearson'、'spearman'、'kendall',大小写敏感
- 传入自定义函数(如 lambda x, y: np.corrcoef(x, y)[0, 1])虽语法合法,但 pandas 1.5+ 已弃用,会触发 FutureWarning
- spearman 内部会对数据做秩转换,若列含大量重复值(如评分 1–5 分),结果可能偏高
提取某两列之间的相关系数值
直接索引即可,比如想取 'age' 和 'income' 的相关系数:
df.corr()['age']['income'] # 或更稳妥的写法(避免 KeyError) df.corr().loc['age', 'income']
常见陷阱:
- 列名不存在时,['age']['income'] 报 KeyError,而 .loc 也报错,但信息更明确
- 如果列名含空格或特殊字符(如 'user id'),必须用 .loc,不能用点号或方括号链式访问
- 返回的是 Python 标量(float64),不是单元素 Series,别误用 .values[0]
corr() 结果矩阵里 NaN 是怎么来的
除了前面说的「全常数列」导致 NaN,还有两个高频原因:
- 两列在相同位置有太多重叠缺失值,有效配对数不足 2(至少需要 2 个非空 (x,y) 对才能算相关)
- 某列是 object 类型但内容无法转为数值(如混有 'N/A' 和数字),该列整列被 drop,对应行列全为 NaN
排查建议:
- 先运行 df.select_dtypes(include='number').isna().sum() 看各数值列缺失量
- 对可疑列手动跑 pd.to_numeric(df['col'], errors='coerce') 再 corr()
- 不要用 df.dropna() 预处理——它按行删,会大幅减少样本量,改用 df.corr(min_periods=10) 设最低有效对数
相关系数矩阵看着简洁,但每一格背后都依赖特定的数据结构假设和清洗状态。特别是当列来自不同系统拼接、或经过多次导出导入后,类型和空值行为极易失控。别只盯着数值大小,先确认 df.dtypes 和 df.isna().sum() 是否合理。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










