np.cov 默认按行计算协方差,即每行视为一个变量、每列视为一个样本;若数据为标准格式 (n_samples, n_features),需显式设置 rowvar=false 才能得到正确的 n_features × n_features 协方差矩阵。

np.cov 默认按行还是按列计算协方差?
默认按**行**把每行当作一个变量(即观测维度),列是样本点——这和大多数机器学习场景的直觉相反,容易导致协方差矩阵形状错乱、特征相关性算反。
- 如果你的数据是
shape=(n_samples, n_features)(标准格式),直接传给np.cov会把每个样本当变量,结果矩阵是n_samples × n_samples,完全没用 - 正确做法是加参数
rowvar=False,告诉它“变量在列上”,此时才输出n_features × n_features协方差矩阵 - 不设
rowvar时,np.cov(X)等价于np.cov(X, rowvar=True),别依赖默认值
为什么 np.cov(X.T) 和 np.cov(X, rowvar=False) 结果一样但要慎用?
两者数学等价,但 X.T 在高维或内存受限时可能触发复制开销,尤其对大数组;而 rowvar=False 是原地逻辑切换,更轻量。
-
np.cov(X.T)强制生成转置副本,若X是 100 万 × 100 的 float64,转置后多占约 800MB 内存 -
np.cov(X, rowvar=False)不额外分配,适合生产环境或 notebook 中反复调试 - 注意:如果
X是 Fortran-order(列优先)数组,X.T是 view,但rowvar=False依然更明确、可读性更强
NaN 值导致 np.cov 返回全 nan 怎么办?
np.cov 遇到任何 nan 就整行/整列失效,默认返回全 nan 矩阵,不是跳过或报错。
- 用
nan_policy='omit'参数可启用剔除含 nan 的样本对(pairwise deletion),这是最常用解法 - 不要用
nan_policy='propagate'(默认)或'raise',前者静默失败,后者直接中断 - 示例:
np.cov(X, rowvar=False, nan_policy='omit')—— 它对每一对特征独立丢弃该对中任一为 nan 的样本行 - 注意:pairwise 删除可能导致协方差矩阵非正定,后续做 PCA 或 Cholesky 分解前需检查
协方差矩阵数值不准?检查数据是否已中心化
np.cov 内部会自动减均值,但前提是它能正确算出均值;若数据含 inf、极端离群值或 dtype 不匹配(如 int64 与 float32 混用),均值计算可能溢出或截断,导致协方差失真。
- 先用
np.isfinite(X).all()确保无 inf/nan - 显式中心化更可控:
X_centered = X - X.mean(axis=0),再用np.dot(X_centered.T, X_centered) / (X.shape[0] - 1) - dtype 推荐统一为
float64,避免int32数组在求和时悄悄溢出 - 小样本(
n_samples )下,样本协方差估计方差大,别急着下结论
协方差矩阵本身不标准化,数值大小严重依赖原始特征量纲;做特征分析前,通常得先标准化或直接用相关系数矩阵(np.corrcoef)。这点常被跳过,但直接影响后续解释。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











