最直接方法是转置dataframe后用scipy.spatial.distance.cdist计算列间欧式距离:cdist(df.t, df.t, metric='euclidean'),结果矩阵(i,j)对应原第i列与第j列的距离,避免误用cdist(df, df)导致行距而非列距。

用 scipy.spatial.distance.cdist 计算列间欧式距离最直接
DataFrame 各列视为向量(长度为行数),列两两之间的欧式距离本质是向量间距离。Pandas 本身不提供列间距离计算接口,硬用 apply + np.linalg.norm 循环效率低且易出错。推荐直接用 scipy.spatial.distance.cdist,它专为这类成对距离计算设计,底层 C 实现,快且稳。
关键点:需先转置 DataFrame,使“列变行”,因为 cdist(X, Y) 默认按行计算距离。原 DataFrame 的列 → 转置后变为行 → cdist 对这些行两两计算距离 → 结果矩阵的 (i, j) 就是原第 i 列与第 j 列的距离。
import pandas as pd
import numpy as np
from scipy.spatial.distance import cdist
<p>df = pd.DataFrame({'a': [1, 2, 3], 'b': [4, 5, 6], 'c': [7, 8, 9]})
dist_matrix = cdist(df.T, df.T, metric='euclidean')</p><h1>dist_matrix[i, j] 是 df.iloc[:, i] 和 df.iloc[:, j] 的欧式距离</h1>
避免 cdist(df, df) 这种常见误用
直接对原始 df 调用 cdist(df, df) 算的是“行之间”的距离,不是列之间。这是最常踩的坑——结果维度对不上,数值也完全不对。
- 错误写法:
cdist(df, df)→ 输出 shape 是(len(df), len(df)),对应行距 - 正确写法:
cdist(df.T, df.T)→ 输出 shape 是(df.shape[1], df.shape[1]),才是列距 - 如果只想要上三角或下三角(避免重复),可用
np.triu(dist_matrix, k=1)提取非对角上三角部分
处理含缺失值(NaN)的列要先填充或剔除
cdist 不支持 NaN。遇到含空值的列,会报错 ValueError: Input contains NaN。
- 简单填充:
df_filled = df.fillna(df.mean(numeric_only=True)),但需确认填充逻辑是否合理 - 更安全做法:剔除含 NaN 的列 ——
df_clean = df.dropna(axis=1),再计算 - 若必须保留缺失列,可逐列手动计算并跳过含 NaN 的列对,但性能下降明显
距离矩阵结果是 numpy.ndarray,转成带行列名的 DataFrame 更实用
原始 cdist 返回纯数组,不方便查看哪两列对应哪个距离。建议立刻包装成带索引和列名的 DataFrame:
dist_df = pd.DataFrame(
dist_matrix,
index=df.columns,
columns=df.columns
)
# 此时 dist_df.loc['a', 'b'] 就是列 a 和列 b 的欧式距离
注意:对角线全为 0(自己到自己的距离),若后续要用,记得 np.fill_diagonal(dist_df.values, np.nan) 或直接屏蔽对角线。
列维度大时(比如上百列),cdist 仍高效;但若只要少数几对列的距离,别全算,直接用 np.linalg.norm(df[col1] - df[col2]) 更省资源。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











