calinski-harabasz分数评估聚类结果的类内紧凑性与类间分离度比值,仅依赖样本坐标x和整数标签labels,要求二者长度一致、labels无空簇且x为浮点型无异常值。

Calinski-Harabasz分数到底在评什么
它只看聚类结果本身的几何结构:类内越紧凑、类间越分离,分数越高。不需要真实标签(y_true),纯靠样本点坐标和聚类分配(labels)就能算。本质是类间离散度与类内离散度的比值,所以它对球形簇、尺度均匀的数据更友好。
用sklearn.metrics.calinski_harabasz_score必须传什么
两个参数缺一不可:X(原始特征矩阵,n_samples × n_features)和labels(整数数组,长度等于X.shape[0],每个值代表对应样本的簇ID)。注意:labels不能是字符串或None,也不能有空簇(即所有整数ID必须实际出现过)。
常见错误现象:
-
ValueError: labels must be 1D array—— 传了二维labels(比如model.labels_.reshape(-1, 1)) -
ValueError: Number of labels is not equal to number of samples——labels长度和X行数不一致 -
ValueError: Found array with 0 sample(s)—— 某个簇完全没分到点(labels里缺某个整数ID,或全为-1的噪声点未过滤)
实操建议:
- 用
np.unique(labels)确认簇ID连续且无gap;如有-1(DBSCAN噪声),先剔除对应样本和label再计算 - 确保
X是float类型,含nan或inf会直接报错 - 别把标准化后的
X和原始X混用——CH分数对量纲敏感,务必保证输入X已按业务需求做过统一缩放
CH分数高就一定聚得好吗
不一定。它隐含假设簇是凸的、各向同性的,且对异常值敏感。当数据存在长条形簇、环状结构或大量离群点时,CH可能给出误导性高分。
使用场景建议:
- 对比同一数据集上不同k值的KMeans结果(选CH峰值)
- 验证预处理是否改善了簇分离度(比如PCA降维后CH是否上升)
- 慎用于DBSCAN或谱聚类结果——尤其当簇形状复杂时,建议搭配
silhouette_score或可视化看
性能影响:计算复杂度O(n²),样本超1万时明显变慢;可考虑用mini-batch或抽样评估趋势。
一个最小可运行检查示例
from sklearn.datasets import make_blobs
from sklearn.cluster import KMeans
from sklearn.metrics import calinski_harabasz_score
<p>X, _ = make_blobs(n_samples=300, centers=4, cluster_std=0.6, random_state=0)
kmeans = KMeans(n_clusters=4, random_state=0).fit(X)
score = calinski_harabasz<em>score(X, kmeans.labels</em>)
print(f"CH Score: {score:.3f}") # 输出类似 561.23</p>
注意这里_是占位符,表示我们故意忽略真实标签——CH根本不读它。真正容易被忽略的是:如果后续换了距离度量(比如用余弦相似度重聚),就不能直接喂给calinski_harabasz_score,因为它默认用欧氏距离算质心和离散度。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











