Python中Scikit-learn如何计算聚类算法的有效性_使用调整兰德系数

雨雪酱_2709

雨雪酱_2709

2026-05-10

274人浏览

原创

adjusted_rand_score用于评估聚类结果与真实标签的相似度,取值范围为[-0.5, 1.0],1.0表示完全一致,0.0表示与随机标记相当,负值表示比随机更差;它只接受等长整数标签,对簇名顺序不敏感,且要求有真实标签才能使用。

python中scikit-learn如何计算聚类算法的有效性_使用调整兰德系数

直接用 sklearn.metrics.adjusted_rand_score 就行,但必须注意:它只适用于你有真实标签(labels_true)的场景——比如 Iris、Digits 这类带标注的公开数据集,或者你人工打标过的业务数据。没有真实标签时,这个函数根本没法用,别硬套。

为什么不能直接拿聚类结果和原始特征算 ARI

adjusted_rand_score 的输入只能是两组整数标签:一组是真实类别(如 [0, 0, 1, 1, 2, 2]),另一组是模型输出的簇编号(如 [0, 0, 1, 1, 2, 2] 或 [1, 1, 0, 0, 2, 2])。它不接受原始数据 X、距离矩阵、嵌入向量,也不接受字符串标签(得先用 LabelEncoder 转成 int)。

常见错误现象:

  • 传入 y_pred 是浮点型簇中心坐标,报 ValueError: Unknown label type: 'continuous'
  • 传入 y_true 是字符串(如 ['cat', 'cat', 'dog']),报 TypeError: Expected array-like (array or non-string sequence)
  • 两个标签长度不一致,直接 ValueError: Found array with dim 3. Expected dim = 2(其实是长度不匹配)

adjusted_rand_score 对标签顺序完全不敏感

它只看“哪些样本被分到了同一组”,不关心组名叫 0 还是 99。这意味着:

  • y_true = [0,0,1,1] 和 y_pred = [5,5,3,3] → ARI = 1.0
  • y_true = [0,0,1,1] 和 y_pred = [1,1,0,0] → ARI = 1.0(组名翻转不影响)
  • y_true = [0,0,1,1] 和 y_pred = [0,1,0,1] → ARI ≈ -0.33(完全错位,比随机还差)

所以你不需要对 y_pred 做任何重映射(比如用 hungarian_algorithm 对齐簇名),adjusted_rand_score 内部已经处理好了。

Galileo python sdk
Galileo python sdk

Galileo AI 平台 Python SDK 完整参考,用于评估、监控和保护 GenAI 应用,适用于构建 Python 应用。

下载

实际跑 KMeans 时怎么嵌入 ARI 计算

典型流程就是:拟合 → 预测 → 对比真实标签。关键点在于确保 y_true 和 y_pred 是等长、同类型、非空的一维数组:

from sklearn.cluster import KMeans
from sklearn.metrics import adjusted_rand_score
<h1>假设你已有带标签的数据(如 Iris)</h1><p>X, y_true = iris.data, iris.target  # y_true 是 0/1/2 整数</p><p>kmeans = KMeans(n_clusters=3, random_state=42)
y_pred = kmeans.fit_predict(X)  # 输出也是 0/1/2 整数</p><p>ari = adjusted_rand_score(y_true, y_pred)
print(f"ARI: {ari:.3f}")  # 输出类似 0.730
</p>

注意:

  • 如果 n_clusters 设得和真实类别数不一致(比如 Iris 真实是 3 类,你设 n_clusters=4),ARI 仍可计算,但值通常会下降;
  • DBSCAN 返回的 y_pred 可能含 -1(噪声点),adjusted_rand_score 能正常处理,-1 会被当作一个独立簇;
  • 不要在训练集上反复调参并用 ARI 选最优 n_clusters——这属于用测试指标污染训练过程,容易过拟合。

真正容易被忽略的是:ARI 高 ≠ 聚类结果业务可用。比如在用户分群中,ARI=0.8 的划分可能把高价值用户全分进同一个簇,但该簇内部行为差异极大——这时得结合轮廓系数、业务规则再判断。ARI 只回答“和已知标签像不像”,不回答“这个簇有没有意义”。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

python

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4224

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24577

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3007

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3027

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2343

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程