t-sne聚类图点挤成一团主因是perplexity和learning_rate设置不当;perplexity默认30易致局部结构模糊,应依数据规模在5–50间调优,小数据集优先选低值(如10、20)。

为什么t-SNE画出来的聚类图点都挤成一团?
t-SNE本身不是聚类算法,它只负责把高维特征“摊开”——但摊得是否合理,高度依赖perplexity和learning_rate。默认perplexity=30在文本或图像嵌入上常导致局部结构模糊,点群糊在一起;而learning_rate太小会让优化卡住,太大则发散。
- 先试
perplexity在5–50之间阶梯尝试(比如10、20、30、50),小数据集优先用低值( -
learning_rate别用sklearn默认的200,改设为200到1000之间,配合n_iter=1000以上 - 务必用
init='pca'——否则随机初始化容易陷入坏局部解,尤其维度>100时 - 降维前对原始特征做标准化(
StandardScaler)或L2归一化(normalize),否则量纲差异会主导距离计算
怎么把KMeans结果和t-SNE图对上号?
t-SNE输出的是二维坐标,KMeans聚的是原始高维空间,二者坐标系不一致——直接拿KMeans标签去标t-SNE散点图没问题,但不能反推“t-SNE聚类中心在哪”。常见错误是先t-SNE再KMeans,这等于在扭曲后的流形上聚类,物理意义丢失。
- 正确顺序:先在原始高维数据上跑
KMeans(或DBSCAN),拿到labels_;再对同一份原始数据跑TSNE,最后用labels_着色散点 - 避免对t-SNE结果再聚类:t-SNE坐标无全局距离意义,欧氏距离不可信
- 若想验证聚类质量,用轮廓系数(
silhouette_score)等指标,必须传原始特征+原始标签,不能传t-SNE坐标
Matplotlib画图时颜色混乱、图例错位怎么办?
用plt.scatter画t-SNE结果时,如果直接传c=labels且标签是非连续整数(比如[-1, 0, 2, 5]),颜色映射会跳号,图例也对不上。更隐蔽的问题是:没设zorder导致图例盖住点,或没关plt.axis('equal')让纵横比失真,扭曲簇形状。
- 显式构造
colors列表,按唯一标签排序:unique_labels = sorted(set(labels)),再用plt.scatter(..., c=[unique_labels.index(l) for l in labels]) - 加
plt.axis('equal')确保x/y轴单位长度一致,否则圆形簇被拉成椭圆 - 图例用
plt.legend(handles=scatter.legend_elements()[0], labels=unique_labels),避免硬编码 - 点大小别用固定
s=1,大数据集调小(s=0.1),小数据集可略大(s=10)
scikit-learn的TSNE比torch-cuda慢太多,能换吗?
sklearn的TSNE纯CPU实现,n>10k就明显卡顿;但盲目切到torch或cuML可能翻车:cuML要求GPU内存足够存整个距离矩阵(O(n²)),而PyTorch版需手动写前向传播,容易漏梯度或初始化错误。
- 1万样本以内,用sklearn +
n_jobs=-1已够用;超1万,优先试openTSNE(C++加速,API兼容,支持多核+early_exaggeration调度) - 确需GPU:cuML的
TSNE要确保X是cp.ndarray,且显存≥2×n×d×4字节(float32);报MemoryError时先降采样 - 别用
torch.nn.functional自己实现——t-SNE目标函数非标准,官方没封装,易出数值不稳定(如log(0))
真正麻烦的从来不是调哪个函数,而是降维后要不要截断异常点、要不要叠加原始特征分布直方图、以及——当业务方指着一团点问“这个簇到底代表什么”,你手里有没有对应原始ID和字段的可追溯链路。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











