多标签分类输出层必须用sigmoid而非softmax,损失函数用binarycrossentropy,标签需用multilabelbinarizer编码为0/1矩阵,评估用hamming_loss或jaccard_score而非accuracy。

输出层必须用 sigmoid,不能用 softmax
多标签分类最常踩的坑就是把单标签那一套直接搬过来:最后一层接 softmax,损失函数用 categorical_crossentropy。结果模型学出来的概率和永远是 1,强行互斥,根本没法同时预测“猫”和“窗台”这种共存标签。
正确做法是对每个标签独立判断,所以输出维度等于标签总数,激活函数必须是 sigmoid,让每个输出在 [0,1] 区间内独立表示“属于该标签”的置信度。
- PyTorch 中:最后一层用
nn.Linear(in_features, num_labels),后接torch.nn.Sigmoid() - Keras/TensorFlow 中:Dense 层设
activation='sigmoid',且输出单元数等于标签数 - 别写成
activation='softmax'—— 那是给 multi-class 用的
损失函数要用 BinaryCrossentropy(BCE),不是 CategoricalCrossentropy
因为每个标签是独立的二分类任务,所以损失函数必须是逐标签计算的二元交叉熵。用 CategoricalCrossentropy 会强制所有标签概率加起来为 1,破坏多标签本质。
实操注意点:
- PyTorch:用
torch.nn.BCELoss()或torch.nn.BCEWithLogitsLoss()(推荐后者,自带 sigmoid + numerically stable) - Keras:用
loss='binary_crossentropy',别用'categorical_crossentropy' - 输入 label 必须是 float 类型的 0/1 矩阵,不是整数索引或 one-hot 向量
标签编码得用 MultiLabelBinarizer,别手写 or 用 LabelEncoder
原始标注常是字符串列表(如 ['cat', 'sunny', 'grass']),直接喂给模型会报错。必须转成固定长度的 0/1 向量,且顺序要稳定。
sklearn.preprocessing.MultiLabelBinarizer 是唯一可靠选择:
- 它能处理变长标签列表,自动对齐所有可能标签
- 生成的
binary_labels是 shape=(n_samples, n_classes) 的 numpy 数组 - 务必保存
mlb.classes_,推理时要用它反查标签名 - 别用
LabelEncoder或手动 map —— 它只支持单标签,会把['cat', 'dog']编成一个整数,彻底丢失结构
评估指标不能看 accuracy,得用 hamming_loss 或 jaccard_score
准确率(accuracy)在多标签里几乎没意义:全对才算对,哪怕只错一个标签就记为错误。一张图有 5 个标签,模型猜对 4 个,accuracy 是 0,但实际效果可能很好。
真正有用的指标:
-
hamming_loss:错误标签数占总标签数的比例,越低越好(sklearn.metrics.hamming_loss) -
jaccard_score:预测标签集与真实标签集的交并比,支持average='samples'按样本算 - 如果需要 per-label 分析,用
classification_report加zero_division=0防止除零
训练时别只盯着 loss 下降——loss 降了但 hamming_loss 升了,说明模型在学歪。多标签的 tricky 在于标签相关性,简单 pipeline 很容易忽略这点。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











