class_weight='balanced'按n_samples/(n_classes×n_samples_class)计算各类权重,使损失函数中各类梯度贡献均衡;手动设置时需用真实标签作key,不影响predict_proba输出,调参应避免验证集过拟合,且不可与xgboost的scale_pos_weight混用。

class_weight=’balanced’ 是怎么算的?
它不是简单按类别频次倒数,而是用 n_samples / (n_classes * n_samples_class) 算每个类的权重。比如二分类中正样本占 5%,那正类权重 ≈ 10,负类权重 ≈ 1.05 —— 本质是让模型在损失函数里“看到”更多正例的梯度贡献。
这个公式隐含两个前提:所有类同等重要、训练集分布能代表真实分布。一旦你有业务逻辑要求(比如误判正例代价是误判负例的 5 倍),class_weight='balanced' 就不够用了。
手动设 class_weight 字典时要注意什么?
必须用真实类别标签作 key,不能假设 0/1 顺序;sklearn 不校验 key 是否在 y 中出现,填了没用的类会静默忽略。
-
class_weight={0: 1, 1: 10}表示把正例(标签为 1)的损失放大 10 倍,等效于在梯度更新时乘以 10 - 如果 y 是字符串标签(如
['cat', 'dog']),必须写成{'cat': 1, 'dog': 5},不能用索引 - 权重影响的是 loss 计算,不改变预测概率输出,所以
predict_proba()结果仍需配合阈值调整
用 validation set 动态调 class_weight 要避开哪些坑?
直接在验证集上扫 class_weight 值容易过拟合——因为你在用验证指标反向选择超参,相当于把验证集当成了调参集。更稳妥的做法是固定一个业务敏感指标(比如 F2-score 或 cost matrix),在训练过程中监控它。
推荐组合:
- 用
class_weight='balanced'作为起点 - 结合
sample_weight在fit()时微调:比如对难分正样本再加权,比改全局class_weight更细粒度 - 如果必须搜索,用 nested cross-validation,外层评估,内层调参,避免数据泄露
class_weight 和 scale_pos_weight 的区别别搞混
class_weight 是 sklearn LogisticRegression 的参数,作用于损失函数的 per-class 样本加权;而 scale_pos_weight 是 XGBoost/LightGBM 的参数,只针对正例,且是 float 类型标量。
两者不能混用,也不能跨库移植。如果你从 sklearn 切到 XGBoost,别把 {0:1, 1:10} 直接换成 scale_pos_weight=10 —— 因为 XGBoost 默认 loss 是二元 logloss,其梯度更新方式不同,实际效果并不等价。
真正关键的不是权重数字本身,而是它如何改变决策边界附近的梯度密度。这点常被忽略:调完 class_weight 后,务必画出 decision_function 分布或校准曲线,确认正负例的置信分隔是否真的向业务需求偏移。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











