过拟合的核心信号是训练得分高、验证得分低且差距不随训练集增大而收敛;需关注曲线趋势而非单点差值,结合任务选用正确scoring(如回归用neg_前缀),并确保cv抽样合理。

learning_curve 返回的 train_scores 和 val_scores 怎么看差距
过拟合的核心信号是:训练得分高、验证得分低,且两者差距随训练集增大仍不收敛。重点不是某一个点的差值,而是整条曲线的趋势——比如 train_mean 稳定在 0.95 以上,val_mean 却卡在 0.72~0.78,且最后几个点几乎水平,说明加数据也救不回来。
别只盯着最后一个点:如果 val_mean 在 train_sizes=0.8 之后还在缓慢爬升,那可能只是数据不够,不算典型过拟合;但如果到 0.9 就不动了,差距还维持在 0.2+,基本可判定模型太复杂或正则太弱。
- 差距 > 0.15 且不随样本增加而缩小 → 高概率过拟合
- 训练得分接近 1.0 但验证得分
- 验证得分标准差
val_std很小(如
scoring 参数设错会导致“假过拟合”
用错 scoring 是最隐蔽的坑:比如分类任务用了 'neg_log_loss',返回的是负对数似然,数值越小反而越好。这时你看到训练得分 -0.1、验证得分 -0.5,会误以为差距大 → 其实是 -0.1 > -0.5,训练确实更好,但绝对值不能直接比。
更常见的是回归任务漏掉负号:该用 'neg_mean_squared_error' 却写了 'mean_squared_error',learning_curve 会静默 fallback 到模型自带的 score() 方法(比如 LinearRegression.score() 返回 R²),结果纵轴含义全乱。
- 分类任务统一用
'accuracy'或'f1'(二分类注意average='binary') - 回归任务必须用带
neg_前缀的,如'neg_mean_absolute_error',画图前记得取反:mae = -val_mean - 别依赖默认
scoring=None,它调用模型原生score(),和你最终评估指标很可能不一致
cv 抽样方式不对会让验证线抖动失真
如果你看到验证线忽高忽低、像锯齿一样,大概率是 cv 没设对。默认的 StratifiedKFold 对分类有效,但若类别极度不均衡(比如正样本仅占 0.5%),某折验证集可能一个正样本都没有,导致那一折的 accuracy 虚高(全判负就 99.5% 准确率),拉高整体均值,掩盖真实过拟合。
这时候验证得分看起来“不低”,甚至偶尔超过训练得分,容易误判。这不是模型问题,是评估流程污染了信号。
- 二分类严重不平衡时,改用
StratifiedKFold(n_splits=5, shuffle=True, random_state=42)并显式传入cv= - 拒绝
ShuffleSplit:它不保比例,小样本下验证分方差爆炸 - train_sizes 最小值别设太小(如
0.05对于 200 条数据 = 10 条),模型根本学不出规律,验证线起点失真
为什么训练分有时比验证分还低 —— 别急着下结论
在极小训练集上,强正则模型(如 LogisticRegression(C=0.01))或某些评估方式(如 scoring='neg_log_loss')会出现训练得分反低于验证得分。这不是 bug,而是模型在样本太少时“不敢拟合”,验证集偶然更均衡,分数略高。
这种现象不能直接当成“没过拟合”的证据。关键看绝对值:如果训练分 0.65、验证分 0.68,两者都低,仍是欠拟合;如果训练分 0.5、验证分 0.7,但整体远低于业务要求(比如需要 ≥0.9),说明模型容量严重不足,得换结构或加特征,而不是减正则。
- 先检查
train_sizes[0]对应的样本量是否 ≥ 模型参数量的 3 倍 - 把
train_scores和val_scores的原始二维数组打印出来,看单折得分分布,别只信均值 - 过拟合判断必须结合业务阈值:0.85 的验证分对风控模型可能是灾难,对推荐冷启动却算不错
train_sizes 没用比例、scoring 和任务不匹配、或者把抖动当信号——这些细节一错,整条曲线就失去诊断价值。Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











