用fairlearn的metricframe分组计算性能差异最稳妥,需显式传sensitive_features、统一敏感列类型、避免classification_report漏组,并用make_group_metric包装scorer适配sklearn流程。

用 fairlearn 分组计算性能差异
直接调用 fairlearn.metrics.MetricFrame 是最稳的路子。它能自动按敏感属性(比如 race、gender 或工业场景里的 batch_id)切分数据,再对每组单独算指标,不手动拆数组、不漏 groupby 边界条件。
常见错误是把敏感列当普通特征传进模型评估函数——MetricFrame 要求显式传入 sensitive_features 参数,否则会报 ValueError: sensitive_features must be 1D 或静默忽略分组逻辑。
-
metrics字典里键名必须是函数名(如"accuracy"),值必须是可调用对象(accuracy_score,不是字符串"accuracy_score") - 敏感列类型要一致:训练时用
int编码的batch_id,测试时也得是int,混用str会导致某组 support=0,后续除零或 nan - 输出是
MetricFrame对象,查各组精度差直接用.difference(method="between_groups"),别自己取 max-min —— 它默认处理了缺失组和 NaN
避免 classification_report 漏掉稀有子组
原生 classification_report 只统计 y_true 和 y_pred 共同出现的类,如果某班组在测试集里只出现 2 次、预测全错,报告里可能压根不显示该组 recall,你以为模型“没偏见”,其实是被隐藏了。
正确做法是先用 np.unique 扫一遍所有敏感值,强制喂给 MetricFrame 的 sensitive_features;或者用 fairlearn.metrics.group_summary 配合 include_overall=False,确保每个子组都强制出结果。
- 工业场景中,原料批次
batch_087可能在训练集为 0 样本,测试集突然出现 5 条——这时sensitive_features必须包含该值,否则MetricFrame会跳过它 - 若用
output_dict=True接classification_report,记得检查返回字典里是否有该组 key;没有就说明该组未参与统计,得回溯数据分布
在 pipeline 中嵌入公平性 scorer 会报错?
GridSearchCV 或 cross_val_score 不能直接用 MetricFrame 当 scorer,因为它的签名是 (y_true, y_pred, sensitive_features),而 sklearn 的 scorer 只认两个参数。强行塞会触发 TypeError: got an unexpected keyword argument 'sensitive_features'。
真正能用的,是 fairlearn.metrics.make_group_metric 包装后的函数,例如:
from fairlearn.metrics import make_group_metric, demographic_parity_difference
dp_diff_scorer = make_group_metric(
demographic_parity_difference,
metric_kwargs={"sensitive_features": groups_test}
)
-
make_group_metric返回的是标准 sklearn scorer,可直接传给scoring=dp_diff_scorer -
metric_kwargs必须在定义 scorer 时固化,不能留到 fit 阶段动态传——否则 cv 折叠间groups_test长度不一致会崩 - 注意:这类 scorer 返回的是差异值(越小越好),所以
greater_is_better=False得显式设,否则GridSearchCV会反向优化
为什么 demographic_parity_difference 和 equalized_odds_difference 结果差很多
前者看“预测为正例的比例”在各组是否接近(P(ŷ=1|A=a) ≈ P(ŷ=1|A=b)),后者看“真实为正例时预测为正例的比例”是否一致(P(ŷ=1|y=1,A=a) ≈ P(ŷ=1|y=1,A=b))。工业产率预测里,若模型对稀有原料批次整体压低预测概率,demographic_parity_difference 就会飙升;但若它对这批原料的达标样本仍保持高召回,则 equalized_odds_difference 可能正常——两者不互斥,得一起看。
- 二分类任务中,
equalized_odds_difference要求你明确传y_true和y_pred,且y_true必须含正例(否则分母为 0 返回 nan) - 多类问题别硬套这两个函数——它们只支持二分类,用错会静默返回 0 或报
ValueError: y_true contains more than two classes - 实际部署前,至少比对三组指标:
accuracy、recall差异、demographic_parity_difference;只盯一个,容易误判“公平”
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











