pd.get_dummies() 更适合探索阶段,因其保留列名前缀、自动跳过数值列、支持nan为独立类别、返回dataframe便于拼接,而onehotencoder要求二维输入且默认忽略nan易报错。

直接用 pd.get_dummies() 最快,但要注意 dtype、drop_first 和缺失值处理——否则容易产出 float64 列或意外多出一列。
为什么 pd.get_dummies() 比 OneHotEncoder 更适合探索阶段
在数据清洗和 EDA 阶段,pd.get_dummies() 能保留原始列名前缀、自动跳过数值列、支持 NaN 作为独立类别(默认不丢),而 sklearn.preprocessing.OneHotEncoder 强制要求所有输入为二维数组且默认忽略 NaN,报错概率高。
- 它返回的是
pd.DataFrame,可直接拼接回原表:pd.concat([df, pd.get_dummies(df['color'])], axis=1) - 对含
None或np.nan的分类列,默认生成color_nan列;加参数dummy_na=False才跳过 - 若列本身是
category类型,get_dummies()仍能正确识别全部类别(包括未在当前样本中出现的)
get_dummies() 的三个关键参数怎么选
多数人只传一个 df[col],结果列名没前缀、无法区分来源、还可能因重复值引发列名冲突。
-
prefix='col_name':强制加前缀,避免多列独热后列名全为0/1;也可传字典如prefix={'color': 'c', 'size': 's'} -
drop_first=True:去掉每组的第一个哑变量,防止线性回归时共线性;但树模型、聚类或特征重要性分析通常不需要 -
columns=['color', 'size']:只对指定列编码,其余列(如 ID、数值特征)原样保留,比先select_dtypes再操作更稳
遇到 category 类型列,别手动转 str
有人把 df['status'].astype(str) 后再喂给 get_dummies(),这会丢失空类别信息,且把 NaN 变成字符串 'nan',导致错误多出一列。
- 正确做法是保持
category类型,get_dummies()内部会调用.categories获取完整取值空间 - 如果某类别在当前 batch 中完全没出现,
get_dummies()默认不生成对应列;需配合pd.Categorical(..., categories=full_list)预设全集 - 注意:
get_dummies()不修改原Series的 dtype,返回的是uint8或bool,内存友好
真正麻烦的是混合类型列(比如字符串里夹着数字或布尔值),这时候 get_dummies() 会静默失败或产出不可预期的列名。得先用 df['col'].apply(type).unique() 排查,再统一规整类型——这个步骤没人提醒,但几乎每次真实项目都会卡在这儿。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











