categorical类型能省内存,因其用整数编码替代重复字符串存储,仅保留一份唯一值字典,内存占用可降至object类型的1/5~1/1/10;安全转换需先计算nunique/len比值筛选高重复列,避免对需字符串操作或保持原始顺序的列强制转换。

为什么categorical类型能省内存?
当列中唯一值数量远小于总行数(比如100万行但只有20个不同字符串),用object类型存储每个值都要存完整字符串指针,而categorical只存一个整数编码 + 一份唯一值字典。内存占用通常能降到原来的1/5~1/10,尤其对高基数文本列效果明显。
怎么安全地转成categorical?
别直接对所有字符串列暴力转换——有些列虽然看起来重复多,但后续要参与字符串操作(比如.str.contains())或需要保持原始顺序,强行转categorical会报错或行为异常。
- 先用
df[col].nunique() / len(df)粗筛:比值 - 确认该列不参与
.str方法、不参与pd.merge的on参数(除非另一侧也是同名categorical)、不导出到某些数据库驱动(如旧版psycopg2对categorical支持弱) - 转换用
df[col] = df[col].astype('category'),别用pd.Categorical()构造后赋值,后者可能丢失原有index对齐
categorical的排序和ordered参数陷阱
默认ordered=False,这时sort_values()按字典序排,但如果你业务上“低/中/高”有天然顺序,又没设ordered=True,后续rank()或cut()就容易出逻辑错误。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
- 显式声明顺序:
df['level'] = pd.Categorical(df['level'], categories=['低', '中', '高'], ordered=True) - 检查是否有序:
df['col'].cat.ordered返回True才算生效 - 注意:设了
ordered=True后,==和!=仍可用,但这类比较才真正有意义
内存节省效果怎么验证?
别只看df.info()里的memory usage——它有时低估categorical的实际开销。更准的方法是:
- 转换前后都执行
df.memory_usage(deep=True).sum(),这个值才反映真实内存(含category内部字典) - 对单列测:
df[col].memory_usage(deep=True)vsdf[col].astype('category').memory_usage(deep=True) - 警惕“假节省”:如果列本身只有几行,转categorical反而略增内存(因为要额外存categories列表)
真正省内存的关键不在类型名,而在重复值密度和后续是否触发category内部字典的深层拷贝——比如df.copy()后修改某行categorical值,可能意外触发字典复制。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










