pandas默认将含缺失值的整数列读为float64,因原生int不支持nan;需用dtype={'col': 'int64'}(可空整型)或str保留原始格式,避免类型误判与精度丢失。

因为CSV里没有类型信息,pandas只能靠推断,而只要有缺失值(NaN),整数列就必然变成float64。
pd.read_csv 为什么默认把整数当浮点读
CSV是纯文本格式,不存数据类型——123 和 123.0 在文件里都是字符串。pandas 读取时会逐列扫描样本值,尝试“猜”最安全的类型:
- 如果一列全是整数且无空值,可能推为
int64(但实际很少见) - 只要出现一个
NaN(比如某行该字段为空),整数列就立刻 fallback 到float64—— 因为 pandas 的int类型不支持NaN,只有float64能同时表示数字和缺失值 - 哪怕你肉眼看到全是
1、2、3,只要有一处空单元格,整列就是float64
dtype 参数怎么用才不踩坑
显式指定类型最可靠,但要注意几个关键点:
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
- 用
dtype={'col': 'Int64'}(首字母大写)才能支持带NaN的整数 —— 这是 pandas 的可空整型,不是原生int - 用
dtype={'col': str}可彻底避免数字解析,适合身份证、证券代码等“看起来像数字”的文本 - 如果同时设了
converters,它会覆盖dtype,两者别混用 - 对含小数的列,
dtype={'col': float}没问题;但想保留原始小数位数(如3.00),得用decimal=','或后续用round()/astype(str)处理
从 Excel 转 CSV 时整数变浮点的根源
Excel 自身显示整数,但底层存储可能是浮点(尤其从公式或外部导入来的数)。导出为 CSV 时,Excel 通常按“实际存储值”输出,所以 5 可能变成 5.0。这不是 pandas 的错,是源头已失真:
- 用
openpyxl或xlsxwriter读 Excel 时,可通过data_only=True获取计算结果,再人工判断是否转整 - 导出 CSV 前,在 Excel 中把列格式设为“文本”,再粘贴值,能强制输出不带
.0的纯数字字符串 - 如果必须处理已有 CSV,正则替换
\.0+$是常见手段,但要小心3.001这类真小数被误删
真正麻烦的不是“怎么转回来”,而是“哪列该转、哪列不该转”——证券代码转成整数会丢前导零,IP 地址转 float 直接报废。类型必须按业务语义定,不能只看数字长得像不像整数。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










