pd.to_datetime()报错或返回nat主因是输入格式混乱且默认严格匹配iso格式;需设errors='coerce'、关闭format参数,并结合正则清洗、dateutil.parser兜底或分组解析。

为什么 pd.to_datetime() 直接报错或返回 NaT
因为输入字符串格式太杂:有的带中文“年月日”,有的用斜杠/短横/点分隔,有的缺年份、有的时区混乱,pd.to_datetime() 默认只认 ISO 格式(如 "2023-01-01")或常见英文格式。一遇到 "2023年05月20日" 或 "2023/5/1 上午9:30" 就哑火,批量转完全是 NaT。
关键不是“能不能转”,而是得告诉 Pandas:你预期它看到什么、容忍什么、 fallback 怎么做。
- 默认
errors='raise'会直接中断;改成errors='coerce'才能静默转成NaT,方便后续排查 -
format参数必须严格匹配——但非规范化数据根本没法写唯一 format,所以通常得关掉它(设为None) - 中文日期必须配
locale?不,Pandas 不支持 locale 解析,得靠预处理或第三方库
用 dateutil.parser.parse 做兜底解析
pd.to_datetime() 底层其实调了 dateutil.parser.parse,但封装后丢了灵活性。直接调用它,能应付绝大多数“人写的”日期字符串:
from dateutil import parser
import pandas as pd
def safe_parse_date(x):
try:
return parser.parse(x)
except (ValueError, TypeError):
return pd.NaT
df['parsed'] = df['date_str'].apply(safe_parse_date)
这个函数能自动识别:"2023-05-20"、"20/05/2023"(按 locale 猜顺序)、"2023年5月1日"、"May 1st, 2023"、甚至 "昨天"(需加 fuzzy=True)。
-
fuzzy=True允许跳过无关字符(比如"下单时间:2023/05/20 14:30") - 但性能比
pd.to_datetime()慢 5–10 倍,大数据量慎用 - 对纯数字串如
"20230520"默认当YYYYMMDD,但如果字段混着"2023520"(少零),它会误判成 2023 年 5 月 20 日还是 2023 年 52 月 0 日?——会报错,得提前清洗
混合策略:先规则清洗,再批量转换
最稳的路是“分治”:把字符串按特征分组,每组用最匹配的方式转。比如:
Python 3.13.5是该编程语言于2025年6月11日发布的第五个维护版本。这是一个紧急修复版本,主要解决了3.13.4中Windows扩展模块构建失败、生成器表达式错误处理延迟、及无法向random.getrandbits()传递类整数对象等关键问题。此版本秉承了3.13系列的新特性,如改进的交互式解释器与实验性的无GIL模式,并建议所有3.13用户升级。
- 含“年”“月”“日”的 → 用正则提取数字,拼成
"%Y年%m月%d日"格式再转 - 含“/”或“-”且长度为 8–10 → 统一补零、标准化分隔符,走
pd.to_datetime(..., format=...) - 含“今天”“明天”“上周五” → 单独用
dateutil.parser.parse(x, fuzzy=True)+datetime.date.today()做相对计算
示例(清洗中文日期):
import re df['cleaned'] = df['date_str'].str.replace(r'(\d+)年(\d+)月(\d+)日', r'\1-\2-\3') df['dt'] = pd.to_datetime(df['cleaned'], errors='coerce')
注意:str.replace 是向量化,比 apply 快得多;但正则要覆盖全,漏一个格式就会留 NaT。
时区和精度问题常被忽略
非规范字符串往往不带时区,但业务可能要求统一转成 UTC 或本地时区。Pandas 默认解析出来是 naive datetime(无时区),直接 .dt.tz_localize('Asia/Shanghai') 会出错——如果原始字符串其实是 UTC 时间,就全偏了 8 小时。
- 先确认数据源头是否有时区语义(比如日志里写“GMT+8”或“UTC”字样)
- 没有明确标识时,宁可保持 naive,别硬加
tz_localize - 毫秒级精度?
pd.to_datetime(..., unit='ms')只适用于数字时间戳;字符串里带毫秒(如"2023-05-20 14:30:00.123")默认就能解析,但parser.parse有时会丢毫秒,建议用pd.to_datetime配fuzzy=False更准
真正麻烦的是“2023-05-20”这种只有日期的字段——Pandas 默认塞 00:00:00,但如果下游系统按“当天任意时刻”理解,就得额外加说明,不能只靠类型判断。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










