
本文介绍如何使用 pandas 读取 csv 文件时,将仅有“日/月”(如 28/03)但实际隐含完整年份(如 2024)的日期列,准确解析为标准 datetime 类型(dd/mm/yyyy),避免默认填充为 1900 年。
本文介绍如何使用 pandas 读取 csv 文件时,将仅有“日/月”(如 28/03)但实际隐含完整年份(如 2024)的日期列,准确解析为标准 datetime 类型(dd/mm/yyyy),避免默认填充为 1900 年。
在处理真实业务数据时,CSV 文件中的日期列常以 DD/MM 简写形式存储(例如 28/03),而 Excel 或源系统中该值实际代表 28/03/2024——即年份虽未显式写出,却具有明确上下文含义(如全部属于当前年、或某固定年份范围)。直接使用 parse_dates + date_format='%d/%m' 会导致 Pandas 默认补全年份为 1900,造成时间语义严重失真:
import pandas as pd
# ❌ 错误示例:年份被强制设为 1900
df = pd.read_csv("data.csv", header=None, sep=';', parse_dates=[0], date_format='%d/%m')
print(df[0].iloc[0]) # 输出:1900-03-28 → 语义错误!
✅ 正确做法是先读取原始字符串,再后置拼接年份并转换。关键在于:不依赖 read_csv 的 parse_dates 自动推断,而是手动控制年份注入逻辑。
推荐方案:pd.to_datetime() + 字符串拼接
假设所有日期均属 2024 年(可根据实际替换为变量):
df = pd.read_csv("data.csv", header=None, sep=';')
df[0] = pd.to_datetime(df[0] + '/2024', format='%d/%m/%Y')
✅ 优势:格式严格、性能好、无歧义;format 参数确保解析高效且避免模糊匹配(如 28/03 不会被误判为 MM/DD)。
若年份需动态确定(如根据文件名、业务规则或相邻字段推断),可扩展为:
# 示例:从文件名提取年份
import re
filename = "sales_2024.csv"
year = re.search(r'_(\d{4})\.csv', filename).group(1)
df = pd.read_csv(filename, header=None, sep=';')
df[0] = pd.to_datetime(df[0] + f'/{year}', format='%d/%m/%Y')
⚠️ 注意事项
- 禁止省略 format 参数:若不指定 format='%d/%m/%Y',pd.to_datetime() 可能因区域设置或启发式解析将 28/03 误认为 MM/DD(尤其在非英语环境),导致日期错乱;
- 避免 infer_datetime_format=True:该参数对缺失年份的格式无效,且已弃用;
- 批量处理多列日期:可对多个列统一操作,如 df[[0, 2]] = df[[0, 2]].apply(lambda s: pd.to_datetime(s + '/2024', format='%d/%m/%Y'));
-
空值/异常值防护:添加 errors='coerce' 自动转为 NaT:
df[0] = pd.to_datetime(df[0] + '/2024', format='%d/%m/%Y', errors='coerce')
总结
Pandas 原生 read_csv(..., parse_dates=...) 无法智能补全年份,因此必须采用「先读取、后构造、再解析」三步法。核心要点是:显式拼接年份字符串 + 指定严格日期格式 + 使用 pd.to_datetime() 安全转换。此方法兼顾准确性、可维护性与执行效率,是处理隐含年份日期的标准实践。











