
本文介绍如何利用 python 和 pandas 从文件名中提取日期信息,并筛选出日期大于指定阈值的 csv 文件,支持灵活解析、安全比较和批量读取。
本文介绍如何利用 python 和 pandas 从文件名中提取日期信息,并筛选出日期大于指定阈值的 csv 文件,支持灵活解析、安全比较和批量读取。
在实际数据处理流程中,常需按时间维度动态加载日志或快照类 CSV 文件(如 file_name_20240906.csv)。原始代码通过字符串匹配(如 "20240905" in loc)仅能做精确匹配,无法实现“大于某日期”的逻辑判断。正确做法是将文件名中的日期字符串解析为 datetime 类型,再进行数值化比较。
以下是一个健壮、可复用的解决方案:
✅ 步骤一:提取并解析文件名中的日期
使用 glob 获取所有 CSV 路径后,构建 DataFrame 并借助 pd.to_datetime(..., format=..., exact=False) 提取嵌入在文件名中的日期。exact=False 允许 Pandas 在长路径中自动定位符合 %Y%m%d 格式的子串(例如从 'C:\temporary_location\file_name_20240906.csv' 中准确捕获 '20240906')。
import glob
import pandas as pd
# 指定根路径(注意:Windows 下推荐使用原始字符串或正斜杠)
base_path = r'C: emporary_location'
pattern = f'{base_path}\file_name_*.csv'
# 获取所有匹配文件路径
file_paths = glob.glob(pattern)
# 构建 DataFrame 并解析日期
df = pd.DataFrame({"filepath": file_paths})
# 从文件路径中提取并转换为 datetime;format 指定日期格式,exact=False 启用模糊匹配
df["date"] = pd.to_datetime(df["filepath"], format="%Y%m%d", exact=False, errors="coerce")
# 过滤:日期严格大于指定阈值(支持字符串或 datetime 输入)
cutoff_date = "2024-09-05" # 或 pd.Timestamp("2024-09-05")
filtered_files = df[df["date"] > cutoff_date]["filepath"].tolist()
print("匹配的文件(日期 > 2024-09-05):")
for f in filtered_files:
print(f)
✅ 输出结果(与预期一致):
Miller CSV TSV JSON 数据处理器下载Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
匹配的文件(日期 > 2024-09-05): C: emporary_locationile_name_20240906.csv C: emporary_locationile_name_20240907.csv ... C: emporary_locationile_name_20240913.csv
⚠️ 关键注意事项
-
errors="coerce":对无法解析的路径(如无有效日期),自动设为NaT,避免程序中断;后续可通过df.dropna(subset=["date"])清洗。 -
路径兼容性:
glob返回完整路径,to_datetime可直接处理(无需手动截取文件名),但需确保日期片段格式统一且唯一。 -
性能优化:若文件数量极大,可改用
pathlib.Path+ 正则预提取日期,减少to_datetime开销;但对百级文件,当前方案简洁高效。 -
时区与精度:默认为本地时区、日精度,如需小时/分钟级比对,请确认文件命名是否包含时间戳,并调整
format(如"%Y%m%d_%H%M%S")。
? 扩展:批量读取筛选后的文件
在获得 filtered_files 列表后,可无缝集成至数据加载逻辑:
all_data = []
for fp in filtered_files:
print(f"正在加载: {fp}")
df_chunk = pd.read_csv(fp, low_memory=False)
df_chunk["source_file"] = fp # 可选:记录来源
all_data.append(df_chunk)
# 合并为单一 DataFrame(如需)
combined = pd.concat(all_data, ignore_index=True) if all_data else pd.DataFrame()
该方法兼顾可读性、健壮性与扩展性,是处理时间序列命名文件的标准实践。











