推荐用 glob.glob("data/*/.csv", recursive=true) 递归查找所有csv文件,读取时为每个dataframe添加 source 列并设 ignore_index=false,再用列表推导式收集后一次性 pd.concat。

用 glob 找到所有 CSV 文件,别用 os.listdir
直接遍历文件夹容易漏掉子目录里的 CSV,或者误读非 CSV 文件。glob 支持通配符,更可靠,还能跨层级匹配(比如 **/*.csv)。Windows 和 macOS/Linux 都能用,不用额外判断路径分隔符。
- 推荐写法:
glob.glob("data/**/*.csv", recursive=True)—— 递归找所有子目录下的 CSV - 避免写法:
os.listdir("data")+ 手动过滤后缀,容易忽略隐藏文件、大小写问题(如.CSV) - 注意:如果路径含中文或空格,
glob默认没问题,但传给pandas.read_csv前最好用pathlib.Path封装一下,防编码异常
pd.concat 拼接时必须设 ignore_index=False 并手动加来源列
默认 ignore_index=True 会重置行号,导致你后续无法追溯某行来自哪个文件;而来源列必须在每个 pd.DataFrame 合并前就加上,不能拼完再统一加——否则所有行都会被赋同一个文件名。
python-docx Skill功能概述python-docx Skill是一项面向实际任务的技能,主要用于本Skill提供使用python-docx生成专业Word文档的标准方法和最佳实践;生成安全服务方案文档;核心要点生成技术架构设计文档;生成任何需要专业排版的Word文档;核心库 : python-docx;使用与执行辅助库 : docx.shared , docx.enum , docx.oxml.ns;标准代码模板;1. 文档初始化;2. 字体设置(必须!它将相关步骤、工具调用和结果整理方式集
- 正确顺序:读一个文件 →
df["source"] = file_path→ 再进列表 → 最后pd.concat(..., ignore_index=False) - 小技巧:用
Path(file_path).name取文件名,比完整路径更简洁;用Path(file_path).stem去掉.csv后缀 - 性能提醒:如果 CSV 超过 100 个,别用循环 +
pd.concat累加(O(n²) 时间),改用列表推导式一次性收集再拼接
读取时加 dtype=object 或按列指定类型,防止自动类型推断出错
多个 CSV 结构稍有差异(比如某列在 A 文件全是数字,在 B 文件混了字符串),read_csv 默认推断类型会失败或静默截断,最常见报错是 ValueError: invalid literal for int() 或列内容被转成 NaN。
- 稳妥做法:先用一个样本文件调用
pd.read_csv(sample, nrows=100)看列名和典型值,再构造dtype字典 - 快速兜底:直接上
dtype=str或dtype=object,后续再用.astype()转,不丢数据 - 别依赖
low_memory=False来“解决”类型冲突——它只是推迟报错,实际问题还在
合并后检查 source 列是否真有区分度
看似加了来源列,但可能全是一样的值。常见原因:循环里变量作用域写错、source 赋值写在循环外、路径用了相对路径没更新。
- 验证方法:
df["source"].nunique()应该等于 CSV 文件总数;df["source"].value_counts()看分布是否合理 - 调试技巧:先只读 2 个文件,打印它们的
df["source"].iloc[0],确认值不同 - 容易被忽略的点:Jupyter 中变量未重置,上次运行残留的
df_list导致重复追加;或者脚本里用了glob但没清空列表就再次运行
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










