用pandas.read_excel(sheet_name=none)读取所有工作表为字典,再用pd.concat合并;注意显式指定header、dtype,统一列名并标记来源,合并后检查类型与空值。

直接用 pandas.read_excel() 配合 pd.concat() 就能搞定,不需要手动循环打开每个 sheet 再拼接——关键是别让 pandas 自动跳过空行或误判 header。
读取单个 Excel 文件的所有工作表
用 sheet_name=None 让 read_excel() 返回一个 dict,键是 sheet 名,值是 DataFrame。这是最省事的起点,比一个个写 sheet_name="Sheet1" 强得多。
常见错误:漏掉 sheet_name=None,结果只读了第一个 sheet;或者用了 sheet_name=0 以为能通吃,其实它只读索引为 0 的那个 sheet。
实操建议:
- 始终显式传参
sheet_name=None,哪怕你只打算合并部分 sheet - 如果文件很大,先用
pd.ExcelFile(file_path).sheet_names查看有哪些 sheet,避免读入无用表 - 注意
read_excel()默认把第一行当列名,若某 sheet 没有 header 或 header 在第 2 行,得单独配header=1
合并多个 Excel 文件的同名工作表(比如都叫“数据”)
典型场景:每月导出一份报表,文件名不同但内部 sheet 名统一。这时不能直接 concat 所有 sheet dict,得先按 key 分组聚合。
性能影响:一次性读完所有文件再合并,内存占用高;如果文件超 10 个且单个 >50MB,建议加 chunksize 或改用生成器逐个处理。
实操建议:
- 用字典推导式收集:
{file: pd.read_excel(file, sheet_name="数据") for file in file_list} - 提取所有
"数据"表:dfs = [d["数据"] for d in sheets_dict.values() if "数据" in d] - 合并时加
ignore_index=True,否则 index 会重复(比如每个 sheet 都从 0 开始) - 如果要保留来源文件名,提前加一列:
df["source_file"] = file
合并同一文件内多个工作表并区分来源
Excel 里常把不同维度数据拆到不同 sheet(如“销售”、“库存”、“退货”),合并后需要标记来源。这时候 sheet_name=None 返回的 dict 就很有用。
容易踩的坑:不同 sheet 列名不一致(比如“销售”有 amount,“退货”写成 return_amt),直接 concat 会导致列对不齐、出现大量 NaN。
实操建议:
- 先检查列结构:
for name, df in sheets.items(): print(name, df.columns.tolist()) - 统一列名再合并,例如:
df.rename(columns={"return_amt": "amount"}, inplace=True) - 用
pd.concat(..., keys=sheets.keys())可以自动加一层 MultiIndex 标记 sheet 来源,但后续索引操作稍麻烦 - 更直观的做法是加普通列:
pd.concat([df.assign(sheet=name) for name, df in sheets.items()])
处理合并后的类型错乱与空值
Excel 原生不存类型,read_excel() 会猜列类型,经常把带空格的数字当字符串,或把日期识别成 float(如 44562.0)。合并后问题放大,比如本该相加的金额列变成 object 类型,.sum() 报错。
兼容性影响:不同版本 pandas 对 Excel 时间格式解析略有差异,pandas ≥ 2.0 用 dtype_backend="pyarrow" 能缓解,但需额外装 pyarrow。
实操建议:
- 读取时就指定关键列类型:
dtype={"order_id": str, "amount": float} - 合并后立刻检查:
df.dtypes和df.isna().sum() - 批量转类型别用
apply(pd.to_numeric),太慢;改用df["col"] = pd.to_numeric(df["col"], errors="coerce") - 空值多的列,合并前先清理:
df.dropna(subset=["key_col"], inplace=True)
真正卡住人的往往不是怎么合并,而是合并后发现 “金额” 列里混着字符串“-”、空格、甚至 Excel 的错误值 #N/A ——这些在单个文件里可能被忽略,一合并就全暴露了。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











