
本文介绍如何使用现代 pandas(≥1.2.0)和 openpyxl 引擎,安全、高效地从现有 excel 文件(.xlsx/.xls)中读取全部工作表为 dataframe,并支持后续合并保存——彻底替代已弃用的 xlwt 和旧式 excelfile 用法。
本文介绍如何使用现代 pandas(≥1.2.0)和 openpyxl 引擎,安全、高效地从现有 excel 文件(.xlsx/.xls)中读取全部工作表为 dataframe,并支持后续合并保存——彻底替代已弃用的 xlwt 和旧式 excelfile 用法。
自 pandas 1.2.0 起,xlwt 引擎已被正式弃用,且 pd.ExcelFile 在仅安装 openpyxl(而非 xlrd)时无法处理 .xls 文件,导致常见报错:ValueError: No engine for filetype: 'xls'。根本解决方案是统一使用 openpyxl(支持 .xlsx)或 xlrd==1.2.0(仅限 .xls,注意:xlrd ≥2.0 已移除 xls 支持),并避免依赖已淘汰的 ExcelFile 迭代模式。
✅ 推荐做法:直接使用 pd.read_excel() 的 sheet_name=None 参数,一行代码即可将整个工作簿所有表读为字典(键为表名,值为 DataFrame):
import pandas as pd
# 一次性读取所有工作表 → 返回 dict[str, pd.DataFrame]
all_sheets = pd.read_excel("Workbook1.xlsx", sheet_name=None, engine="openpyxl")
# 示例:获取第一个表数据(按原始顺序)
df_sheet1 = list(all_sheets.values())[0]
# 或按表名访问:
# df_sheet1 = all_sheets["Sheet1"]
⚠️ 注意事项:
- .xlsx 文件默认使用 openpyxl 引擎(需 pip install openpyxl);
- .xls 文件必须使用 xlrd==1.2.0(pip install "xlrd==1.2.0"),新版 xlrd 不再支持 xls;
- sheet_name=None 是最简洁、最健壮的方式,无需手动遍历 sheet_names;
- 避免生成中间 .xls 文件(如 df.to_excel("sheet1.xls")),既不必要又易触发引擎错误;所有操作应在内存中完成。
? 完整工作流示例(读取 → 处理 → 合并保存):
import pandas as pd
import time
# 1. 读取全部工作表(返回字典)
workbook_data = pd.read_excel("Workbook1.xlsx", sheet_name=None, engine="openpyxl")
# 2. 对每个 DataFrame 进行个性化处理(示例:添加来源列)
processed_dfs = {}
for sheet_name, df in workbook_data.items():
df_processed = df.copy()
df_processed["source_sheet"] = sheet_name # 标记来源
# ✅ 此处插入您的业务逻辑(清洗、计算、过滤等)
processed_dfs[sheet_name] = df_processed
# 3. 合并写入新工作簿(自动按原表名分页)
output_file = f"New_Workbook_{time.strftime('%m-%d-%Y')}.xlsx"
with pd.ExcelWriter(output_file, engine="openpyxl") as writer:
for sheet_name, df in processed_dfs.items():
df.to_excel(writer, sheet_name=sheet_name, index=False)
print(f"✅ 已成功生成:{output_file}")
? 总结:
- 永远优先使用 sheet_name=None 替代 ExcelFile + 循环 read_excel;
- 明确指定 engine 参数("openpyxl" 或 "xlrd")可提升兼容性与可维护性;
- 中间文件(如 .xls)不仅冗余,还可能因引擎缺失导致失败——内存操作更可靠、更高效。
遵循以上实践,即可无缝迁移旧脚本,适配当前 pandas 生态。











