根本原因是pandas默认调用xlwt或旧版xlrd引擎,二者仅支持.xls格式且硬性限制65535行;改用openpyxl引擎并保存为.xlsx格式即可突破限制,因.xlsx支持1048576行。

to_excel 写入超过 65536 行时直接报错,不是数据有问题,是引擎选错了——默认用 xlwt 或老版 xlrd 引擎,它们只认 .xls 格式,硬性限制 65535 行。换用 openpyxl 引擎 + .xlsx 后缀,问题就解了。
为什么 to_excel 会卡在 65536 行?
根本原因是 Pandas 默认调用的 Excel 引擎不匹配文件格式:
- .xls 文件(Excel 2003 及以前)最大支持 65536 行(0~65535),这是二进制格式的硬限制
- .xlsx 文件(Excel 2007+)理论支持 1048576 行,但 Pandas 若没显式指定引擎,仍可能 fallback 到 xlwt(只写 .xls)或旧版 xlrd(读 .xlsx 也受限)
- 报错信息通常是 ValueError: row index was 65536, not allowed by .xls format 或 AssertionError: 0
用 openpyxl 引擎导出大表的实操要点
只需两步:装包 + 指定引擎和后缀
- 运行
pip install openpyxl(确保没装错成xlwt或旧xlrd) -
to_excel必须用.xlsx后缀,且显式传参engine='openpyxl' - 不要写
df.to_excel('data.xls', engine='openpyxl')—— 后缀仍是.xls,openpyxl 会拒绝写入或静默失败 - 示例正确写法:
df.to_excel('output.xlsx', engine='openpyxl', index=False)
读取超大 Excel 文件也得换引擎
如果 read_excel 读 10 万行 .xlsx 文件就报错,说明 Pandas 还在用默认 xlrd 引擎(哪怕文件是 .xlsx)
-
xlrd从 2.0 版起已弃用对 .xlsx 的支持,旧版本又强制限行;必须显式指定engine='openpyxl' - 正确读法:
pd.read_excel('big_data.xlsx', engine='openpyxl') - 注意:
openpyxl不支持读取 .xls 文件,若原始是 .xls 且无法重存,只能分块读或转 CSV
百万行以上别硬刚 Excel,优先考虑 CSV
openpyxl 能绕过行数限制,但性能会明显下降:写入 50 万行可能耗时数分钟,内存占用飙升,且 Excel 打开后极易卡死
- 纯数据交付场景,直接用
df.to_csv('data.csv', index=False)—— 没格式、无限制、秒级完成 - 需要保留多级索引/合并单元格等格式,再用
openpyxl;否则 CSV + Excel 手动套格式更稳 - 真要导百万行 Excel,建议分 sheet 写入:
df.iloc[i:i+100000].to_excel(..., sheet_name=f'Sheet_{i//100000}')
真正容易被忽略的是:引擎和后缀必须严格配套。写 .xlsx 却没写 engine='openpyxl',或写了引擎却保存为 .xls,都会回到原点。不是“装了 openpyxl 就自动生效”。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











