excel读取慢的根源在于其zip+xml结构及默认加载全部样式对象,应启用read_only=true、清理合并单元格与空行,并优先改用csv/parquet格式。

Excel格式本身是 ZIP 容器,解析开销大
Excel(.xlsx)本质是一个 ZIP 压缩包,里面包含 XML 文件、样式表、公式定义、元数据等数十个组件。Python 读取时必须解压、逐个解析 XML 节点、重建单元格逻辑关系——这和 CSV 的纯文本流式读取有本质区别。CSV 只需按行切分、按分隔符拆字段,pandas.read_csv() 甚至能跳过解析直接 mmap 内存映射。
openpyxl 默认加载全部对象,内存与 CPU 双重负担
默认模式下,openpyxl.load_workbook() 会加载样式、字体、合并单元格、条件格式、图表、批注等全部信息,哪怕你只想要数值。这些对象在 Python 中是重量级实例,创建/销毁成本高。实测同一张 6.5 万行 × 25 列的表:read_only=True 模式耗时 0.4 秒,普通模式耗时 40.8 秒。
- 务必加
read_only=True(只读模式),禁用样式与对象加载 - 若用
pandas.read_excel(),底层仍调 openpyxl,所以同样受此影响 -
data_only=True可跳过公式重算,但仅对已缓存计算结果的文件有效
合并单元格、空行、隐藏列会触发全表扫描
Excel 中一个合并单元格(如 A1:C1)会让 openpyxl 在读取时反复回溯行列索引;空行空列、隐藏列、整列公式都会迫使解析器遍历无效区域。这不是“多读几行”的问题,而是触发 O(n²) 级别的坐标映射逻辑。有用户反馈:一张含 3 行 logo 图片 + 5 行合并标题的表,读取慢了 10 倍。
- 用 Excel 自带快捷键
Ctrl+G → 定位条件 → 对象/空值/公式清除所有非数据内容 - 取消全部合并单元格:
开始 → 合并后居中 → 取消合并 - 删除空白行/列,确保数据区紧贴左上角(A1 开始,无跳空)
真正快的方案不是“优化读取”,而是绕过 Excel
90% 的慢,根源不在 Python,而在你坚持用 Excel 当数据源。CSV 是为机器读写设计的,Excel 是为人眼设计的。只要业务允许,优先转成 CSV 或 Parquet:
-
xlsx2csv your.xlsx -o your.csv,再用pandas.read_csv()—— 实测提速 5~10 倍 - 超大文件(>100MB)直接导出为
Parquet,支持列裁剪、压缩、分区,pd.read_parquet()可秒开 - 如果必须保留在 Excel 流程中,建议只用 Excel 做最终交付,中间处理环节一律用 CSV/Parquet
最常被忽略的一点:Excel 文件里那些“看起来很专业”的格式、logo、多层标题,对程序全是噪音。删掉它们比调十个参数更有效。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











