用 pandas.read_excel() 处理不规则 excel 需组合 skiprows、header、skipfooter 跳过说明行和汇总行;replace+dropna 清空行;列名标准化去空格/全角空格/重复;数值列用 to_numeric(..., errors="coerce") 安全转换。

用 pandas.read_excel() 读取时跳过空行和标题行
不规则 Excel 常见于报表导出:前几行是单位、日期、说明,真正数据从第 N 行开始,中间还夹杂空行或合并单元格。直接 pd.read_excel("file.xlsx") 会把说明当列名,或把空行当数据。
关键参数是 skiprows 和 skipfooter。先用 Excel 手动确认真实数据起始行号(比如第 6 行,索引从 0 算就是 skiprows=5),再用 header=0 让 pandas 把第一行当列名:
df = pd.read_excel("report.xlsx", skiprows=5, header=0)
如果末尾有汇总行,加 skipfooter=1(需配合 engine="openpyxl",因 xlrd 已不支持新格式):
df = pd.read_excel("report.xlsx", skiprows=5, header=0, skipfooter=1, engine="openpyxl")
- 不要依赖
header=None后手动设列名——合并单元格会导致列名错位 -
skiprows接收整数或列表,如前 3 行+第 7 行是干扰行,可写skiprows=[0,1,2,6] - 遇到“列名跨两行”的情况,先用
header=[0,1]读成 MultiIndex,再用df.columns = df.columns.map(' '.join)合并
识别并删除空行、全 NaN 行
即使跳过了开头说明,Excel 中仍常有隔行空行或“——”占位符,read_excel() 会把它们读成全 NaN 或空字符串行。这类行不能靠 df.dropna() 默认行为删掉——默认只删所有列都为 NaN 的行,而实际可能某列是空字符串 "" 或字符串 " "。
稳妥做法是先统一转空值,再按行判断:
df = df.replace(r"^\s*$", np.nan, regex=True) # 把纯空白字符串变 NaN<br>df = df.dropna(how="all") # 删掉所有列都是 NaN 的行
- 必须用
regex=True,否则^$不生效 -
how="all"是关键,避免误删某列有数据但其他列为空的合法行 - 如果存在字符串
"N/A"、"-"等占位符,一并在replace()中处理:replace({"N/A": np.nan, "-": np.nan})
处理列名重复、含不可见字符或空格
导出 Excel 的列名常带前后空格、换行符、中文全角空格(\u3000)、甚至 Excel 自动追加的 .1 .2(因重复列名)。直接 df["销售量"] 会报 KeyError。
先标准化列名:
df.columns = df.columns.str.strip().str.replace(r"[\r\n\u3000\s]+", " ", regex=True).str.replace(" ", "_")
再检查是否还有重复:
print(df.columns[df.columns.duplicated()])
-
str.strip()只清两端,中间空格需用正则替换 - 全角空格
\u3000很隐蔽,复制粘贴到代码里也看不见,务必包含在正则中 - 如果列名含斜杠
/、括号等,在后续存 CSV 或数据库时可能出问题,建议统一替换成下划线
用 applymap() 或 apply() 清洗每列数据类型
不规则 Excel 的同一列可能混着数字、字符串、百分比(如 "85%")、货币(如 "¥12,345.00"),pandas 默认全读成 object,无法计算或排序。
对数值列,别用 astype(float) 硬转——遇到 "-" 或空单元格就崩。改用 pd.to_numeric(..., errors="coerce"),自动把非法值转为 NaN:
df["销售额"] = pd.to_numeric(df["销售额"].str.replace(r"[¥,$%]", "", regex=True).str.replace(",", ""), errors="coerce")
对日期列,同理用 pd.to_datetime(..., errors="coerce"),别信 infer_datetime_format=True——不规则数据格式混乱,反而容易误判。
-
str.replace()必须链式调用在字符串列上,若列含数字会报错,先用df[col] = df[col].astype(str)强制转串(但注意nan会变字符串"nan",需提前fillna("")) - 百分比列除以 100,货币列去掉符号和逗号后再转数值,这些步骤必须写死,不能依赖自动推断
- 清洗后立刻用
df.info()看各列 dtype,确认object是否已减少——残留的object列大概率还有脏数据没扫干净
清洗真正的难点不在代码多寡,而在每次 Excel 导出规则都可能微调:标题行下移一行、新增一列、百分比符号从 % 换成 百分比。所以清洗逻辑要拆成独立函数,每份新文件先人工抽样看前 20 行,再对应调整 skiprows 和正则模式。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











