真正需要的是将html表格转为可复用、可查询、可导入其他工具的格式,关键步骤是提取→序列化→落盘;推荐优先使用pd.read_html()自动提取清洗为dataframe,再导出csv/excel/sqlite。

直接保存 HTML 源码里的 <table> 元素本身不等于“保存表格数据”——你真正需要的,是把表格的结构和内容转成可复用、可查询、可导入其他工具(比如 Excel、数据库)的格式。关键在于:先提取,再序列化,最后落盘。<h3>用 <code>pd.read_html() 一键提取并转 DataFrame
这是最省事、也最容易被低估的方案。Pandas 内置的 pd.read_html() 不是解析器,而是一个“表格识别+自动清洗”管道,能跳过 DOM 遍历、自动忽略广告栏/嵌套表、处理空单元格,并直接返回 list of DataFrame。
- 它默认用
lxml或html5lib解析,比纯BeautifulSoup更鲁棒(尤其对 malformed HTML) - 不支持 JavaScript 渲染的表格;若页面是动态加载,得先用
Selenium获取渲染后 HTML,再喂给pd.read_html() - 常见失败原因:目标页没
<table> 标签(比如用 <code><div> + CSS 模拟表格),或表格被 <code>display: none隐藏 - 示例:
import pandas as pd dfs = pd.read_html("https://example.com/page", header=0, skiprows=0) df = dfs[0] # 选第一个表 df.to_csv("table.csv", index=False, encoding="utf-8-sig") - 正确做法:优先用
cell.decode_contents()(保留内联标签如<sup></sup>、<br>),再按需清洗 - 遇到
rowspan/colspan:必须手动维护坐标偏移,find_all('tr')后不能直接按行索引,得模拟渲染逻辑 - 编码问题常源于响应头缺失
charset,建议显式指定解析器:BeautifulSoup(html, 'html.parser', from_encoding='utf-8') - 别用
strip()处理含空格的字段(如地址、代码),改用re.sub(r'\s+', ' ', text).strip() - 推荐方案:用
pandas.DataFrame.to_sql(),它会自动建表、适配 dtype(数值列推为REAL,全数字字符串也可能被误判) - 若必须手写 SQL,先用第一行当列名生成 DDL:
columns = [re.sub(r'[^a-zA-Z0-9_]', '_', h) for h in headers],避免空格和特殊字符 - SQLite 不支持
ALTER COLUMN,后续加列只能ALTER TABLE ADD COLUMN,且无法指定位置;建议初期预留extra_data TEXT字段存 JSON 化的扩展字段 - 中文导出乱码?不是编码问题,是 Excel 默认用系统 locale 解析 CSV;用
.xlsx格式替代.csv,并指定引擎:df.to_excel("out.xlsx", engine="openpyxl") - 日期列变数字?确保原始数据是
datetime64类型,或加参数:date_format="YYYY-MM-DD" - 想保留超链接?
openpyxl支持,但df中对应列必须是dict格式:{"value": "点击", "url": "https://..."},再用worksheet.write_url()手动写 - 大表(>10 万行)导出慢?关闭
index=True,并考虑分块写入或改用parquet格式作中间存储
用 BeautifulSoup 手动提取时,get_text(strip=True) 不够用
很多人卡在中文乱码、换行符残留、合并单元格丢失、<span></span> 嵌套导致文本截断——根本原因是 cell.get_text() 只做扁平化拼接,不保留语义结构。
存 SQLite 前,别急着建固定列名的表
网页表格列数/列名经常变动(比如月报新增一列“同比增幅”),硬写 CREATE TABLE ... (Col1 TEXT, Col2 TEXT) 会导致插入失败或数据错位。
导出 Excel 时,to_excel() 的隐藏陷阱
表面看只是改个后缀名,但实际涉及字体、日期格式、超链接、合并单元格等渲染细节,稍不注意就变成“能打开但打不开原意”。
真正难的不是“怎么保存”,而是判断这张表到底属于哪一类:是带样式的报表(需保留格式)、带计算逻辑的业务表(需还原公式含义)、还是纯粹的数据快照(只关心字段对齐)。选错路径,后面所有清洗和存储都会事倍功半。











