pdf解析需先判别类型:用pdfinfo和pdfplumber.chars密度判断文本型或扫描型;文本型优先用extract_words保留布局,表格用extract_table;扫描型需dpi=300转图+预处理+psm 6+chi_sim ocr;字段提取应基于锚点坐标偏移,而非硬编码正则。

PDF 解析不是“读个文件”那么简单——直接用 open() 只能得到乱码,而盲目套用 OCR 工具又容易在纯文本 PDF 上白白拖慢速度、引入识别噪声。关键得先判断 PDF 类型,再选对工具链。
怎么快速判断 PDF 是文本型还是扫描型?
别急着上 PyPDF2 或 pdfplumber,先用命令行或 Python 快速探查结构:
- 终端执行
pdfinfo your_file.pdf,看输出里是否有Pages:但无Tagged:或Form:字段——这还不够,继续验证 - Python 中用
PyPDF2.PdfReader打开后调用reader.pages[0].extract_text(),如果返回空字符串或极短内容(如仅换行符),大概率是图像型 - 更稳的方法:用
pdfplumber.open()加page.chars检查字符密度——若len(page.chars) 且页面宽度 > 500,基本可判定为扫描件
纯文本 PDF 提取字段:别只依赖 extract_text()
PyPDF2 和 pdfplumber 的 extract_text() 默认会抹平换行、合并空格、丢弃坐标信息,导致“姓名:张三 电话:138…”被压成一行,正则难匹配。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
- 优先用
pdfplumber的page.extract_words(x_tolerance=2, y_tolerance=2)获取带位置的词列表,再按 y 坐标分块,保留原始排版逻辑 - 对齐式表格(如发票明细)必须用
page.extract_table(),而非文本提取——它能识别线框和空白分隔,PyPDF2完全不支持此功能 - 中文 PDF 要显式指定
use_text_flow=True(pdfplumber v0.7+),否则竖排或复杂字体下文字顺序错乱
扫描型 PDF 怎么避免 OCR 翻车?
用 pytesseract 直接喂整页图,小字号、表格线、水印都会让识别率断崖下跌。
- 先用
pdf2image.convert_from_path()转图,分辨率设为dpi=300(低于 200 会漏字,高于 400 内存暴涨) - 对每张图做预处理:
cv2.threshold()二值化 +cv2.medianBlur()去噪,特别针对公章遮挡区域做局部裁剪再识别 - OCR 时传参
config='--psm 6 -l chi_sim':psm 6 表示“假设为单块均匀文本”,比默认 psm 3 更稳;-l chi_sim必须显式指定简体中文模型,否则默认英文 - 识别后立刻用规则过滤:比如身份证号校验用
re.match(r'^\d{17}[\dXx]$', text),电话号用\b1[3-9]\d{9}\b,剔除 OCR 常见错字(如“O”当“0”、“l”当“1”)
字段定位不稳定?试试基于布局锚点的相对提取
硬写正则找“金额:(.+?)元”在不同模板中极易失效——发票可能写“金额(¥)”,合同可能写“本合同总金额为”。
- 先定位强锚点:如固定文字“收款人:”、图标(用
page.chars找连续的 “★” 或 “■”)、或表格标题行(含“序号”“名称”“单价”等关键词) - 以锚点坐标为原点,用偏移量提取邻近字段:例如找到“金额:”右侧 20px、同一行 y±5px 范围内的所有
word,拼接后去空格 - 对多页文档,锚点位置可能偏移,建议用第一页训练偏移范围,后续页动态校准(如计算“供应商”字段 y 坐标标准差,超 3px 就重搜)
最麻烦的永远不是“能不能提”,而是“换一份 PDF 格式就崩”。实际项目里,80% 的维护成本花在应对新模板的微小差异上——加一个空格、换一种分割线、改个字体粗细,都可能让基于坐标的提取逻辑失效。留好日志,把每一步的中间结果(坐标、OCR 原文、正则匹配片段)打出来,比写完美代码重要得多。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










