如果pdf本身自带文字层,直接全选复制就行。要是碰到扫描版pdf,或者复制出来是空白、乱码的情况,用pdfgear桌面版的ocr功能来提取文字最靠谱。下面的操作流程是按windows版pdfgear的界面写的,核心步骤就是打开文件、框选要识别的区域、最后导出文字结果。
第1步:打开待识别的 PDF
打开PDFgear之后,先点左侧的 Open File,导入你要提取文字的PDF。这里可以先简单判断下文件类型:要是页面上的文字能直接用鼠标选中,那直接复制就完事了;如果整页和图片一样,拖选选不中任何文字,基本就是扫描件,接着往下走OCR流程就行。

第2步:框选文字区域并执行 OCR
文件加载完成后,找到工具栏里的 OCR 点进去。这时候你可以在PDF页面上拖动画一个识别框,尽量只圈住要提取的正文部分,别把页眉、页脚、水印、装饰图这些无关内容也框进去。选好区域之后点右下角的 Done,软件就会启动识别,要是框选的范围太大,最后识别结果里很容易混进去很多没用的零碎短句。

第3步:复制文字或保存为文本文件
识别结束后会自动弹出 Extract Text 窗口,右边显示的就是刚提取出来的文字。如果只是临时要用,想直接粘贴到Word、微信或者邮件里,点 Copy text to clipboard 就好;要是需要长期留存,点 Save 就能导出成TXT文本文件。这时候可以顺手扫一眼段落断行和标题层级,要是发现错字很多,退回到上一步把识别范围缩小点重新跑一遍,比直接整页强识别出来的结果要干净得多。

等你看到右边的文本框里已经生成了可直接编辑的段落,就说明这份PDF的文字已经提取完成了。之后不管是粘贴到Word里继续整理,还是另存为TXT文件归档,都可以直接从这个结果窗口操作。











