Python解析並讀取PDF文件內容的方法-Python教學-PHP中文網

首頁

後端開發

Python教學

Python解析並讀取PDF文件內容的方法

不言

May 08, 2018 pm 02:20 PM

python內容文件

這篇文章主要介紹了Python解析並讀取PDF文件內容的方法,結合實例形式分別描述了Python2.7在win32與win64環境下實現讀取pdf的相關操作技巧,需要的朋友可以參考下

本文實例講述了Python解析並讀取PDF檔案內容的方法。分享給大家供大家參考，具體如下：

一、問題描述

利用python，去讀取pdf文字內容。

二、效果

三、運行環境

python2.7

#四、需要安裝的函式庫

pip install pdfminer

五、實作原始碼

#程式碼1（win64）

# coding=utf-8
import sys
reload(sys)
sys.setdefaultencoding(&#39;utf-8&#39;)
import time
time1=time.time()
import os.path
from pdfminer.pdfparser import PDFParser,PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LTTextBoxHorizontal,LAParams
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed
result=[]
class CPdf2TxtManager():
  def __init__(self):
    &#39;&#39;&#39;&#39;&#39;
    Constructor
    &#39;&#39;&#39;
  def changePdfToText(self, filePath):
    file = open(path, &#39;rb&#39;) # 以二进制读模式打开
    #用文件对象来创建一个pdf文档分析器
    praser = PDFParser(file)
    # 创建一个PDF文档
    doc = PDFDocument()
    # 连接分析器 与文档对象
    praser.set_document(doc)
    doc.set_parser(praser)
    # 提供初始化密码
    # 如果没有密码 就创建一个空的字符串
    doc.initialize()
    # 检测文档是否提供txt转换，不提供就忽略
    if not doc.is_extractable:
      raise PDFTextExtractionNotAllowed
    # 创建PDf 资源管理器 来管理共享资源
    rsrcmgr = PDFResourceManager()
    # 创建一个PDF设备对象
    laparams = LAParams()
    device = PDFPageAggregator(rsrcmgr, laparams=laparams)
    # 创建一个PDF解释器对象
    interpreter = PDFPageInterpreter(rsrcmgr, device)
    pdfStr = &#39;&#39;
    # 循环遍历列表，每次处理一个page的内容
    for page in doc.get_pages(): # doc.get_pages() 获取page列表
      interpreter.process_page(page)
      # 接受该页面的LTPage对象
      layout = device.get_result()
      for x in layout:
        if hasattr(x, "get_text"):
          # print x.get_text()
          result.append(x.get_text())
          fileNames = os.path.splitext(filePath)
          with open(fileNames[0] + &#39;.txt&#39;,&#39;wb&#39;) as f:
            results = x.get_text()
            print(results)
            f.write(results + &#39;\n&#39;)
if __name__ == &#39;__main__&#39;:
  &#39;&#39;&#39;&#39;&#39;
   解析pdf 文本，保存到txt文件中
  &#39;&#39;&#39;
  path = u&#39;C:/data3.pdf&#39;
  pdf2TxtManager = CPdf2TxtManager()
  pdf2TxtManager.changePdfToText(path)
  # print result[0]
  time2 = time.time()
  print u&#39;ok,解析pdf结束!&#39;
  print u&#39;总共耗时：&#39; + str(time2 - time1) + &#39;s&#39;

代碼2（win32）

# coding=utf-8
import sys
reload(sys)
sys.setdefaultencoding(&#39;utf-8&#39;)
import time
time1=time.time()
import os.path
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LAParams
from pdfminer.pdfpage import PDFTextExtractionNotAllowed
from pdfminer.pdfparser import PDFParser
from pdfminer.pdfdocument import PDFDocument
from pdfminer.pdfpage import PDFPage
result=[]
class CPdf2TxtManager():
  def __init__(self):
    &#39;&#39;&#39;&#39;&#39;
    Constructor
    &#39;&#39;&#39;
  def changePdfToText(self, filePath):
    file = open(path, &#39;rb&#39;) # 以二进制读模式打开
    #用文件对象来创建一个pdf文档分析器
    praser = PDFParser(file)
    # 创建一个PDF文档
    doc = PDFDocument(praser)
    # 检测文档是否提供txt转换，不提供就忽略
    if not doc.is_extractable:
      raise PDFTextExtractionNotAllowed
    # 创建PDf 资源管理器 来管理共享资源
    rsrcmgr = PDFResourceManager()
    # 创建一个PDF设备对象
    laparams = LAParams()
    device = PDFPageAggregator(rsrcmgr, laparams=laparams)
    # 创建一个PDF解释器对象
    interpreter = PDFPageInterpreter(rsrcmgr, device)
    pdfStr = &#39;&#39;
    # 循环遍历列表，每次处理一个page的内容
    for page in PDFPage.create_pages(doc): # doc.get_pages() 获取page列表
      interpreter.process_page(page)
      # 接受该页面的LTPage对象
      layout = device.get_result()
      for x in layout:
        if hasattr(x, "get_text"):
          # print x.get_text()
          result.append(x.get_text())
          fileNames = os.path.splitext(filePath)
          with open(fileNames[0] + &#39;.txt&#39;,&#39;wb&#39;) as f:
            results = x.get_text()
            print(results)
            f.write(results + &#39;\n&#39;)
if __name__ == &#39;__main__&#39;:
  &#39;&#39;&#39;&#39;&#39;
   解析pdf 文本，保存到txt文件中
  &#39;&#39;&#39;
  path = u&#39;C:/36.pdf&#39;
  pdf2TxtManager = CPdf2TxtManager()
  pdf2TxtManager.changePdfToText(path)
  # print result[0]
  time2 = time.time()
  print u&#39;ok,解析pdf结束!&#39;
  print u&#39;总共耗时：&#39; + str(time2 - time1) + &#39;s&#39;

相關推薦：

Python實作抓取HTML網頁並以PDF檔案形式儲存的方法

以上是Python解析並讀取PDF文件內容的方法的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

Python vs.C：申請和用例Apr 12, 2025 am 12:01 AM

Python适合数据科学、Web开发和自动化任务，而C 适用于系统编程、游戏开发和嵌入式系统。Python以简洁和强大的生态系统著称，C 则以高性能和底层控制能力闻名。

2小時的Python計劃：一種現實的方法Apr 11, 2025 am 12:04 AM

2小時內可以學會Python的基本編程概念和技能。 1.學習變量和數據類型，2.掌握控制流（條件語句和循環），3.理解函數的定義和使用，4.通過簡單示例和代碼片段快速上手Python編程。

Python：探索其主要應用程序Apr 10, 2025 am 09:41 AM

Python在web開發、數據科學、機器學習、自動化和腳本編寫等領域有廣泛應用。 1)在web開發中，Django和Flask框架簡化了開發過程。 2)數據科學和機器學習領域，NumPy、Pandas、Scikit-learn和TensorFlow庫提供了強大支持。 3)自動化和腳本編寫方面，Python適用於自動化測試和系統管理等任務。

您可以在2小時內學到多少python？Apr 09, 2025 pm 04:33 PM

兩小時內可以學到Python的基礎知識。 1.學習變量和數據類型，2.掌握控制結構如if語句和循環，3.了解函數的定義和使用。這些將幫助你開始編寫簡單的Python程序。

如何在10小時內通過項目和問題驅動的方式教計算機小白編程基礎？Apr 02, 2025 am 07:18 AM

如何在10小時內教計算機小白編程基礎？如果你只有10個小時來教計算機小白一些編程知識，你會選擇教些什麼�...

如何在使用 Fiddler Everywhere 進行中間人讀取時避免被瀏覽器檢測到？Apr 02, 2025 am 07:15 AM

使用FiddlerEverywhere進行中間人讀取時如何避免被檢測到當你使用FiddlerEverywhere...

Python 3.6加載Pickle文件報錯"__builtin__"模塊未找到怎麼辦？Apr 02, 2025 am 07:12 AM

Python3.6環境下加載Pickle文件報錯：ModuleNotFoundError:Nomodulenamed...

如何提高jieba分詞在景區評論分析中的準確性？Apr 02, 2025 am 07:09 AM

如何解決jieba分詞在景區評論分析中的問題？當我們在進行景區評論分析時，往往會使用jieba分詞工具來處理文�...

See all articles

熱AI工具

熱工具

SecLists

SecLists是最終安全測試人員的伙伴。它是一個包含各種類型清單的集合，這些清單在安全評估過程中經常使用，而且都在一個地方。 SecLists透過方便地提供安全測試人員可能需要的所有列表，幫助提高安全測試的效率和生產力。清單類型包括使用者名稱、密碼、URL、模糊測試有效載荷、敏感資料模式、Web shell等等。測試人員只需將此儲存庫拉到新的測試機上，他就可以存取所需的每種類型的清單。

Damn Vulnerable Web App (DVWA) 是一個PHP/MySQL的Web應用程序，非常容易受到攻擊。它的主要目標是成為安全專業人員在合法環境中測試自己的技能和工具的輔助工具，幫助Web開發人員更好地理解保護網路應用程式的過程，並幫助教師/學生在課堂環境中教授/學習Web應用程式安全性。 DVWA的目標是透過簡單直接的介面練習一些最常見的Web漏洞，難度各不相同。請注意，該軟體中