如何使用Python使用PDF文档-Python教程-PHP中文网

首页

后端开发

Python教程

如何使用Python使用PDF文档

Joseph Gordon-Levitt

Mar 02, 2025 am 09:54 AM

How to Work With PDF Documents Using Python

PDF 文件因其跨平台兼容性而广受欢迎，内容和布局在不同操作系统、阅读设备和软件上保持一致。然而，与 Python 处理纯文本文件不同，PDF 文件是二进制文件，结构更复杂，包含字体、颜色和图像等元素。

幸运的是，借助 Python 的外部模块，处理 PDF 文件并非难事。本文将使用 PyPDF2 模块演示如何打开 PDF 文件、打印页面和提取文本。关于 PDF 文件的创建和编辑，请参考我的另一篇教程。

准备工作

核心在于使用外部模块 PyPDF2。首先，使用 pip 安装它：

pip 是 Python 的包管理系统，用于安装和管理 Python 软件包，许多包可在 Python 包索引 (PyPI) 中找到。

如果您是从 python.org 下载的 Python，pip 很可能已自动安装。在终端输入以下命令安装 PyPDF2：

pip install PyPDF2

要使用 PyPDF2 的全部功能（包括加密、解密和图像处理），可以使用以下命令：

pip install PyPDF2[full]

如果您只需要 AES 加密/解密功能，则可以使用：

pip install PyPDF2[crypto]

PyPDF2 默认支持 RC4 加密。

PyPDF2 基础

PyPDF2 是一个免费开源库，支持 PDF 文件的读取、写入、分割和合并等操作。本教程使用 PyPDF2 版本 2.11.1。

读取 PDF 文件

我们将使用 Project Gutenberg 上的《美女与野兽》PDF 版本作为示例文件。您可以下载该文件或使用任何其他 PDF 文件。

以下代码演示如何打开并读取 PDF 文件：

import PyPDF2

with open('beauty-and-the-beast.pdf', 'rb') as book:
    book_reader = PyPDF2.PdfReader(book)

第一行导入 PyPDF2 模块。PdfReader 类用于读取 PDF 文件，并将其页面表示为 Page 对象。

获取页面数量：

import PyPDF2

with open('beauty-and-the-beast.pdf', 'rb') as book:
    book_reader = PyPDF2.PdfReader(book)
    number_of_pages = len(book_reader.pages)
    print(number_of_pages)  # 输出：48

直接访问页面编号

get_page_number() 方法可获取页面的编号：

import random
from PyPDF2 import PdfReader

with open('beauty-and-the-beast.pdf', 'rb') as book:
    book_reader = PdfReader(book)
    page_list = book_reader.pages
    last_page = page_list[-1]
    print(book_reader.get_page_number(last_page))  # 输出：47 (实际为第48页)
    some_page = page_list[random.randint(15, 35)]
    print(book_reader.get_page_number(some_page))  # 输出：随机页码

页面模式和页面布局

page_mode 和 page_layout 属性分别返回页面模式和页面布局信息：

from PyPDF2 import PdfReader

with open('beauty-and-the-beast.pdf', 'rb') as book:
    book_reader = PdfReader(book)
    print(book_reader.page_mode)  # 输出：None
    print(book_reader.page_layout)  # 输出：None

metadata 属性返回 PDF 文件的元数据，例如作者、标题、创建时间和生成器等信息：

from PyPDF2 import PdfReader

with open('beauty-and-the-beast.pdf', 'rb') as book:
    book_reader = PdfReader(book)
    book_metadata = book_reader.metadata
    print(book_metadata.title)       # 输出：Beauty and the Beast
    print(book_metadata.author)      # 输出：Anonymous
    print(book_metadata.creation_date) # 输出：例如 2006-11-30 01:13:00-08:00
    print(book_metadata.producer)    # 输出：例如 pdfeTeX-1.21a

总结

Python 通过 PyPDF2 模块简化了 PDF 文件的处理。本文仅介绍了 PyPDF2 的部分功能，更多细节请参考 PyPDF2 官方文档。

以上是如何使用Python使用PDF文档的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

Python与C：学习曲线和易用性Apr 19, 2025 am 12:20 AM

Python更易学且易用，C 则更强大但复杂。1.Python语法简洁，适合初学者，动态类型和自动内存管理使其易用，但可能导致运行时错误。2.C 提供低级控制和高级特性，适合高性能应用，但学习门槛高，需手动管理内存和类型安全。

Python vs. C：内存管理和控制Apr 19, 2025 am 12:17 AM

Python和C 在内存管理和控制方面的差异显着。 1.Python使用自动内存管理，基于引用计数和垃圾回收，简化了程序员的工作。 2.C 则要求手动管理内存，提供更多控制权但增加了复杂性和出错风险。选择哪种语言应基于项目需求和团队技术栈。

科学计算的Python：详细的外观Apr 19, 2025 am 12:15 AM

Python在科学计算中的应用包括数据分析、机器学习、数值模拟和可视化。1.Numpy提供高效的多维数组和数学函数。2.SciPy扩展Numpy功能，提供优化和线性代数工具。3.Pandas用于数据处理和分析。4.Matplotlib用于生成各种图表和可视化结果。

Python和C：找到合适的工具Apr 19, 2025 am 12:04 AM

选择Python还是C 取决于项目需求：1)Python适合快速开发、数据科学和脚本编写，因其简洁语法和丰富库；2)C 适用于需要高性能和底层控制的场景，如系统编程和游戏开发，因其编译型和手动内存管理。

数据科学和机器学习的PythonApr 19, 2025 am 12:02 AM

Python在数据科学和机器学习中的应用广泛，主要依赖于其简洁性和强大的库生态系统。1）Pandas用于数据处理和分析，2）Numpy提供高效的数值计算，3）Scikit-learn用于机器学习模型构建和优化，这些库让Python成为数据科学和机器学习的理想工具。

学习Python：2小时的每日学习是否足够？Apr 18, 2025 am 12:22 AM

每天学习Python两个小时是否足够？这取决于你的目标和学习方法。1)制定清晰的学习计划，2)选择合适的学习资源和方法，3)动手实践和复习巩固，可以在这段时间内逐步掌握Python的基本知识和高级功能。

Web开发的Python：关键应用程序Apr 18, 2025 am 12:20 AM

Python在Web开发中的关键应用包括使用Django和Flask框架、API开发、数据分析与可视化、机器学习与AI、以及性能优化。1.Django和Flask框架：Django适合快速开发复杂应用，Flask适用于小型或高度自定义项目。2.API开发：使用Flask或DjangoRESTFramework构建RESTfulAPI。3.数据分析与可视化：利用Python处理数据并通过Web界面展示。4.机器学习与AI：Python用于构建智能Web应用。5.性能优化：通过异步编程、缓存和代码优