So konvertieren Sie PDFs mit PyMuPDFM und seiner Auswertung in Markdown-Python-Tutorial-php.cn

Heim

Backend-Entwicklung

Python-Tutorial

So konvertieren Sie PDFs mit PyMuPDFM und seiner Auswertung in Markdown

Linda Hamilton

Oct 07, 2024 pm 06:12 PM

PyMuPDF4LLM ist eine Bibliothek zum Konvertieren von PDFs in das Markdown-Format. Hier teile ich meine Erfahrungen beim Testen dieser Bibliothek.

Installation

Beginnen Sie mit der Installation der Bibliothek mit dem folgenden Befehl:


pip install pymupdf4llm

Verwendung

Die grundlegende Verwendung ist recht einfach: Es sind nur drei Codezeilen erforderlich, um eine PDF-Datei in Markdown zu konvertieren:


import pymupdf4llm
md_text = pymupdf4llm.to_markdown("input.pdf")
print(md_text)

Sie können Argumente angeben, um anzupassen, wie Inhalte extrahiert werden.

Text nach Seite extrahieren

Standardmäßig wird das gesamte PDF in eine einzige Textausgabe konvertiert. Sie können jedoch Text Seite für Seite extrahieren, indem Sie page_chunks=True.

angeben


md_text = pymupdf4llm.to_markdown("input.pdf", page_chunks=True)

Bilder extrahieren

Um Bilder als Dateien zu extrahieren, verwenden Sie die Option write_images=True:


md_text = pymupdf4llm.to_markdown("input.pdf", write_images=True)

Es ist auch möglich, Bilder mithilfe der Base64-Kodierung direkt in den Markdown einzubetten:


md_text = pymupdf4llm.to_markdown("input.pdf", embed_images=True)

Auswertung der Conversion-Ergebnisse

Zum Testen wurden verschiedene PDFs mit unterschiedlichen Markdown-Elementen verwendet.

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation

Header-Konvertierung

Header werden korrekt in das Markdown-Format konvertiert. Hier ist ein Teil des Ergebnisses:


# Sample Markdown Guide

This is a sample markdown file that includes various features for quick reference.

## 1. Headers

...

## 3. Lists

Fetter und kursiver Text

Fett- und kursive Formatierungen werden ebenfalls ordnungsgemäß konvertiert:


**Bold: **Bold Text****

_Italic: *Italic Text*_

**_Bold and Italic: ***Bold and Italic***_**

Listenkonvertierung

Geordnete Listen auf der ersten Ebene werden ohne Probleme konvertiert, verschachtelte Listen und ungeordnete Listen werden jedoch nicht korrekt konvertiert.

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


## 3. Lists

### Unordered List

Item 1

Item 2

Sub-item 1

Sub-item 2

### Ordered List

1. First item

2. Second item

1. Sub-item A

2. Sub-item B

Linkkonvertierung

Die URLs von Links werden extrahiert, aber die gesamte Zeile, die den Link enthält, wird zu einem Hyperlink, was vom ursprünglichen Format abweicht.

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


## 4. Links and Images

[You can add links using [Link Text](URL).](https://www.example.com/)

Bildextraktion

Bilder werden standardmäßig nicht extrahiert, können aber mit write_images=True lokal gespeichert werden.


md_text = pymupdf4llm.to_markdown("input.pdf", write_images=True)

Die gespeicherten Bilder werden dann im Markdown wie folgt referenziert:


<p>### Image Example</p>

<p>![](input.pdf-1-0.png)</p>

Tabellenkonvertierung

Einfache Tabellen ohne vertikale Ränder werden nicht genau konvertiert (wahrscheinlich, weil mehrdeutige Spaltengrenzen dazu führen, dass Tabellen als einfacher Text behandelt werden).

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


<p>## 5. Tables</p>

<p>**Column 1** **Column 2** **Column 3**</p>

<p>Row 1 Data A Data B</p>

<p>Row 2 Data C Data D</p>

Codekonvertierung

Codeblöcke werden korrekt konvertiert, die Sprachspezifikation (z. B. Python) bleibt jedoch nicht erhalten. Bei der Inline-Codekonvertierung gibt es ebenfalls Probleme.

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


<p>## 6. Code</p>

<p>### Inline Code</p>

<p>Use backticks for inline code: print("Hello, world!")</p>

<p>### Code Block</p>

<p>Use triple backticks for code blocks:</p>

<p>```<br>
def greet(name):<br>
  return f"Hello, {name}!"<br>
print(greet("Markdown"))<br>
```</p>

Mehrzeiliger Text

Bei mehrzeiligem Text bleiben die Zeilenumbrüche so erhalten, wie sie im Original-PDF erscheinen.

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


<p>Markdown is a lightweight and versatile markup language favored by developers, writers, and bloggers alike</p>

<p>due to its simplicity in formatting text, enabling users to create readable and well-structured documents—</p>

<p>whether for documentation, blog posts, or articles—without the complexity of HTML, while also offering the</p>

<p>ability to convert content seamlessly into other formats like HTML, PDF, and even slideshows, making it an</p>

<p>ideal choice for projects that require both clarity and flexibility in presentation.</p>

Fazit

Trotz der Herausforderungen bei der genauen Konvertierung von Listen und Links ist PyMuPDF4LLM ein nützliches Tool zum Konvertieren von PDFs in Markdown. Es kann lokal ohne die Notwendigkeit externer Sprachmodelle arbeiten und eignet sich daher für Umgebungen, in denen kein Internetzugang verfügbar ist.

Das obige ist der detaillierte Inhalt vonSo konvertieren Sie PDFs mit PyMuPDFM und seiner Auswertung in Markdown. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Stellungnahme

Der Inhalt dieses Artikels wird freiwillig von Internetnutzern beigesteuert und das Urheberrecht liegt beim ursprünglichen Autor. Diese Website übernimmt keine entsprechende rechtliche Verantwortung. Wenn Sie Inhalte finden, bei denen der Verdacht eines Plagiats oder einer Rechtsverletzung besteht, wenden Sie sich bitte an admin@php.cn

Verwandter Artikel

Der Hauptzweck von Python: Flexibilität und BenutzerfreundlichkeitApr 17, 2025 am 12:14 AM

Die Flexibilität von Python spiegelt sich in Multi-Paradigm-Unterstützung und dynamischen Typsystemen wider, während eine einfache Syntax und eine reichhaltige Standardbibliothek stammt. 1. Flexibilität: Unterstützt objektorientierte, funktionale und prozedurale Programmierung und dynamische Typsysteme verbessern die Entwicklungseffizienz. 2. Benutzerfreundlichkeit: Die Grammatik liegt nahe an der natürlichen Sprache, die Standardbibliothek deckt eine breite Palette von Funktionen ab und vereinfacht den Entwicklungsprozess.

Python: Die Kraft der vielseitigen ProgrammierungApr 17, 2025 am 12:09 AM

Python ist für seine Einfachheit und Kraft sehr beliebt, geeignet für alle Anforderungen von Anfängern bis hin zu fortgeschrittenen Entwicklern. Seine Vielseitigkeit spiegelt sich in: 1) leicht zu erlernen und benutzten, einfachen Syntax; 2) Reiche Bibliotheken und Frameworks wie Numpy, Pandas usw.; 3) plattformübergreifende Unterstützung, die auf einer Vielzahl von Betriebssystemen betrieben werden kann; 4) Geeignet für Skript- und Automatisierungsaufgaben zur Verbesserung der Arbeitseffizienz.

Python in 2 Stunden am Tag lernen: Ein praktischer LeitfadenApr 17, 2025 am 12:05 AM

Ja, lernen Sie Python in zwei Stunden am Tag. 1. Entwickeln Sie einen angemessenen Studienplan, 2. Wählen Sie die richtigen Lernressourcen aus, 3. Konsolidieren Sie das durch die Praxis erlernte Wissen. Diese Schritte können Ihnen helfen, Python in kurzer Zeit zu meistern.

Python gegen C: Vor- und Nachteile für EntwicklerApr 17, 2025 am 12:04 AM

Python eignet sich für eine schnelle Entwicklung und Datenverarbeitung, während C für hohe Leistung und zugrunde liegende Kontrolle geeignet ist. 1) Python ist einfach zu bedienen, mit prägnanter Syntax, und eignet sich für Datenwissenschaft und Webentwicklung. 2) C hat eine hohe Leistung und eine genaue Kontrolle und wird häufig bei der Programmierung von Spielen und Systemen verwendet.

Python: zeitliches Engagement und LerntempoApr 17, 2025 am 12:03 AM

Die Zeit, die zum Erlernen von Python erforderlich ist, variiert von Person zu Person, hauptsächlich von früheren Programmiererfahrungen, Lernmotivation, Lernressourcen und -methoden und Lernrhythmus. Setzen Sie realistische Lernziele und lernen Sie durch praktische Projekte am besten.

Python: Automatisierung, Skript- und AufgabenverwaltungApr 16, 2025 am 12:14 AM

Python zeichnet sich in Automatisierung, Skript und Aufgabenverwaltung aus. 1) Automatisierung: Die Sicherungssicherung wird durch Standardbibliotheken wie OS und Shutil realisiert. 2) Skriptschreiben: Verwenden Sie die PSUTIL -Bibliothek, um die Systemressourcen zu überwachen. 3) Aufgabenverwaltung: Verwenden Sie die Zeitplanbibliothek, um Aufgaben zu planen. Die Benutzerfreundlichkeit von Python und die Unterstützung der reichhaltigen Bibliothek machen es zum bevorzugten Werkzeug in diesen Bereichen.

Python und Zeit: Machen Sie das Beste aus Ihrer StudienzeitApr 14, 2025 am 12:02 AM

Um die Effizienz des Lernens von Python in einer begrenzten Zeit zu maximieren, können Sie Pythons DateTime-, Zeit- und Zeitplanmodule verwenden. 1. Das DateTime -Modul wird verwendet, um die Lernzeit aufzuzeichnen und zu planen. 2. Das Zeitmodul hilft, die Studie zu setzen und Zeit zu ruhen. 3. Das Zeitplanmodul arrangiert automatisch wöchentliche Lernaufgaben.

Python: Spiele, GUIs und mehrApr 13, 2025 am 12:14 AM

Python zeichnet sich in Gaming und GUI -Entwicklung aus. 1) Spielentwicklung verwendet Pygame, die Zeichnungen, Audio- und andere Funktionen bereitstellt, die für die Erstellung von 2D -Spielen geeignet sind. 2) Die GUI -Entwicklung kann Tkinter oder Pyqt auswählen. Tkinter ist einfach und einfach zu bedienen. PYQT hat reichhaltige Funktionen und ist für die berufliche Entwicklung geeignet.

See all articles