


Artikel ini menerangkan cara menggunakan sup yang indah, perpustakaan python, untuk menghuraikan html. Ia memperincikan kaedah biasa seperti mencari (), find_all (), pilih (), dan get_text () untuk pengekstrakan data, pengendalian struktur dan kesilapan HTML yang pelbagai, dan alternatif (sel
Bagaimana saya menggunakan sup yang indah untuk menghuraikan html?
Sup Cantik adalah perpustakaan Python yang direka untuk menghuraikan dokumen HTML dan XML. Ia mewujudkan pokok parse dari HTML yang diberikan, membolehkan anda dengan mudah menavigasi, mencari, dan mengubah suai data. Untuk menggunakannya, anda perlu memasangnya menggunakan PIP: pip install beautifulsoup4
. Kemudian, anda boleh mengimportnya ke dalam skrip Python anda dan menggunakannya untuk menghuraikan kandungan HTML. Inilah contoh asas:
<code class="python">from bs4 import BeautifulSoup import requests # Fetch the HTML content (replace with your URL) url = "https://www.example.com" response = requests.get(url) response.raise_for_status() # Raise HTTPError for bad responses (4xx or 5xx) html_content = response.content # Parse the HTML soup = BeautifulSoup(html_content, "html.parser") # Now you can use soup to navigate and extract data print(soup.title) # Prints the title tag print(soup.find_all("p")) # Prints all paragraph tags</code>
Kod ini pertama kali mengambil HTML dari URL menggunakan Perpustakaan requests
(anda perlu memasangnya secara berasingan dengan pip install requests
). Ia kemudian menggunakan pembina BeautifulSoup
untuk menghuraikan kandungan HTML, menyatakan "html.parser" sebagai parser. Akhirnya, ia menunjukkan mengakses tag <title></title>
dan mencari semua <p></p>
tag. Ingatlah untuk mengendalikan pengecualian yang berpotensi seperti kesilapan rangkaian ( requests.exceptions.RequestException
) dengan sewajarnya dalam persekitaran pengeluaran.
Apakah kaedah sup yang paling biasa untuk mengekstrak data dari HTML?
Sup yang indah menawarkan satu set kaedah yang kaya untuk menavigasi dan mengekstrak data. Sebahagian yang paling biasa termasuk:
-
find()
danfind_all()
: Ini adalah kerja -kerja sup yang indah.find()
Mengembalikan tag pertama yang sepadan dengan kriteria yang ditentukan, manakalafind_all()
mengembalikan senarai semua tag yang sepadan. Kriteria boleh menjadi nama tag (misalnya, "p", "a"), atribut (misalnya, {"class": "my-class", "id": "my-id"}), atau gabungan kedua-duanya. Anda juga boleh menggunakan ungkapan biasa untuk padanan yang lebih kompleks. -
select()
: Kaedah ini menggunakan pemilih CSS untuk mencari tag. Ini adalah cara yang kuat dan ringkas untuk menargetkan unsur -unsur tertentu, terutamanya apabila berurusan dengan struktur HTML yang kompleks. Sebagai contoh,soup.select(".my-class p")
akan mendapati semua<p></p>
tag dalam elemen yang mempunyai kelas "my-class". -
get_text()
: Kaedah ini mengekstrak kandungan teks tag dan keturunannya. Ia tidak ternilai untuk mendapatkan teks sebenar dari elemen HTML. -
attrs
: Atribut ini menyediakan akses kepada atribut tag sebagai kamus. Sebagai contoh,tag["href"]
akan mengembalikan nilai atributhref
daripada tag<a></a>
. - Navigasi: Sup yang indah membolehkan navigasi mudah melalui pokok parse menggunakan kaedah seperti
.parent
,.children
,.next_sibling
,.previous_sibling
, dan lain -lain. Kaedah ini membolehkan melintasi struktur HTML untuk mencari unsur -unsur yang berkaitan.
Berikut adalah contoh yang menunjukkan find()
, find_all()
, dan get_text()
:
<code class="python"># ... (previous code to get soup) ... first_paragraph = soup.find("p") all_paragraphs = soup.find_all("p") first_paragraph_text = first_paragraph.get_text() print(f"First paragraph: {first_paragraph_text}") print(f"Number of paragraphs: {len(all_paragraphs)}")</code>
Bagaimanakah saya dapat mengendalikan struktur HTML yang berbeza dan kesilapan yang berpotensi apabila menghuraikan dengan sup yang indah?
HTML boleh menjadi kemas dan tidak konsisten. Untuk menangani variasi dan kesilapan yang berpotensi, pertimbangkan strategi ini:
- Parsing yang teguh: Gunakan parser yang memaafkan seperti "html.parser" (lalai) yang dibina ke dalam python. Lebih baik mengendalikan HTML yang cacat daripada parser lain seperti "LXML" (yang lebih cepat tetapi lebih ketat).
- Pengendalian Ralat: Balut kod parsing anda dalam
try...except
blok untuk menangkap pengecualian sepertiAttributeError
(ketika cuba mengakses atribut yang tidak wujud) atauTypeError
(ketika berurusan dengan jenis data yang tidak dijangka). - Pemilihan fleksibel: Gunakan pemilih CSS atau padanan atribut fleksibel dalam
find()
danfind_all()
untuk menampung variasi dalam struktur HTML. Daripada bergantung pada nama kelas atau ID tertentu yang mungkin berubah, pertimbangkan untuk menggunakan lebih banyak pemilih atau atribut umum. - Semak kewujudan: Sebelum mengakses atribut atau elemen kanak -kanak, selalu periksa sama ada elemen wujud untuk mengelakkan
AttributeError
. Gunakan pernyataan bersyarat (contohnya,if element:
. - Pembersihan Data: Selepas pengekstrakan, bersihkan data untuk mengendalikan ketidakkonsistenan seperti ruang kosong tambahan, aksara baru, atau entiti HTML. Kaedah
strip()
Python dan ekspresi tetap berguna untuk ini.
Contoh dengan pengendalian ralat:
<code class="python">try: title = soup.find("title").get_text().strip() print(f"Title: {title}") except AttributeError: print("Title tag not found.")</code>
Bolehkah sup cantik mengendalikan kandungan yang diberikan oleh JavaScript, dan jika tidak, apakah alternatifnya?
Tidak, sup yang indah tidak dapat mengendalikan kandungan yang diberikan oleh JavaScript secara langsung. Sup cantik berfungsi dengan HTML yang pada mulanya dimuat turun; Ia tidak melaksanakan JavaScript. JavaScript menjadikan kandungan secara dinamik selepas beban halaman, jadi sup yang indah hanya melihat HTML statik awal.
Untuk mengendalikan kandungan yang diberikan oleh JavaScript, anda memerlukan alternatif:
- Selenium: Selenium adalah alat automasi penyemak imbas yang dapat mengawal penyemak imbas sebenar (seperti Chrome atau Firefox). Ia memuatkan halaman sepenuhnya, membolehkan JavaScript untuk dilaksanakan, dan kemudian anda boleh menggunakan sup yang indah untuk menghuraikan HTML yang dihasilkan dari DOM pelayar. Ini adalah kaedah yang kuat tetapi lebih perlahan.
- Penulis drama: Sama seperti Selenium, Playwright adalah perpustakaan Node.js (dengan pengikat Python) untuk automasi web. Ia sering lebih cepat dan lebih moden daripada selenium.
- Pelayar tanpa kepala (dengan selenium atau penulis drama): Jalankan penyemak imbas dalam mod tanpa kepala (tanpa tetingkap yang kelihatan) untuk meningkatkan kecekapan.
- Splash (Recrecated): Splash adalah perkhidmatan yang popular untuk memberikan JavaScript, tetapi kini ditolak.
- Perkhidmatan rendering lain: Beberapa perkhidmatan berasaskan awan menawarkan keupayaan rendering JavaScript. Ini biasanya perkhidmatan yang dibayar tetapi boleh menjadi mudah untuk mengikis berskala besar.
Ingat bahawa laman web mengikis harus sentiasa menghormati fail robots.txt
laman web dan terma perkhidmatan. Pengikis yang berlebihan boleh membebankan pelayan dan membawa kepada alamat IP anda disekat.
Atas ialah kandungan terperinci Bagaimana saya menggunakan sup yang indah untuk menghuraikan html?. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Python digunakan secara meluas dalam bidang pembangunan web, sains data, pembelajaran mesin, automasi dan skrip. 1) Dalam pembangunan web, kerangka Django dan Flask memudahkan proses pembangunan. 2) Dalam bidang sains data dan pembelajaran mesin, numpy, panda, scikit-learn dan perpustakaan tensorflow memberikan sokongan yang kuat. 3) Dari segi automasi dan skrip, Python sesuai untuk tugas -tugas seperti ujian automatik dan pengurusan sistem.

Anda boleh mempelajari asas -asas Python dalam masa dua jam. 1. Belajar pembolehubah dan jenis data, 2. Struktur kawalan induk seperti jika pernyataan dan gelung, 3 memahami definisi dan penggunaan fungsi. Ini akan membantu anda mula menulis program python mudah.

Bagaimana Mengajar Asas Pengaturcaraan Pemula Komputer Dalam masa 10 jam? Sekiranya anda hanya mempunyai 10 jam untuk mengajar pemula komputer beberapa pengetahuan pengaturcaraan, apa yang akan anda pilih untuk mengajar ...

Cara mengelakkan dikesan semasa menggunakan fiddlerevery di mana untuk bacaan lelaki-dalam-pertengahan apabila anda menggunakan fiddlerevery di mana ...

Memuatkan Fail Pickle di Python 3.6 Kesalahan Laporan Alam Sekitar: ModulenotFoundError: Nomodulenamed ...

Bagaimana untuk menyelesaikan masalah segmentasi kata Jieba dalam analisis komen tempat yang indah? Semasa kami mengadakan komen dan analisis tempat yang indah, kami sering menggunakan alat segmentasi perkataan jieba untuk memproses teks ...

Bagaimana cara menggunakan ungkapan biasa untuk memadankan tag tertutup pertama dan berhenti? Semasa berurusan dengan HTML atau bahasa markup lain, ungkapan biasa sering diperlukan untuk ...

Memahami Strategi Anti-Crawling of Investing.com Ramai orang sering cuba merangkak data berita dari Investing.com (https://cn.investing.com/news/latest-news) ...


Alat AI Hot

Undresser.AI Undress
Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover
Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool
Gambar buka pakaian secara percuma

Clothoff.io
Penyingkiran pakaian AI

AI Hentai Generator
Menjana ai hentai secara percuma.

Artikel Panas

Alat panas

SublimeText3 versi Inggeris
Disyorkan: Versi Win, menyokong gesaan kod!

Muat turun versi mac editor Atom
Editor sumber terbuka yang paling popular

Versi Mac WebStorm
Alat pembangunan JavaScript yang berguna

VSCode Windows 64-bit Muat Turun
Editor IDE percuma dan berkuasa yang dilancarkan oleh Microsoft

MinGW - GNU Minimalis untuk Windows
Projek ini dalam proses untuk dipindahkan ke osdn.net/projects/mingw, anda boleh terus mengikuti kami di sana. MinGW: Port Windows asli bagi GNU Compiler Collection (GCC), perpustakaan import yang boleh diedarkan secara bebas dan fail pengepala untuk membina aplikasi Windows asli termasuk sambungan kepada masa jalan MSVC untuk menyokong fungsi C99. Semua perisian MinGW boleh dijalankan pada platform Windows 64-bit.