Kira-kira setahun yang lalu saya telah diberi tugas untuk mengekstrak dan menstruktur data daripada fail, terutamanya data yang terkandung dalam jadual. Saya tidak mempunyai pengetahuan awal tentang penglihatan komputer dan mengalami kesukaran mencari penyelesaian "plug and play" yang sesuai. Pilihan yang tersedia pada masa itu adalah sama ada penyelesaian berdasarkan rangkaian saraf (NN) terkini, yang besar dan rumit, atau penyelesaian yang lebih ringkas berdasarkan OpenCV, yang tidak cukup konsisten.
Diinspirasikan oleh skrip OpenCV sedia ada, saya membangunkan cara yang mudah dan konsisten untuk mengekstrak jadual dan menjadikannya pustaka Python sumber terbuka: img2table
#🎜🎜 #Kandungan yang perlu ditulis semula ialah: Pautan: https://github.com/xavctn/img2tableMengenal pasti jadual dalam imej dan fail PDF, termasuk kotak sempadan pada peringkat sel jadual.
- Ekstrak kandungan jadual dengan menyokong perkhidmatan/alat OCR (Tesseract, PaddleOCR, AWS Text, Google Vision dan Azure OCR kini disokong).
- Kendalikan struktur jadual kompleks seperti sel bercantum.
- Kaedah untuk membetulkan kecondongan dan putaran imej.
- Jadual yang diekstrak dikembalikan sebagai objek ringkas, termasuk perwakilan Pandas DataFrame.
- Pilihan untuk mengeksport jadual yang diekstrak sebagai fail Excel, mengekalkan struktur asalnya.
- Bagaimana cara menggunakannya?
pip install img2tableUntuk mengenal pasti jadual dalam dokumen , anda hanya perlu memanggil fungsi :
从img2table.document导入Image类# 图像实例化 img = Image(src="myimage.jpg")# 表格识别 img_tables = img.extract_tables()# 表格识别结果 img_tables[ExtractedTable(title=None, bbox=(10, 8, 745, 314),shape=(6, 3)), ExtractedTable(title=None, bbox=(936, 9, 1129, 111),shape=(2, 2))]#🎜🎜🎜#Kandungan yang diperlukan untuk ditulis semula ialah: Apa yang digunakan dalam contoh di atas Imej
Jika kita ingin mengekstrak kandungan jadual, kita perlu menggunakan alat OCR. Anda boleh ikuti langkah di bawah:
from img2table.document import PDFfrom img2table.ocr import TesseractOCR# Instantiation of the pdfpdf = PDF(src="mypdf.pdf")# Instantiation of the OCR, Tesseract, which requires prior installationocr = TesseractOCR(lang="eng")# Table identification and extractionpdf_tables = pdf.extract_tables(ocr=ocr)# We can also create an excel file with the tablespdf.to_xlsx('tables.xlsx',ocr=ocr)Borang sampel ialah sampel yang diekstrak daripada fail PDF#🎜🎜 #
Tak perlu tukar maksud asal, isi yang perlu ditulis semula ialah: Contoh perahan jadual "Tanpa Sempadan"
#🎜🎜 ##🎜🎜 #Itu sahaja! Sebenarnya, repositori tidak rumit, kerana matlamat kami adalah untuk memudahkannya sebanyak mungkin dan mengelakkan daripada memperkenalkan penyelesaian lain yang mungkin memperkenalkan kerumitan Sila lawati halaman GitHub projek Untuk dokumentasi dan contoh yang lebih terperinci: https://github.com /xavctn/img2table
Semua pemprosesan imej CV terbuka dan dibuka menggunakan Cv Terbuka . Walau bagaimanapun, ini masih agak asas. Inti algoritma ialah transformasi Hough, yang mampu mengenal pasti garis lurus dalam imej, membolehkan kami mengesan garis mendatar dan menegak dalam imej
需要重写的内容是:cv2.HoughLinesP(img, rho, theta, threshold, None, minLinLength, maxLineGap)#🎜🎜 #
Selepas ini, kita perlu melakukan beberapa pemprosesan pada garisan untuk mengenal pasti sel daripadanya dan seterusnya mengenal pasti jadual daripada sel
# 🎜🎜## 🎜🎜#
Pelaksanaan perwakilan algoritma yang dipermudahkan Kebanyakan pengiraan dilakukan menggunakan Polar untuk prestasi dan kelajuan yang baik.Atas ialah kandungan terperinci Ekstrak jadual daripada imej menggunakan Python. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Model bahasa yang besar (LLMS) telah melonjak populariti, dengan ciri-ciri alat yang secara dramatik memperluaskan keupayaan mereka di luar penjanaan teks mudah. Sekarang, LLMS dapat mengendalikan tugas automasi yang kompleks seperti penciptaan UI dinamik dan autonomi a

Bolehkah permainan video meringankan kebimbangan, membina fokus, atau menyokong kanak -kanak dengan ADHD? Memandangkan cabaran penjagaan kesihatan melonjak di seluruh dunia - terutamanya di kalangan belia - inovator beralih kepada alat yang tidak mungkin: permainan video. Sekarang salah satu hiburan terbesar di dunia Indus

"Sejarah telah menunjukkan bahawa walaupun kemajuan teknologi memacu pertumbuhan ekonomi, ia tidak sendiri memastikan pengagihan pendapatan yang saksama atau menggalakkan pembangunan manusia yang inklusif," tulis Rebeca Grynspan, Setiausaha Agung Unctad, dalam Mukadimah.

Easy-peasy, gunakan AI Generatif sebagai tutor rundingan dan rakan kongsi sparring anda. Mari kita bercakap mengenainya. Analisis terobosan AI yang inovatif ini adalah sebahagian daripada liputan lajur Forbes yang berterusan pada AI terkini, termasuk mengenal pasti dan menjelaskan

Persidangan TED2025, yang diadakan di Vancouver, membungkus edisi ke -36 semalam, 11 April. Ia menampilkan 80 penceramah dari lebih daripada 60 negara, termasuk Sam Altman, Eric Schmidt, dan Palmer Luckey. Tema Ted, "Kemanusiaan Reimagined," telah disesuaikan dibuat

Joseph Stiglitz adalah ahli ekonomi yang terkenal dan penerima Hadiah Nobel dalam Ekonomi pada tahun 2001. Stiglitz berpendapat bahawa AI dapat memburukkan lagi ketidaksamaan dan kuasa yang disatukan di tangan beberapa syarikat dominan, akhirnya menjejaskan ekonomi

Pangkalan Data Graf: Merevolusi Pengurusan Data Melalui Hubungan Apabila data berkembang dan ciri -cirinya berkembang di pelbagai bidang, pangkalan data grafik muncul sebagai penyelesaian transformatif untuk menguruskan data yang saling berkaitan. Tidak seperti tradisional

Routing Model Besar (LLM): Mengoptimumkan Prestasi melalui Pengedaran Tugas Pintar Landskap LLM yang pesat berkembang membentangkan pelbagai model, masing -masing dengan kekuatan dan kelemahan yang unik. Beberapa cemerlang di Gen Kandungan Kreatif


Alat AI Hot

Undresser.AI Undress
Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover
Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool
Gambar buka pakaian secara percuma

Clothoff.io
Penyingkiran pakaian AI

AI Hentai Generator
Menjana ai hentai secara percuma.

Artikel Panas

Alat panas

Muat turun versi mac editor Atom
Editor sumber terbuka yang paling popular

Notepad++7.3.1
Editor kod yang mudah digunakan dan percuma

ZendStudio 13.5.1 Mac
Persekitaran pembangunan bersepadu PHP yang berkuasa

VSCode Windows 64-bit Muat Turun
Editor IDE percuma dan berkuasa yang dilancarkan oleh Microsoft

Versi Mac WebStorm
Alat pembangunan JavaScript yang berguna