OCR을 사용하지 않으면 PDF 문서에서 구조를 유지하면서 테이블을 추출하는 것이 어려울 수 있습니다. 이 작업을 수행하려면 코드에서 휴먼 테이블 인식 기능을 에뮬레이션해야 합니다.
제공된 예의 경우 극복해야 할 추가 장애물이 있습니다. PDF에는 직접 텍스트 추출 데이터가 포함되어 있지 않습니다. Adobe Reader에서 텍스트를 복사하여 붙여넣으려고 하면 부분 임의의 문자가 표시됩니다. 이는 문서에 사용된 글꼴이 올바르게 인코딩되지 않았음을 나타냅니다.
이는 OCR을 사용하지 않으면 안정적인 텍스트 추출이 불가능하다는 것을 의미합니다. 텍스트 추출이 가능한지 확인하려면 Adobe Reader의 텍스트 추출 방법이 강력하므로 복사하여 붙여넣는 것이 좋습니다. 합리적인 텍스트를 추출할 수 없는 경우 적합한 텍스트 추출 솔루션을 찾는 것이 훨씬 더 어려울 것입니다.
동일한 소프트웨어로 생성된 향후 PDF의 경우 파일의 내부 환경을 기반으로 사용자 정의 솔루션을 개발하는 것이 가능할 수도 있습니다. 구조. 그러나 테이블 위치가 다양한 PDF의 경우 이 접근 방식은 실용적이지 않을 수 있습니다.
위 내용은 OCR 없이 PDF에서 구조화된 테이블 데이터를 추출할 수 있습니까?의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!