이 글에서는 주로 Python 웹 크롤러 기능의 기본 작성 방법을 소개합니다. 웹 크롤러, 즉 Web Spider는 매우 생생한 이름입니다. 인터넷을 스파이더웹에 비유하면 스파이더는 웹을 기어다니는 거미입니다. 웹 크롤러에 관심이 있는 친구들은 이 글
웹 크롤러, 즉 웹 스파이더를 참고하세요. 매우 생생한 이름입니다. 인터넷을 거미줄에 비유한다면 거미는 웹 위를 기어다니는 거미입니다.
1. 웹 크롤러의 정의
웹 스파이더는 링크 주소를 통해 웹 페이지를 검색합니다. 웹사이트의 특정 페이지(보통 홈페이지)에서 시작하여 웹페이지의 내용을 읽고, 웹페이지에서 다른 링크 주소를 찾은 후, 이 링크 주소를 통해 다음 웹페이지를 찾아 계속 진행합니다. 이 웹사이트의 모든 페이지가 크롤링될 때까지 루프를 반복합니다. 전체 인터넷을 하나의 웹사이트로 간주한다면 웹 스파이더는 이 원리를 이용해 인터넷의 모든 웹페이지를 크롤링할 수 있습니다. 이런 방식으로 웹 크롤러는 웹 페이지를 크롤링하는 프로그램인 크롤러입니다. 웹 크롤러의 기본 작업은 웹 페이지를 크롤링하는 것입니다.
2. 웹페이지를 탐색하는 과정
웹페이지를 크롤링하는 과정은 실제로 독자들이 일반적으로 사용하는 IE 브라우저와 동일합니다. 웹페이지를 탐색합니다. 예를 들어, 브라우저의 주소 표시줄에 www.baidu.com 주소를 입력합니다.
웹페이지를 여는 과정은 실제로 브라우징 "클라이언트"인 브라우저가 서버에 요청을 보내고 서버측 파일을 로컬로 "잡은" 후 해석하고 표시하는 과정입니다. 그들을.
HTML은 태그를 사용하여 콘텐츠를 표시하고 구문 분석하고 구별하는 마크업 언어입니다. 브라우저의 기능은 획득한 HTML 코드를 구문 분석한 다음 원본 코드를 우리가 직접 보는 웹사이트 페이지로 변환하는 것입니다.
3. Python 기반의 웹 크롤러 기능
1) Python으로 html 페이지 가져오기
사실 가장 기본적인 웹사이트 캡처는
import urllib2 content = urllib2.urlopen('http://XXXX').read()
이렇게 하면 전체 HTML 문서를 얻을 수 있다는 점입니다. 전체 문서 대신 필요한 유용한 정보를 얻으세요. 이를 위해서는 다양한 태그로 채워진 HTML을 구문 분석해야 합니다.
2) Python 크롤러는 페이지를 크롤링한 후 html 메서드를 구문 분석합니다
python 크롤러 html 구문 분석 라이브러리 SGMLParser
Python에는 기본적으로 HTMLParser 및 SGMLParser와 같은 파서가 제공됩니다. 전자는 사용하기가 매우 어렵기 때문에 SGMLParser를 사용하여 샘플 프로그램을 작성했습니다.
import urllib2 from sgmllib import SGMLParser class ListName(SGMLParser): def init(self): SGMLParser.init(self) self.is_h4 = "" self.name = [] def start_h4(self, attrs): self.is_h4 = 1 def end_h4(self): self.is_h4 = "" def handle_data(self, text): if self.is_h4 == 1: self.name.append(text) content = urllib2.urlopen('http://169it.com/xxx.htm').read() listname = ListName() listname.feed(content) for item in listname.name: print item.decode('gbk').encode('utf8')
여기에는 ListName이라는 클래스가 정의되어 있으며 는 SGMLParser의 메서드를 상속합니다. 변수 is_h4를 마크로 사용하여 html 파일에서 h4 태그를 확인합니다. h4 태그가 발견되면 태그의 내용이 목록 변수 이름에 추가됩니다. start_h4() 및 end_h4() 함수에 대해 설명합니다. 해당 프로토타입은 SGMLParser에서
start_tagname(self, attrs) end_tagname(self)
태그 이름입니다. start_pre가 호출되고 가 발생하면 end_pre가 호출됩니다. attrs는 레이블의 매개변수이며 [(속성, 값), (속성, 값), ...] 형식으로 반환됩니다.
python 크롤러 html 구문 분석 라이브러리 pyQuery
pyQuery는 Python에서 jQuery를 구현한 것이며 jQuery 구문을 사용할 수 있습니다. HTML 문서를 작동하고 구문 분석하는 데 매우 편리합니다. 사용하기 전에 easy_install pyquery를 설치하거나 Ubuntu
sudo apt-get install python-pyquery
에 설치해야 합니다. 다음 예:
from pyquery import PyQuery as pyq doc=pyq(url=r'http://169it.com/xxx.html') cts=doc('.market-cat') for i in cts: print '====',pyq(i).find('h4').text() ,'====' for j in pyq(i).find('.sub'): print pyq(j).text() , print '\n'
Python 크롤러 html 파싱 라이브러리 BeautifulSoup
문제는 대부분의 웹 페이지가 표준을 완벽하게 준수하지 않고 작성되었으며 설명할 수 없는 다양한 오류로 인해 사람들이 찾고 싶어한다는 것입니다. 웹 페이지를 작성하고 그를 때린 사람. 이 문제를 해결하기 위해 우리는 유명한 BeautifulSoup을 선택하여 HTML 문서를 구문 분석할 수 있습니다. 이는 우수한 내결함성을 가지고 있습니다.
위 내용은 이 글의 전체 내용입니다. Python 웹 크롤러 기능 구현에 대한 자세한 분석과 소개를 제공하므로 모든 분들의 학습에 도움이 되기를 바랍니다.
위 내용은 Python 웹 크롤러 기능의 기본 작성 방법 소개의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

2 시간 이내에 Python의 기본 프로그래밍 개념과 기술을 배울 수 있습니다. 1. 변수 및 데이터 유형을 배우기, 2. 마스터 제어 흐름 (조건부 명세서 및 루프), 3. 기능의 정의 및 사용을 이해하십시오. 4. 간단한 예제 및 코드 스 니펫을 통해 Python 프로그래밍을 신속하게 시작하십시오.

Python은 웹 개발, 데이터 과학, 기계 학습, 자동화 및 스크립팅 분야에서 널리 사용됩니다. 1) 웹 개발에서 Django 및 Flask 프레임 워크는 개발 프로세스를 단순화합니다. 2) 데이터 과학 및 기계 학습 분야에서 Numpy, Pandas, Scikit-Learn 및 Tensorflow 라이브러리는 강력한 지원을 제공합니다. 3) 자동화 및 스크립팅 측면에서 Python은 자동화 된 테스트 및 시스템 관리와 같은 작업에 적합합니다.

2 시간 이내에 파이썬의 기본 사항을 배울 수 있습니다. 1. 변수 및 데이터 유형을 배우십시오. 이를 통해 간단한 파이썬 프로그램 작성을 시작하는 데 도움이됩니다.

10 시간 이내에 컴퓨터 초보자 프로그래밍 기본 사항을 가르치는 방법은 무엇입니까? 컴퓨터 초보자에게 프로그래밍 지식을 가르치는 데 10 시간 밖에 걸리지 않는다면 무엇을 가르치기로 선택 하시겠습니까?

Fiddlerevery Where를 사용할 때 Man-in-the-Middle Reading에 Fiddlereverywhere를 사용할 때 감지되는 방법 ...

Python 3.6에 피클 파일로드 3.6 환경 보고서 오류 : modulenotfounderror : nomodulename ...

경치 좋은 스팟 댓글 분석에서 Jieba Word 세분화 문제를 해결하는 방법은 무엇입니까? 경치가 좋은 스팟 댓글 및 분석을 수행 할 때 종종 Jieba Word 세분화 도구를 사용하여 텍스트를 처리합니다 ...

정규 표현식을 사용하여 첫 번째 닫힌 태그와 정지와 일치하는 방법은 무엇입니까? HTML 또는 기타 마크 업 언어를 다룰 때는 정규 표현식이 종종 필요합니다.


핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

AI Hentai Generator
AI Hentai를 무료로 생성하십시오.

인기 기사

뜨거운 도구

Atom Editor Mac 버전 다운로드
가장 인기 있는 오픈 소스 편집기

mPDF
mPDF는 UTF-8로 인코딩된 HTML에서 PDF 파일을 생성할 수 있는 PHP 라이브러리입니다. 원저자인 Ian Back은 자신의 웹 사이트에서 "즉시" PDF 파일을 출력하고 다양한 언어를 처리하기 위해 mPDF를 작성했습니다. HTML2FPDF와 같은 원본 스크립트보다 유니코드 글꼴을 사용할 때 속도가 느리고 더 큰 파일을 생성하지만 CSS 스타일 등을 지원하고 많은 개선 사항이 있습니다. RTL(아랍어, 히브리어), CJK(중국어, 일본어, 한국어)를 포함한 거의 모든 언어를 지원합니다. 중첩된 블록 수준 요소(예: P, DIV)를 지원합니다.

맨티스BT
Mantis는 제품 결함 추적을 돕기 위해 설계된 배포하기 쉬운 웹 기반 결함 추적 도구입니다. PHP, MySQL 및 웹 서버가 필요합니다. 데모 및 호스팅 서비스를 확인해 보세요.

Dreamweaver Mac版
시각적 웹 개발 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기
