Python 웹 크롤러 기능의 기본 작성 방법 소개-파이썬 튜토리얼-php.cn

집

백엔드 개발

파이썬 튜토리얼

Python 웹 크롤러 기능의 기본 작성 방법 소개

高洛峰

Mar 13, 2017 pm 06:12 PM

이 글에서는 주로 Python 웹 크롤러 기능의 기본 작성 방법을 소개합니다. 웹 크롤러, 즉 Web Spider는 매우 생생한 이름입니다. 인터넷을 스파이더웹에 비유하면 스파이더는 웹을 기어다니는 거미입니다. 웹 크롤러에 관심이 있는 친구들은 이 글

웹 크롤러, 즉 웹 스파이더를 참고하세요. 매우 생생한 이름입니다. 인터넷을 거미줄에 비유한다면 거미는 웹 위를 기어다니는 거미입니다.

1. 웹 크롤러의 정의

웹 스파이더는 링크 주소를 통해 웹 페이지를 검색합니다. 웹사이트의 특정 페이지(보통 홈페이지)에서 시작하여 웹페이지의 내용을 읽고, 웹페이지에서 다른 링크 주소를 찾은 후, 이 링크 주소를 통해 다음 웹페이지를 찾아 계속 진행합니다. 이 웹사이트의 모든 페이지가 크롤링될 때까지 루프를 반복합니다. 전체 인터넷을 하나의 웹사이트로 간주한다면 웹 스파이더는 이 원리를 이용해 인터넷의 모든 웹페이지를 크롤링할 수 있습니다. 이런 방식으로 웹 크롤러는 웹 페이지를 크롤링하는 프로그램인 크롤러입니다. 웹 크롤러의 기본 작업은 웹 페이지를 크롤링하는 것입니다.

2. 웹페이지를 탐색하는 과정

웹페이지를 크롤링하는 과정은 실제로 독자들이 일반적으로 사용하는 IE 브라우저와 동일합니다. 웹페이지를 탐색합니다. 예를 들어, 브라우저의 주소 표시줄에 www.baidu.com 주소를 입력합니다.

웹페이지를 여는 과정은 실제로 브라우징 "클라이언트"인 브라우저가 서버에 요청을 보내고 서버측 파일을 로컬로 "잡은" 후 해석하고 표시하는 과정입니다. 그들을.

HTML은 태그를 사용하여 콘텐츠를 표시하고 구문 분석하고 구별하는 마크업 언어입니다. 브라우저의 기능은 획득한 HTML 코드를 구문 분석한 다음 원본 코드를 우리가 직접 보는 웹사이트 페이지로 변환하는 것입니다.

3. Python 기반의 웹 크롤러 기능

1) Python으로 html 페이지 가져오기

사실 가장 기본적인 웹사이트 캡처는

import urllib2
content = urllib2.urlopen(&#39;http://XXXX&#39;).read()

이렇게 하면 전체 HTML 문서를 얻을 수 있다는 점입니다. 전체 문서 대신 필요한 유용한 정보를 얻으세요. 이를 위해서는 다양한 태그로 채워진 HTML을 구문 분석해야 합니다.

2) Python 크롤러는 페이지를 크롤링한 후 html 메서드를 구문 분석합니다

python 크롤러 html 구문 분석 라이브러리 SGMLParser

Python에는 기본적으로 HTMLParser 및 SGMLParser와 같은 파서가 제공됩니다. 전자는 사용하기가 매우 어렵기 때문에 SGMLParser를 사용하여 샘플 프로그램을 작성했습니다.

import urllib2
from sgmllib import SGMLParser
 
class ListName(SGMLParser):
def init(self):
SGMLParser.init(self)
self.is_h4 = ""
self.name = []
def start_h4(self, attrs):
self.is_h4 = 1
def end_h4(self):
self.is_h4 = ""
def handle_data(self, text):
if self.is_h4 == 1:
self.name.append(text)
 
content = urllib2.urlopen(&#39;http://169it.com/xxx.htm&#39;).read()
listname = ListName()
listname.feed(content)
for item in listname.name:
print item.decode(&#39;gbk&#39;).encode(&#39;utf8&#39;)

여기에는 ListName이라는 클래스가 정의되어 있으며 는 SGMLParser의 메서드를 상속합니다. 변수 is_h4를 마크로 사용하여 html 파일에서 h4 태그를 확인합니다. h4 태그가 발견되면 태그의 내용이 목록 변수 이름에 추가됩니다. start_h4() 및 end_h4() 함수에 대해 설명합니다. 해당 프로토타입은 SGMLParser에서

start_tagname(self, attrs)
end_tagname(self)

태그 이름입니다. start_pre가 호출되고 가 발생하면 end_pre가 호출됩니다. attrs는 레이블의 매개변수이며 [(속성, 값), (속성, 값), ...] 형식으로 반환됩니다.

python 크롤러 html 구문 분석 라이브러리 pyQuery

pyQuery는 Python에서 jQuery를 구현한 것이며 jQuery 구문을 사용할 수 있습니다. HTML 문서를 작동하고 구문 분석하는 데 매우 편리합니다. 사용하기 전에 easy_install pyquery를 설치하거나 Ubuntu

sudo apt-get install python-pyquery

에 설치해야 합니다. 다음 예:

from pyquery import PyQuery as pyq
doc=pyq(url=r&#39;http://169it.com/xxx.html&#39;)
cts=doc(&#39;.market-cat&#39;)
 
for i in cts:
print &#39;====&#39;,pyq(i).find(&#39;h4&#39;).text() ,&#39;====&#39;
for j in pyq(i).find(&#39;.sub&#39;):
print pyq(j).text() ,
print &#39;\n&#39;

Python 크롤러 html 파싱 라이브러리 BeautifulSoup

문제는 대부분의 웹 페이지가 표준을 완벽하게 준수하지 않고 작성되었으며 설명할 수 없는 다양한 오류로 인해 사람들이 찾고 싶어한다는 것입니다. 웹 페이지를 작성하고 그를 때린 사람. 이 문제를 해결하기 위해 우리는 유명한 BeautifulSoup을 선택하여 HTML 문서를 구문 분석할 수 있습니다. 이는 우수한 내결함성을 가지고 있습니다.

위 내용은 이 글의 전체 내용입니다. Python 웹 크롤러 기능 구현에 대한 자세한 분석과 소개를 제공하므로 모든 분들의 학습에 도움이 되기를 바랍니다.

위 내용은 Python 웹 크롤러 기능의 기본 작성 방법 소개의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

관련 기사

2 시간의 파이썬 계획 : 현실적인 접근Apr 11, 2025 am 12:04 AM

2 시간 이내에 Python의 기본 프로그래밍 개념과 기술을 배울 수 있습니다. 1. 변수 및 데이터 유형을 배우기, 2. 마스터 제어 흐름 (조건부 명세서 및 루프), 3. 기능의 정의 및 사용을 이해하십시오. 4. 간단한 예제 및 코드 스 니펫을 통해 Python 프로그래밍을 신속하게 시작하십시오.

파이썬 : 기본 응용 프로그램 탐색Apr 10, 2025 am 09:41 AM

Python은 웹 개발, 데이터 과학, 기계 학습, 자동화 및 스크립팅 분야에서 널리 사용됩니다. 1) 웹 개발에서 Django 및 Flask 프레임 워크는 개발 프로세스를 단순화합니다. 2) 데이터 과학 및 기계 학습 분야에서 Numpy, Pandas, Scikit-Learn 및 Tensorflow 라이브러리는 강력한 지원을 제공합니다. 3) 자동화 및 스크립팅 측면에서 Python은 자동화 된 테스트 및 시스템 관리와 같은 작업에 적합합니다.

2 시간 안에 얼마나 많은 파이썬을 배울 수 있습니까?Apr 09, 2025 pm 04:33 PM

2 시간 이내에 파이썬의 기본 사항을 배울 수 있습니다. 1. 변수 및 데이터 유형을 배우십시오. 이를 통해 간단한 파이썬 프로그램 작성을 시작하는 데 도움이됩니다.

10 시간 이내에 프로젝트 및 문제 중심 방법에서 컴퓨터 초보자 프로그래밍 기본 사항을 가르치는 방법?Apr 02, 2025 am 07:18 AM

10 시간 이내에 컴퓨터 초보자 프로그래밍 기본 사항을 가르치는 방법은 무엇입니까? 컴퓨터 초보자에게 프로그래밍 지식을 가르치는 데 10 시간 밖에 걸리지 않는다면 무엇을 가르치기로 선택 하시겠습니까?

중간 독서를 위해 Fiddler를 사용할 때 브라우저에서 감지되는 것을 피하는 방법은 무엇입니까?Apr 02, 2025 am 07:15 AM

Fiddlerevery Where를 사용할 때 Man-in-the-Middle Reading에 Fiddlereverywhere를 사용할 때 감지되는 방법 ...

Python 3.6에 피클 파일을로드 할 때 '__builtin__'모듈을 찾을 수없는 경우 어떻게해야합니까?Apr 02, 2025 am 07:12 AM

Python 3.6에 피클 파일로드 3.6 환경 보고서 오류 : modulenotfounderror : nomodulename ...

경치 좋은 스팟 코멘트 분석에서 Jieba Word 세분화의 정확성을 향상시키는 방법은 무엇입니까?Apr 02, 2025 am 07:09 AM

경치 좋은 스팟 댓글 분석에서 Jieba Word 세분화 문제를 해결하는 방법은 무엇입니까? 경치가 좋은 스팟 댓글 및 분석을 수행 할 때 종종 Jieba Word 세분화 도구를 사용하여 텍스트를 처리합니다 ...

정규 표현식을 사용하여 첫 번째 닫힌 태그와 정지와 일치하는 방법은 무엇입니까?Apr 02, 2025 am 07:06 AM

정규 표현식을 사용하여 첫 번째 닫힌 태그와 정지와 일치하는 방법은 무엇입니까? HTML 또는 기타 마크 업 언어를 다룰 때는 정규 표현식이 종종 필요합니다.

See all articles

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

뜨거운 도구

Atom Editor Mac 버전 다운로드

가장 인기 있는 오픈 소스 편집기

mPDF

mPDF는 UTF-8로 인코딩된 HTML에서 PDF 파일을 생성할 수 있는 PHP 라이브러리입니다. 원저자인 Ian Back은 자신의 웹 사이트에서 "즉시" PDF 파일을 출력하고 다양한 언어를 처리하기 위해 mPDF를 작성했습니다. HTML2FPDF와 같은 원본 스크립트보다 유니코드 글꼴을 사용할 때 속도가 느리고 더 큰 파일을 생성하지만 CSS 스타일 등을 지원하고 많은 개선 사항이 있습니다. RTL(아랍어, 히브리어), CJK(중국어, 일본어, 한국어)를 포함한 거의 모든 언어를 지원합니다. 중첩된 블록 수준 요소(예: P, DIV)를 지원합니다.