>백엔드 개발 >파이썬 튜토리얼 >Python의 BeautifulSoup을 이용한 html 분석방법에 대한 자세한 설명

Python의 BeautifulSoup을 이용한 html 분석방법에 대한 자세한 설명

高洛峰
高洛峰원래의
2017-03-31 11:36:531583검색

1) 검색 태그:

찾기(tagname) # 다음과 같이 tagname이라는 태그를 직접 검색합니다. Find ('

Head Find ( List
) # 목록에서 태그를 검색합니다. 예: Find (['Head', 'Body']) Find (DICT) # DICT에서 태그 검색: Find (Find {'head':True, 'body':True})find(re.compile('')) # 다음과 같은 일반 규칙을 따르는 태그를 검색합니다. find(re.compile('^p' )) p
find(lambda)로 시작하는 태그 검색 #
함수
가 true를 반환하는 태그를 검색합니다. 예: find(lambda name: if len(name) == 1) 길이가 1인 태그 검색find(True) # 모든 태그 검색
2) 텍스트 검색(텍스트)

3) 재귀, 제한:

from bs4 import BeautifulSoup
import re
 
doc = ['<html><head><title>Page title</title></head>',
       '<body><p id="firstpara" align="center">This is paragraph <b>one</b>.',
       '<p id="secondpara" align="blah">This is paragraph <b>two</b>.',
       '</html>']
soup = BeautifulSoup(''.join(doc))
 
print soup.prettify()+"\n"
print soup.findAll('b')
 
print soup.findAll(text=re.compile("paragraph"))
print soup.findAll(text=True)
print soup.findAll(text=lambda(x):len(x)<12)
 
a = soup.findAll(re.compile('^b'))
print [tag.name for tag in a]
 
print [tag.name for tag in soup.html.findAll()]
print [tag.name for tag in soup.html.findAll(recursive=False)]
 
print soup.findAll('p',limit=1)

위 내용은 Python의 BeautifulSoup을 이용한 html 분석방법에 대한 자세한 설명의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명:
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.