>  기사  >  주제  >  Baidu에서 웹사이트를 크롤링하는지 확인하는 방법

Baidu에서 웹사이트를 크롤링하는지 확인하는 방법

silencement
silencement원래의
2019-05-24 10:57:042940검색

바이두에서 웹사이트를 크롤링하는지 확인하는 방법: 웹사이트 로그에서 바이두 스파이더의 활동, 크롤링 빈도, 반환된 HTTP 상태 코드 등을 분석합니다. 웹사이트의 방문 및 작업을 기록하는 웹사이트의 루트 디렉터리에서 로그 파일을 볼 수도 있습니다.

Baidu에서 웹사이트를 크롤링하는지 확인하는 방법

바이두에서 웹페이지를 크롤링하는 데 사용하는 프로그램은 Baiduspider - Baidu Spider입니다. 주로 바이두에서 크롤링하는 웹사이트의 상황을 분석합니다. . 웹사이트 로그에서 Baidu spider Baiduspider의 활동: 크롤링 빈도, 반환된 HTTP 상태 코드.

로그 보는 방법:

FTP를 통해 웹사이트의 루트 디렉토리에서 로그 파일을 찾으세요. 파일 이름에는 일반적으로 다음이 포함됩니다. 웹사이트의 로그인 메모장은 웹사이트의 방문과 운영을 기록합니다.

서버와 호스트마다 조건이 다르기 때문에 호스트마다 로그 기능이 기록하는 내용이 다르며, 심지어 로그 기능이 없는 경우도 있습니다.

로그 내용은 다음과 같습니다:

61.135.168.22 - - [11/Jan/2009:04:02:45 +0800 ] "GET /bbs/thread-7303-1-1.html HTTP/1.1" 200 8450 "-" "Baiduspider+(+http://www.baidu.com/search/spider.htm)"

# 🎜🎜# 분석:

GET /bbs/thread-7303-1-1.html은 /bbs/thread-7303-1-1.html 페이지를 가져옵니다.

200은 성공적인 캡처를 의미합니다.

8450은 8450바이트가 캡처되었음을 의미합니다.

로그 형식이 이와 같지 않다면 로그 형식 설정이 다르다는 의미입니다.

많은 로그에서 200 0 0 및 200 0 64를 볼 수 있는데 이는 정상적인 크롤링을 나타냅니다.

크롤링 빈도는 일일 로그에서 바이두 스파이더가 크롤링하는 횟수를 확인하여 얻습니다. 크롤링 빈도에 대한 표준화된 시간표나 빈도 수는 없습니다. 일반적으로 여러 날에 걸쳐 로그를 비교하여 판단합니다. 물론 Baidu Spider가 매일 가능한 한 많이 크롤링되기를 바랍니다.

위 내용은 Baidu에서 웹사이트를 크롤링하는지 확인하는 방법의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명:
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.