ホームページ >バックエンド開発 >PHPの問題 >PHPでWebページのヘッダーのみをクロールする方法

PHPでWebページのヘッダーのみをクロールする方法

藏色散人
藏色散人オリジナル
2021-10-14 09:16:201966ブラウズ

php を使用して Web ページのヘッダーのみを取得する方法: 1. get_headers() 関数を使用します; 2. http_response_header メソッドを使用します; 3. stream_get_meta_data() 関数を使用します; 4. php CURL を使用して取得しますWeb ページのヘッダー。

PHPでWebページのヘッダーのみをクロールする方法

この記事の動作環境:Windows7システム、PHP7.1バージョン、DELL G3パソコン

クロールのみの方法WebページのヘッダーをPHPで?

php Web ページのヘッダー情報を取得する 4 つの方法

phpWeb ページのヘッダー情報を取得する方法はたくさんあります。php 言語に関する限り、私は以下に 4 つの方法があります。

方法 1: get_headers() 関数を使用する

推奨インデックス:

get_header メソッドは最も単純で、わずか 2 行のコードで実行できます。コード。

$thisurl = "http://www.lao8.org/";
print_r(get_headers($thisurl, 1));

得られた結果は次のとおりです:

Array
(
    [0] => HTTP/1.1 200 OK
    [Cache-Control] => max-age=86400
    [Content-Length] => 76102
    [Content-Type] => text/html
    [Content-Location] => http://www.lao8.org/index.html
    [Last-Modified] => Fri, 19 Jul 2013 03:52:30 GMT
    [Accept-Ranges] => bytes
    [ETag] => "50bc48643384ce1:5cb3"
    [Server] => Microsoft-IIS/6.0
    [X-Powered-By] => ASP.NET
    [Date] => Fri, 19 Jul 2013 09:06:39 GMT
    [Connection] => close
)

方法 2: http_response_header を使用します

推奨インデックス: ★★★

http_response_headerf メソッドも非常に便利ですシンプル、わずか 3 行:

$thisurl = "http://www.lao8.org";
$html = file_get_contents($thisurl ); 
print_r($http_response_header);

得られた結果は次のとおりです:

Array
(
    [0] => HTTP/1.1 200 OK
    [1] => Cache-Control: max-age=86400
    [2] => Content-Length: 76102
    [3] => Content-Type: text/html
    [4] => Content-Location: http://www.lao8.org/index.html
    [5] => Last-Modified: Fri, 19 Jul 2013 03:52:30 GMT
    [6] => Accept-Ranges: bytes
    [7] => ETag: "50bc48643384ce1:5cb3"
    [8] => Server: Microsoft-IIS/6.0
    [9] => X-Powered-By: ASP.NET
    [10] => Date: Fri, 19 Jul 2013 09:06:41 GMT
    [11] => Connection: close
)

方法 3: stream_get_meta_data() 関数を使用します

推奨インデックス: ★★★

使用 stream_get_meta_data() コードに必要なのは 3 行だけです:

$thisurl = "http://www.lao8.org/";
$fp = fopen($thisurl, 'r'); 
print_r(stream_get_meta_data($fp));

得られる結果は次のとおりです:

Array
(
    [wrapper_data] => Array
        (
            [0] => HTTP/1.1 200 OK
            [1] => Cache-Control: max-age=86400
            [2] => Content-Length: 76102
            [3] => Content-Type: text/html
            [4] => Content-Location: http://www.lao8.org/index.html
            [5] => Last-Modified: Fri, 19 Jul 2013 03:52:30 GMT
            [6] => Accept-Ranges: bytes
            [7] => ETag: "50bc48643384ce1:5cb3"
            [8] => Server: Microsoft-IIS/6.0
            [9] => X-Powered-By: ASP.NET
            [10] => Date: Fri, 19 Jul 2013 09:06:41 GMT
            [11] => Connection: close
        )
    [wrapper_type] => http
    [stream_type] => tcp_socket
    [mode] => r+
    [unread_bytes] => 1086
    [seekable] => 
    [uri] => http://www.lao8.org/
    [timed_out] => 
    [blocked] => 1
    [eof] => 
)

4 番目の方法: PHP の高度な関数 CURL() を使用して

おすすめ度: ★★★★

上記の 3 つの方法で一般的な Web ページのヘッダー情報を取得できますが、Web ページで GZip 圧縮が有効かどうかなど、より詳細なヘッダー情報を取得したい場合に使用します。このとき、PHPの高度な関数curl()を使用して取得できます。

curl を使用して GZip 圧縮を検出するヘッダーを取得します

最初にコードを投稿します:

<?php
$szUrl = &#39;http://www.lao8.org/&#39;;
$curl = curl_init();
curl_setopt($curl, CURLOPT_URL, $szUrl);
curl_setopt($curl, CURLOPT_HEADER, 1);  //输出header信息
curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //不显示网页内容
curl_setopt($curl, CURLOPT_ENCODING, &#39;&#39;); //允许执行gzip
$data=curl_exec($curl); 
if(!curl_errno($curl))
{
    $info = curl_getinfo($curl);
    $httpHeaderSize = $info[&#39;header_size&#39;];  //header字符串体积
    $pHeader = substr($data, 0, $httpHeaderSize); //获得header字符串
    $split   = array("rn", "n", "r");  //需要格式化header字符串
    $pHeader = str_replace($split, &#39;<br>&#39;, $pHeader); //使用<br>换行符格式化输出到网页上
    echo $pHeader;
}
?>

出力結果は次のとおりです:

HTTP/1.1 200 OK
Cache-Control: max-age=86400
Content-Length: 15189
Content-Type: text/html
Content-Encoding: gzip
Content-Location: http://www.lao8.org/index.html
Last-Modified: Fri, 19 Jul 2013 03:52:28 GMT
Accept-Ranges: bytes
ETag: "0268633384ce1:5cb3"
Vary: Accept-Encoding
Server: Microsoft-IIS/6.0
X-Powered-By: ASP.NET
Date: Fri, 19 Jul 2013 09:27:21 GMT

curl を使用して取得したヘッダー情報に Content-Encoding: gzip という行があり、Web ページで GZip 圧縮が有効になっていることがわかります。

推奨学習: 「PHP ビデオ チュートリアル

」###

以上がPHPでWebページのヘッダーのみをクロールする方法の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明:
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。