ホームページ  >  記事  >  バックエンド開発  >  PHP のカールを使用して、キーワードに基づいて Baidu の検索結果ページをクロールします。

PHP のカールを使用して、キーワードに基づいて Baidu の検索結果ページをクロールします。

WBOY
WBOYオリジナル
2016-06-13 12:10:191196ブラウズ

PHP のカールを使用して、キーワードに基づいて Baidu の検索結果ページをクロールします。
私が実現したいのは、毎回指定されたキーワードに基づいて Baidu の結果ページを検索することです。たとえば、Baidu の検索結果は次のようになります。Baidu のプロモーション コンテンツです。プラステキスト:

そして、curl を使用してクロールすると、結果は次のようになります:

つまり、すべてのクロール結果は、Baidu によって宣伝されたコンテンツをクロールすることはできません。 。始めたばかりなので、ご指導いただける師匠がいらっしゃいましたらお願いいたします。前もって感謝します。
PHP クローリング コードは次のとおりです:

<br /><?php<br />$url = "http://www.baidu.com/s?wd=生命动力";<br />// 构造包头,模拟浏览器请求<br />$header = array (<br />		"Host:www.baidu.com",<br />		"Content-Type:application/x-www-form-urlencoded",//post请求<br />		"Connection: keep-alive",<br />		'Referer:http://www.baidu.com',<br />		'User-Agent: Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; WOW64; Trident/5.0; BIDUBrowser 2.6)'<br />);<br />$ch = curl_init ();<br />curl_setopt ( $ch, CURLOPT_URL, $url );<br />curl_setopt ( $ch, CURLOPT_HTTPHEADER, $header );<br />curl_setopt ( $ch, CURLOPT_RETURNTRANSFER, 1 );<br />// 执行<br />$content = curl_exec ( $ch );<br />if ($content == FALSE) {<br />	echo "error:" . curl_error ( $ch );<br />}<br />// 关闭<br />curl_close ( $ch );<br /><br />//输出结果<br />echo $content;<br />?><br />

-----ソリューション アイデア----------------------
ユーザー エージェントが適切にシミュレートされていないため、機能しません。
実際には、post を使用する必要はまったくなく、get を使用するだけです。
次のように変更します:
<br />$url = "http://www.baidu.com/s?wd=生命动力";<br /><br />$header = array (<br />        'User-Agent: Mozilla/5.0 (Windows NT 5.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/33.0.1750.146 Safari/537.36'<br />);<br />$ch = curl_init ();<br />curl_setopt ( $ch, CURLOPT_URL, $url );<br />curl_setopt ( $ch, CURLOPT_HTTPHEADER, $header );<br />curl_setopt ( $ch, CURLOPT_RETURNTRANSFER, 1 );<br />// 执行<br />$content = curl_exec ( $ch );<br />if ($content == FALSE) {<br />    echo "error:" . curl_error ( $ch );<br />}<br />// 关闭<br />curl_close ( $ch );<br /> <br />//输出结果<br />echo $content;<br />


声明:
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。