検索

PHPでデータ収集を実装する方法

Mar 21, 2018 pm 04:27 PM
phpデータ収集方法

収集とは、PHP プログラムを使用して他の Web サイトから情報を独自のデータベースと Web サイトに取り込むことです。この記事では主に PHP でのデータ収集方法を紹介し、皆様のお役に立てれば幸いです。

PHPの生成と収集技術:

基盤となるソケットから高レベルのファイル操作関数まで、収集を実現するには合計3つの方法があります。

1. ソケットテクノロジーを使用したコレクション:

ソケットコレクションは長い接続を確立するだけであり、その後、リクエストを送信するために http プロトコル文字列を構築する必要があります。

たとえば、このページのコンテンツを取得したい場合は、http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~Aを使用します。ソケットに次のように書き込みます:

  1. <?php  
    //连接,$error错误编号,$errstr错误的字符串,30s是连接超时时间
    $fp=fsockopen("www.youku.com",80,$errno,$errstr,30);  
    if(!$fp) die("连接失败".$errstr);  
    //构造http协议字符串,因为socket编程是最底层的,它还没有使用http协议
    $http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n";   //  \r\n表示前面的是一个命令
    $http.="Host:www.youku.com\r\n";  //请求的主机
    $http.="Connection:close\r\n\r\n";   // 连接关闭,最后一行要两个\r\n
    //发送这个字符串到服务器
    fwrite($fp,$http,strlen($http));  
    //接收服务器返回的数据
    $data=&#39;&#39;;  
    while (!feof($fp)) {  
    $data.=fread($fp,4096);  //fread读取返回的数据,一次读取4096字节
    }  
    //关闭连接
    fclose($fp);  
    var_dump($data);  
    ?>

返されたヘッダー情報とページのソースコードを含む出力結果は次のとおりです:

2 のcurl_aセットを使用します。 HTTP プロトコルを変換する関数

curl これらはすべて多くの関数にカプセル化されており、対応するパラメーターを直接渡すことができるため、HTTP プロトコル文字列を記述する難しさが軽減されます。

前提条件:curl 拡張機能が php.ini で有効になっている必要があります。

  1. //生成一个curl对象
    $curl=curl_init();  
    //设置URL和相应的选项
    curl_setopt($curl, CURLOPT_URL, "http://www.youku.com");  
    curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //将curl_exec()获取的信息以字符串返回,而不是直接输出。
    //执行curl操作
    $data=curl_exec($curl);  
    var_dump($data);

出力される結果は次のとおりです。これにはページのソース コードのみが含まれます:

3. file_get_contents を直接使用します (最上位)

前提条件: php.ini ネットワークを開くためのURLアドレスを設定します。

//使用file_get_contents()
$data=file_get_contents("http://www.youku.com");  
var_dump($data);

3つの方法から選択

上記の3つは主にネットワーク間の通信に使用されます。このうち、後者の 2 つはより一般的に使用されます: 大量のデータをバッチで収集したい場合は、パフォーマンスと安定性に優れた 2 番目の [CURL] を使用します。

頻繁ではないが時々いくつかのリクエストを送信する場合は、3 番目のオプションを使用します。

拡張: 写真の盗難防止リンクを解除するにはどうすればよいですか?

たとえば、7060 の Web サイト上の写真はホットリンクから保護されています。写真は彼の Web サイトで見ることができますが、サイトの外からはアクセスできません。

原則: HTTP プロトコルにはリクエストの送信元アドレスを表すリファラー項目があり、サーバーはリクエストがこの Web サイトからのものではないと判断し、リクエストを除外します。 :

解決策: HTTP を送信するときに自分でリファラーをシミュレートするだけです:

 

扩展:有些要采集数据时时必须先登录,可以使用模拟的试模拟在登录状态下的采集:

a. 先用浏览登录一下,登录完,浏览器的COOKIE中就会有SESSIONID

b. 发PHP发HTTP协议时,把浏览器中的SESSIONID放到PHP的HTTP协议请求里,这样就在以登录的状态发请求。

总结:所有客户端发过来的数据都可以被模拟,所以服务器上的程序必须要必要的地方过滤客户端的数据。

什么时候用以上东西?接口开发时、采集时。

二、数据采集

例如我要采集这个url里的所有美国电影的信息,

http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html

则先要知道电影所在的节点的结构,我们使用firebug查看。

 

然后开始写代码:完整代码如下

  1. /**
     * 发一个GET请求获取数据
     */
    function get($url)  
    {  
       global $curl;  
       // 配置curl中的http协议->可配置的荐可以查PHP手册中的curl_
       curl_setopt($curl, CURLOPT_URL, $url);  
       curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE);  
       curl_setopt($curl, CURLOPT_HEADER, FALSE);  
       // 执行这个请求
       return curl_exec($curl);  
    }  
    // 生成一个curl对象
    $curl = curl_init();  
    $url=&#39;http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html&#39;;  
    $data=get($url);  
    // 匹配电影所在位置
    $list_preg = &#39;/<li class="yk-col4 mr1">.+<\/li>/Us&#39;;  
    // 匹配img标签上的src和alt
    $img_preg = &#39;/<img class="quic lazy"  src="/static/imghwm/default1.png"  data-src="(.*)"   _  alt="(.*)" \/>/U&#39;;  
    //匹配电影的url
    $video_preg=&#39;/<a href="(.*)" title="(.*)" target="(.*)"><\/a>/U&#39;;  
    //把所有的li存到$list里,$list是个二维数组
    preg_match_all($list_preg,$data,$list);  
       //var_dump($list);
    foreach ($list[0] as $k => $v) {   //这里$v就是每一个li标签
    /* 获取图片及电影名称
        preg_match($img_preg,$v,$img);  //把匹配到的图片的信息存到$img里
        var_dump($img);
        */
        /*获取电影地址
        preg_match($video_preg,$v,$video);  //把匹配到的电影的信息存到$video里
        var_dump($video);
    */
        preg_match($img_preg,$v,$img);  
        preg_match($video_preg,$v,$video);  
        echo $img[0].&#39;<a href="&#39;.$video[1].&#39;">&#39;.$video[2].&#39;</a>&#39;;  
    }

测试:

打印$list;

 

打印$img

 

打印$video

 

 

最终效果:

 

如果需要把图片拷贝到硬盘上,则在foreach循环里加上以下代码:

  1. $imgData = get($img[1]);  
       // 把图片文件写到硬盘上【下载】
       // 因为操作系统是GBK的,所以要把UTF8转成GBK
       is_dir(&#39;./youkuimg/&#39;) ? &#39;&#39;: mkdir(&#39;./youkuimg/&#39;);  
    file_put_contents(&#39;./youkuimg/&#39;.mb_convert_encoding($img[3], &#39;gbk&#39;, &#39;utf-8&#39;).&#39;.jpg&#39;, $imgData);


 

效果如下:在当前目录下的youkuimg目录下就会有下载好的图片。


相关推荐:

php正则与数据采集详解

php 一个数据采集类实例代码

深入php数据采集的详解_PHP教程

以上がPHPでデータ収集を実装する方法の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。
スカラータイプ、リターンタイプ、ユニオンタイプ、ヌル可能なタイプなど、PHPタイプのヒントはどのように機能しますか?スカラータイプ、リターンタイプ、ユニオンタイプ、ヌル可能なタイプなど、PHPタイプのヒントはどのように機能しますか?Apr 17, 2025 am 12:25 AM

PHPタイプは、コードの品質と読みやすさを向上させるためのプロンプトがあります。 1)スカラータイプのヒント:php7.0であるため、基本データ型は、int、floatなどの関数パラメーターで指定できます。 3)ユニオンタイプのプロンプト:PHP8.0であるため、関数パラメーターまたは戻り値で複数のタイプを指定することができます。 4)Nullable Typeプロンプト:null値を含めることができ、null値を返す可能性のある機能を処理できます。

PHPは、オブジェクトのクローニング(クローンキーワード)と__Clone Magicメソッドをどのように処理しますか?PHPは、オブジェクトのクローニング(クローンキーワード)と__Clone Magicメソッドをどのように処理しますか?Apr 17, 2025 am 12:24 AM

PHPでは、クローンキーワードを使用してオブジェクトのコピーを作成し、\ _ \ _クローンマジックメソッドを使用してクローン動作をカスタマイズします。 1.クローンキーワードを使用して浅いコピーを作成し、オブジェクトのプロパティをクローン化しますが、オブジェクトのプロパティはクローニングしません。 2。\ _ \ _クローン法は、浅いコピーの問題を避けるために、ネストされたオブジェクトを深くコピーできます。 3.クローニングにおける円形の参照とパフォーマンスの問題を避けるために注意し、クローニング操作を最適化して効率を向上させます。

PHP対Python:ユースケースとアプリケーションPHP対Python:ユースケースとアプリケーションApr 17, 2025 am 12:23 AM

PHPはWeb開発およびコンテンツ管理システムに適しており、Pythonはデータサイエンス、機械学習、自動化スクリプトに適しています。 1.PHPは、高速でスケーラブルなWebサイトとアプリケーションの構築においてうまく機能し、WordPressなどのCMSで一般的に使用されます。 2。Pythonは、NumpyやTensorflowなどの豊富なライブラリを使用して、データサイエンスと機械学習の分野で驚くほどパフォーマンスを発揮しています。

さまざまなHTTPキャッシングヘッダー(例:キャッシュコントロール、ETAG、ラスト変更)を説明してください。さまざまなHTTPキャッシングヘッダー(例:キャッシュコントロール、ETAG、ラスト変更)を説明してください。Apr 17, 2025 am 12:22 AM

HTTPキャッシュヘッダーの主要なプレーヤーには、キャッシュコントロール、ETAG、およびラスト修飾が含まれます。 1.Cache-Controlは、キャッシュポリシーを制御するために使用されます。例:キャッシュコントロール:Max-Age = 3600、public。 2。ETAGは、一意の識別子を介してリソースの変更を検証します。例:ETAG: "686897696A7C876B7E"。 3. Last-Modifiedは、リソースの最後の変更時間を示しています。

PHPでの安全なパスワードハッシュ(例:Password_hash、password_verify)を説明します。 MD5またはSHA1を使用してみませんか?PHPでの安全なパスワードハッシュ(例:Password_hash、password_verify)を説明します。 MD5またはSHA1を使用してみませんか?Apr 17, 2025 am 12:06 AM

PHPでは、Password_hashとpassword_verify関数を使用して安全なパスワードハッシュを実装する必要があり、MD5またはSHA1を使用しないでください。 1)password_hashセキュリティを強化するために、塩値を含むハッシュを生成します。 2)password_verifyハッシュ値を比較して、パスワードを確認し、セキュリティを確保します。 3)MD5とSHA1は脆弱であり、塩の値が不足しており、最新のパスワードセキュリティには適していません。

PHP:サーバー側のスクリプト言語の紹介PHP:サーバー側のスクリプト言語の紹介Apr 16, 2025 am 12:18 AM

PHPは、動的なWeb開発およびサーバー側のアプリケーションに使用されるサーバー側のスクリプト言語です。 1.PHPは、編集を必要とせず、迅速な発展に適した解釈言語です。 2。PHPコードはHTMLに組み込まれているため、Webページの開発が簡単になりました。 3。PHPプロセスサーバー側のロジック、HTML出力を生成し、ユーザーの相互作用とデータ処理をサポートします。 4。PHPは、データベースと対話し、プロセスフォームの送信、サーバー側のタスクを実行できます。

PHPとWeb:その長期的な影響を調査しますPHPとWeb:その長期的な影響を調査しますApr 16, 2025 am 12:17 AM

PHPは過去数十年にわたってネットワークを形成しており、Web開発において重要な役割を果たし続けます。 1)PHPは1994年に発信され、MySQLとのシームレスな統合により、開発者にとって最初の選択肢となっています。 2)コア関数には、動的なコンテンツの生成とデータベースとの統合が含まれ、ウェブサイトをリアルタイムで更新し、パーソナライズされた方法で表示できるようにします。 3)PHPの幅広いアプリケーションとエコシステムは、長期的な影響を促進していますが、バージョンの更新とセキュリティの課題にも直面しています。 4)PHP7のリリースなど、近年のパフォーマンスの改善により、現代の言語と競合できるようになりました。 5)将来的には、PHPはコンテナ化やマイクロサービスなどの新しい課題に対処する必要がありますが、その柔軟性とアクティブなコミュニティにより適応性があります。

なぜPHPを使用するのですか?利点と利点が説明されましたなぜPHPを使用するのですか?利点と利点が説明されましたApr 16, 2025 am 12:16 AM

PHPの中心的な利点には、学習の容易さ、強力なWeb開発サポート、豊富なライブラリとフレームワーク、高性能とスケーラビリティ、クロスプラットフォームの互換性、費用対効果が含まれます。 1)初心者に適した学習と使用が簡単。 2)Webサーバーとの適切な統合および複数のデータベースをサポートします。 3)Laravelなどの強力なフレームワークを持っています。 4)最適化を通じて高性能を達成できます。 5)複数のオペレーティングシステムをサポートします。 6)開発コストを削減するためのオープンソース。

See all articles

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

AtomエディタMac版ダウンロード

AtomエディタMac版ダウンロード

最も人気のあるオープンソースエディター

PhpStorm Mac バージョン

PhpStorm Mac バージョン

最新(2018.2.1)のプロフェッショナル向けPHP統合開発ツール

ゼンドスタジオ 13.0.1

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

WebStorm Mac版

WebStorm Mac版

便利なJavaScript開発ツール

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)