ホームページ >バックエンド開発 >PHPチュートリアル >PHP は Zhihu ユーザーデータのクロールと分析を実装します、php_PHP チュートリアル

PHP は Zhihu ユーザーデータのクロールと分析を実装します、php_PHP チュートリアル

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBオリジナル: 2016-07-12 08:59:511208ブラウズ

php は、Zhihu ユーザーデータのクロールと分析を実装します。php

背景の説明: Xiaoyan は、実験的に 50,000 人の Zhihu ユーザーの基本情報を同時にクロールするために、php のcurl で作成されたクローラーを使用しました。データは簡単に分析されます。そして提示されました。

php スパイダーコードとユーザーダッシュボードの表示コードは分類されて github にアップロードされ、コードベースは個人のブログや公開アカウントで更新されます。このプログラムは、Zhihu 関連の権利と利益を侵害する場合にのみ使用されます。、削除する場合はできるだけ早くご連絡ください。

写真も真実もありません

モバイル分析データのスクリーンショット

PC側解析データのスクリーンショット

全体のクローリング、分析、表示のプロセスは大きく次のステップに分かれており、Xiaoyan がそれぞれについて紹介します

curlはZhihuのWebページデータをクロールします
Zhihuウェブページデータの定期分析
データストレージとプログラムの展開
データ分析とプレゼンテーション

curlはWebデータをクロールします

PHP 用のカール拡張機能は、さまざまなタイプのプロトコルを使用してさまざまなサーバーに接続して通信できるようにする、PHP でサポートされているライブラリです。 Webページをクロールするのに非常に便利なツールであり、同時にマルチスレッド拡張もサポートしています。

このプログラムは、Zhihu がユーザーにアクセスを提供する個人情報ページ https://www.zhihu.com/people/xxx をキャプチャします。クロールプロセスでは、ページを取得するためにユーザーの Cookie が必要です。直接コードを書く

ページの Cookie を取得します

コードをコピーしますコードは次のとおりです:
// Zhihu にログインし、パーソナルセンターを開いて、コンソールを開いて、Cookie を取得します
ドキュメント.クッキー
"_za=67254197-3wwb8d-43f6-94f0-fb0e2d521c31; _ga=GA1.2.2142818188.1433767929; q_c1=78ee1604225d47d08cddd8142a08288b23|1452172601 |1452172601000; _xsrf=15f0639cbe6fb607560c075269064393; cap_id="N2QwMTExNGQ0YTY2NGVddlMGIyNmQ4NjdjOTU0YTM5MmQ=|1453444256|49fdc6b43dc51f 702b7 d6575451e228f56cdaf5d"; __utmt=1; lock_ticket = "QUJDTWpmM0lsZdd2dYQUFBQVlRSlZUVTNVb1ZaNDVoQXJlblVmWGJ0WGwyaHlDdVdscXdZU1VRPT0=|1453444421|c47a2afde1ff334d416bafb1cc267b41014c9d5f"; 54 390.21428dd18188.1433767929.1453187421.1453444257.3; __utmb=51854390.14.8.1453444425011; __utmc=51854390.14528 46679 .1.dd1.utmcsr=google|utmccn=(オーガニック)|utmcmd =organic| utmctr=(%20 が提供されていません); __utmv=51854390.100-1|2=登録日=20150823=1^dd3=エントリ日=20150823=1"

個人センターページをキャッチ

カールを使用し、クッキーを運び、最初に私のセンターページをつかんでください

リーリー

さらなるクロールのための Web ページデータと新しいリンクの定期的な分析

クロールされた Web ページを保存します。

。 Zhihu ページの分析を通じて、個人センターページにはフォロワーと「いいね！」をした人やフォローしている人がいることがわかりました。 要想进行进一步的爬取，页面必须包含有可用于进一步爬取用户的链接 以下に示すように

コードをコピーしますコードは次のとおりです: // クロールされた HTML ページで新しいユーザーが見つかり、クローラーに使用できます
e3baa16372767ba4dd78af55006edcd5

わかりました、この方法で自分自身を使用できます-》人をフォローする-》人のフォロワーをフォローする-》。。。継続的なクロール。次のステップは、定期的なマッチングを通じて情報を抽出することです

コードをコピーしますコードは次のとおりです: // クロールされたページに一致するすべてのユーザーと一致します
preg_match_all('//people/([w-]+)"/i', $str, $match_arr);
//重複を削除して新しいユーザー配列にマージすると、ユーザーはさらにクロールできるようになります
self::$newUserArr = array_unique(array_merge($match_arr[1], self::$newUserArr));

この時点で、クロールプロセス全体がスムーズに進むことができます。

大量のデータをクロールする必要がある場合は、マルチスレッド高速クロールの
を検討できますが、ここでは説明しません。 curl_multi和pcntl

ユーザーデータを分析し、分析を提供します

正規表現を使用すると、さらに多くのユーザーデータと照合し、それを直接コーディングできます。

リーリー

クロールプロセス中、可能であれば、Redis を介してデータベースに入る必要があります。これにより、クロールとウェアハウスの効率が実際に向上します。条件がない場合は、SQL を通じてのみ最適化できます。ここにいくつかの考えがあります。

データベーステーブルのインデックスを設計するときは注意してください。スパイダークローリングのプロセスでは、ユーザー名にインデックスを付けず、主キーを含む左右のフィールドにインデックスを付けないことをお勧めします。

毎回 1 つずつ追加する 5,000 万のデータを想像してください。インデックスを作成するために必要です。クロールが完了し、データを分析する必要があると、インデックスがバッチで作成されます。 尽可能的提高入库效率

データの保存と更新の操作はバッチで実行する必要があります。 mysql による公式の提案と追加、削除、変更の速度: http://dev.mysql.com/doc/refman/5.7/en/insert-speed.html

リーリー

展開操作。クローリング処理中にプログラムが異常ハングする場合がありますので、効率と安定性を確保するために、可能な限りタイミングスクリプトを作成してください。時々異常終了しても、貴重な時間を無駄にしないように、時々強制終了して再実行してください。

#!/bin/bash

# 干掉
ps aux |grep spider |awk '{print $2}'|xargs kill -9
sleep 5s

# 重新跑
nohup /home/cuixiaohuan/lamp/php5/bin/php /home/cuixiaohuan/php/zhihu_spider/spider_new.php &

数据分析呈现

数据的呈现主要使用echarts 3.0，感觉对于移动端兼容还不错。兼容移动端的页面响应式布局主要通过几个简单的css控制，代码如下

// 获取用户头像
preg_match('/<img.+src=\"&#63;([^\s]+\.(jpg|gif|bmp|bnp|png))\"&#63;.+>/i', $str, $match_img);
$img_url = $match_img[1];

// 匹配用户名：
// <span class="name">崔小拽</span>
preg_match('/<span.+class=\"&#63;name\"&#63;>([\x{4e00}-\x{9fa5}]+).+span>/u', $str, $match_name);
$user_name = $match_name[1];

// 匹配用户简介
// class bio span 中文
preg_match('/<span.+class=\"&#63;bio\"&#63;.+\>([\x{4e00}-\x{9fa5}]+).+span>/u', $str, $match_title);
$user_title = $match_title[1];

// 匹配性别
//<input type="radio" name="gender" value="1" checked="checked" class="male"/> 男  
// gender value1 ;结束 中文
preg_match('/<input.+name=\"&#63;gender\"&#63;.+value=\"&#63;1\"&#63;.+([\x{4e00}-\x{9fa5}]+).+\;/u', $str, $match_sex);
$user_sex = $match_sex[1];

// 匹配地区
//<span class="location item" title="北京">
preg_match('/<span.+class=\"&#63;location.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_city);
$user_city = $match_city[1];

// 匹配工作
//<span class="employment item" title="人见人骂的公司">人见人骂的公司</span>
preg_match('/<span.+class=\"&#63;employment.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_employment);
$user_employ = $match_employment[1];

// 匹配职位
// <span class="position item" title="程序猿"><a href="/topic/19590046" title="程序猿" class="topic-link" data-token="19590046" data-topicid="13253">程序猿</a></span>
preg_match('/<span.+class=\"&#63;position.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+).+\">/u', $str, $match_position);
$user_position = $match_position[1];

// 匹配学历
// <span class="education item" title="研究僧">研究僧</span>
preg_match('/<span.+class=\"&#63;education.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_education);
$user_education = $match_education[1];

// 工作情况
// <span class="education-extra item" title='挨踢'>挨踢</span>
preg_match('/<span.+class=\"&#63;education-extra.+\"&#63;.+>([\x{4e00}-
\x{9fa5}]+)</u', $str, $match_education_extra);
$user_education_extra = $match_education_extra[1];


// 匹配关注话题数量
// class="zg-link-litblue"><strong>41 个话题</strong></a>
preg_match('/class=\"&#63;zg-link-litblue\"&#63;><strong>(\d+)\s.+strong>/i', $str, $match_topic);
$user_topic = $match_topic[1];

// 关注人数
// <span class="zg-gray-normal">关注了
preg_match_all('/<strong>(\d+)<.+<label>/i', $str, $match_care);
$user_care = $match_care[1][0];
$user_be_careed = $match_care[1][1];

// 历史浏览量
// <span class="zg-gray-normal">个人主页被 <strong>17</strong> 人浏览</span>
preg_match('/class=\"&#63;zg-gray-normal\"&#63;.+>(\d+)<.+span>/i', $str, $match_browse);
$user_browse = $match_browse[1];

不足和待学习

整个过程中涉及php,shell,js,css,html,正则等语言和部署等基础知识，但还有诸多需要改进完善，小拽特此记录，后续补充例：

php 采用multicul进行多线程。
正则匹配进一步优化
部署和抓取过程采用redis提升存储
移动端布局的兼容性提升
js的模块化和sass书写css。

您可能感兴趣的文章:

php IIS日志分析搜索引擎爬虫记录程序
php 向访客和爬虫显示不同的内容
一个PHP实现的轻量级简单爬虫
PHP实现简单爬虫的方法
PHP代码实现爬虫记录——超管用
PHP爬虫之百万级别知乎用户数据爬取与分析

声明：

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

前の記事：[php+mysql] ブログページング制作のアイデア、phpmysql ページングのアイデア_PHP チュートリアル次の記事：[php+mysql] ブログページング制作のアイデア、phpmysql ページングのアイデア_PHP チュートリアル

続きを見る

PHP は Zhihu ユーザー データのクロールと分析を実装します、php_PHP チュートリアル