ホームページ  >  記事  >  バックエンド開発  >  PHP は Zhihu ユーザー データのクロールと分析を実装します、php_PHP チュートリアル

PHP は Zhihu ユーザー データのクロールと分析を実装します、php_PHP チュートリアル

WBOY
WBOYオリジナル
2016-07-12 08:59:511121ブラウズ

php は、Zhihu ユーザー データのクロールと分析を実装します。php

背景の説明: Xiaoyan は、実験的に 50,000 人の Zhihu ユーザーの基本情報を同時にクロールするために、php のcurl で作成されたクローラーを使用しました。データは簡単に分析されます。そして提示されました。

php スパイダー コードとユーザー ダッシュボードの表示コードは分類されて github にアップロードされ、コード ベースは個人のブログや公開アカウントで更新されます。このプログラムは、Zhihu 関連の権利と利益を侵害する場合にのみ使用されます。 、削除する場合はできるだけ早くご連絡ください。

写真も真実もありません

モバイル分析データのスクリーンショット

PC側解析データのスクリーンショット

全体のクローリング、分析、表示のプロセスは大きく次のステップに分かれており、Xiaoyan がそれぞれについて紹介します

  1. curlはZhihuのWebページデータをクロールします
  2. Zhihuウェブページデータの定期分析
  3. データストレージとプログラムの展開
  4. データ分析とプレゼンテーション

curlはWebデータをクロールします

PHP 用のカール拡張機能は、さまざまなタイプのプロトコルを使用してさまざまなサーバーに接続して通信できるようにする、PHP でサポートされているライブラリです。 Webページをクロールするのに非常に便利なツールであり、同時にマルチスレッド拡張もサポートしています。

このプログラムは、Zhihu がユーザーにアクセスを提供する個人情報ページ https://www.zhihu.com/people/xxx をキャプチャします。クロール プロセスでは、ページを取得するためにユーザーの Cookie が必要です。直接コードを書く

ページの Cookie を取得します

コードをコピーします コードは次のとおりです:
// Zhihu にログインし、パーソナル センターを開いて、コンソールを開いて、Cookie を取得します
ドキュメント.クッキー
"_za=67254197-3wwb8d-43f6-94f0-fb0e2d521c31; _ga=GA1.2.2142818188.1433767929; q_c1=78ee1604225d47d08cddd8142a08288b23|1452172601 |1452172601000; _xsrf=15f0639cbe6fb607560c075269064393; cap_id="N2QwMTExNGQ0YTY2NGVddlMGIyNmQ4NjdjOTU0YTM5MmQ=|1453444256|49fdc6b43dc51f 702b7 d6575451e228f56cdaf5d"; __utmt=1; lock_ticket = "QUJDTWpmM0lsZdd2dYQUFBQVlRSlZUVTNVb1ZaNDVoQXJlblVmWGJ0WGwyaHlDdVdscXdZU1VRPT0=|1453444421|c47a2afde1ff334d416bafb1cc267b41014c9d5f"; 54 390.21428dd18188.1433767929.1453187421.1453444257.3; __utmb=51854390.14.8.1453444425011; __utmc=51854390.14528 46679 .1.dd1.utmcsr=google|utmccn=(オーガニック)|utmcmd =organic| utmctr=(%20 が提供されていません); __utmv=51854390.100-1|2=登録日=20150823=1^dd3=エントリ日=20150823=1"

個人センターページをキャッチ

カールを使用し、クッキーを運び、最初に私のセンターページをつかんでください

リーリー

さらなるクロールのための Web ページデータと新しいリンクの定期的な分析

クロールされた Web ページを保存します。

。 Zhihu ページの分析を通じて、個人センター ページにはフォロワーと「いいね!」をした人やフォローしている人がいることがわかりました。 要想进行进一步的爬取,页面必须包含有可用于进一步爬取用户的链接 以下に示すように

コードをコピーします コードは次のとおりです: // クロールされた HTML ページで新しいユーザーが見つかり、クローラーに使用できます
e3baa16372767ba4dd78af55006edcd5

わかりました、この方法で自分自身を使用できます-》人をフォローする-》人のフォロワーをフォローする-》。 。 。継続的なクロール。次のステップは、定期的なマッチングを通じて情報を抽出することです

コードをコピーします コードは次のとおりです: // クロールされたページに一致するすべてのユーザーと一致します
preg_match_all('//people/([w-]+)"/i', $str, $match_arr);
//重複を削除して新しいユーザー配列にマージすると、ユーザーはさらにクロールできるようになります
self::$newUserArr = array_unique(array_merge($match_arr[1], self::$newUserArr));

この時点で、クロールプロセス全体がスムーズに進むことができます。

大量のデータをクロールする必要がある場合は、マルチスレッド高速クロールの
を検討できますが、ここでは説明しません。 curl_multipcntl

ユーザーデータを分析し、分析を提供します

正規表現を使用すると、さらに多くのユーザー データと照合し、それを直接コーディングできます。

リーリー

クロール プロセス中、可能であれば、Redis を介してデータベースに入る必要があります。これにより、クロールとウェアハウスの効率が実際に向上します。条件がない場合は、SQL を通じてのみ最適化できます。ここにいくつかの考えがあります。

データベーステーブルのインデックスを設計するときは注意してください。スパイダー クローリングのプロセスでは、ユーザー名にインデックスを付けず、主キーを含む左右のフィールドにインデックスを付けないことをお勧めします。

毎回 1 つずつ追加する 5,000 万のデータを想像してください。インデックスを作成するために必要です。クロールが完了し、データを分析する必要があると、インデックスがバッチで作成されます。 尽可能的提高入库效率

データの保存と更新の操作はバッチで実行する必要があります。 mysql による公式の提案と追加、削除、変更の速度: http://dev.mysql.com/doc/refman/5.7/en/insert-speed.html

リーリー

展開操作。クローリング処理中にプログラムが異常ハングする場合がありますので、効率と安定性を確保するために、可能な限りタイミングスクリプトを作成してください。時々異常終了しても、貴重な時間を無駄にしないように、時々強制終了して再実行してください。

#!/bin/bash

# 干掉
ps aux |grep spider |awk '{print $2}'|xargs kill -9
sleep 5s

# 重新跑
nohup /home/cuixiaohuan/lamp/php5/bin/php /home/cuixiaohuan/php/zhihu_spider/spider_new.php &  

数据分析呈现

数据的呈现主要使用echarts 3.0,感觉对于移动端兼容还不错。兼容移动端的页面响应式布局主要通过几个简单的css控制,代码如下

// 获取用户头像
preg_match('/<img.+src=\"&#63;([^\s]+\.(jpg|gif|bmp|bnp|png))\"&#63;.+>/i', $str, $match_img);
$img_url = $match_img[1];

// 匹配用户名:
// <span class="name">崔小拽</span>
preg_match('/<span.+class=\"&#63;name\"&#63;>([\x{4e00}-\x{9fa5}]+).+span>/u', $str, $match_name);
$user_name = $match_name[1];

// 匹配用户简介
// class bio span 中文
preg_match('/<span.+class=\"&#63;bio\"&#63;.+\>([\x{4e00}-\x{9fa5}]+).+span>/u', $str, $match_title);
$user_title = $match_title[1];

// 匹配性别
//<input type="radio" name="gender" value="1" checked="checked" class="male"/> 男  
// gender value1 ;结束 中文
preg_match('/<input.+name=\"&#63;gender\"&#63;.+value=\"&#63;1\"&#63;.+([\x{4e00}-\x{9fa5}]+).+\;/u', $str, $match_sex);
$user_sex = $match_sex[1];

// 匹配地区
//<span class="location item" title="北京">
preg_match('/<span.+class=\"&#63;location.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_city);
$user_city = $match_city[1];

// 匹配工作
//<span class="employment item" title="人见人骂的公司">人见人骂的公司</span>
preg_match('/<span.+class=\"&#63;employment.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_employment);
$user_employ = $match_employment[1];

// 匹配职位
// <span class="position item" title="程序猿"><a href="/topic/19590046" title="程序猿" class="topic-link" data-token="19590046" data-topicid="13253">程序猿</a></span>
preg_match('/<span.+class=\"&#63;position.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+).+\">/u', $str, $match_position);
$user_position = $match_position[1];

// 匹配学历
// <span class="education item" title="研究僧">研究僧</span>
preg_match('/<span.+class=\"&#63;education.+\"&#63;.+\"([\x{4e00}-\x{9fa5}]+)\">/u', $str, $match_education);
$user_education = $match_education[1];

// 工作情况
// <span class="education-extra item" title='挨踢'>挨踢</span>
preg_match('/<span.+class=\"&#63;education-extra.+\"&#63;.+>([\x{4e00}-
\x{9fa5}]+)</u', $str, $match_education_extra);
$user_education_extra = $match_education_extra[1];


// 匹配关注话题数量
// class="zg-link-litblue"><strong>41 个话题</strong></a>
preg_match('/class=\"&#63;zg-link-litblue\"&#63;><strong>(\d+)\s.+strong>/i', $str, $match_topic);
$user_topic = $match_topic[1];

// 关注人数
// <span class="zg-gray-normal">关注了
preg_match_all('/<strong>(\d+)<.+<label>/i', $str, $match_care);
$user_care = $match_care[1][0];
$user_be_careed = $match_care[1][1];

// 历史浏览量
// <span class="zg-gray-normal">个人主页被 <strong>17</strong> 人浏览</span>
preg_match('/class=\"&#63;zg-gray-normal\"&#63;.+>(\d+)<.+span>/i', $str, $match_browse);
$user_browse = $match_browse[1];

不足和待学习

整个过程中涉及php,shell,js,css,html,正则等语言和部署等基础知识,但还有诸多需要改进完善,小拽特此记录,后续补充例:

  1. php 采用multicul进行多线程。
  2. 正则匹配进一步优化
  3. 部署和抓取过程采用redis提升存储
  4. 移动端布局的兼容性提升
  5. js的模块化和sass书写css。

您可能感兴趣的文章:

  • php IIS日志分析搜索引擎爬虫记录程序
  • php 向访客和爬虫显示不同的内容
  • 一个PHP实现的轻量级简单爬虫
  • PHP实现简单爬虫的方法
  • PHP代码实现爬虫记录——超管用
  • PHP爬虫之百万级别知乎用户数据爬取与分析

www.bkjia.comtruehttp://www.bkjia.com/PHPjc/1096148.htmlTechArticlephp实现爬取和分析知乎用户数据,php 背景说明:小拽利用php的curl写的爬虫,实验性的爬取了知乎5w用户的基本信息;同时,针对爬取的数据...
声明:
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。