最初の 2 つの記事では、Mobike の インターフェイス を取得した理由とデータ分析の結果を分析しました。この記事では、Zhongjiao が実行可能ソースを直接提供しています学習用のコードです。
声明:
このクローラーは学習と研究目的のみに使用してください。
記事を読んだ場合は、直接ご連絡ください。気に入ったらスターを付けることを忘れないでください!
ディレクトリ構造- analysis - データ分析用の jupyter - influxdb にインポートします。
- module
s - プロキシモジュール
web - 当時はreactを学ぶためのものでした
- importtodb.py-分析用のpostgresデータベースにインポート
- sql.sql -create tablesql
- start.sh-継続的に実行されていますcoreコードコードはですは、crawler.py に配置され、データは最初に
- sqlite
3 データベースに保存され、スペースを節約するために重複排除後に CSV ファイルにエクスポートされます。自転車の場合、
Mobike の - API
は正方形の領域を返します。
左、
、
右、下をエリアごとに移動して、広いエリア全体のデータを作成します。これは、現在の成都環状高速道路内と南湖までの広場エリアです。 off
setはクロール間隔を定義しており、現在は 0.002 に基づいており、DigitalOcean 5$ サーバー
git clone https://github.com/derekhe/mobike-crawler python3 crawler.py
で 15 分に 1 回クロールできます。なぜですか。私はコルーチンを使用しませんでした、ハミング~~当時は習いませんでした~~~実際には可能です、おそらくより効率的です 小さな正方形領域間の重複を削除するには、データを取得した後に処理する必要があるためです。最後の group_data はまさにこれを行います def start(self):
left = 30.7828453209
top = 103.9213455517
right = 30.4781772402
bottom = 104.2178123382
offset = 0.002
if os.path.isfile(self.db_name):
os.remove(self.db_name)
try:
with sqlite3.connect(self.db_name) as c:
c.execute('''CREATE TABLE mobike
(Time DATETIME, bikeIds VARCHAR(12), bikeType TINYINT,distId INTEGER,distNum TINYINT, type TINYINT, x DOUBLE, y DOUBLE)''')
except Exception as ex:
pass
コア API コードは、いくつかの 変数を作成するだけです
executor = ThreadPoolExecutor(max_workers=250) print("Start") self.total = 0 lat_range = np.arange(left, right, -offset) for lat in lat_range: lon_range = np.arange(top, bottom, offset) for lon in lon_range: self.total += 1 executor.submit(self.get_nearby_bikes, (lat, lon)) executor.shutdown() self.group_data()最後に、Mobike はブロックされているかどうかを尋ねたいかもしれません。 IP アクセス速度の制限がありますが、それを解決する方法は、多数のプロキシ を使用することです。私は基本的に毎日 8,000 を超えるプロキシ プールを持っており、ProxyProvider でこのプロキシ プールを直接取得し、ピック機能を提供します。 上位 50 のプロキシをランダムに選択します。プロキシ プールは 1 時間ごとに更新されます
が、コードで提供されている
jsonblob プロキシ リストは単なるサンプルであり、しばらくするとそのほとんどが無効になることに注意してください。
ここでは代理スコアリングメカニズムが使用されます。エージェントを直接ランダムに選択するのではなく、スコアに従ってエージェントを並べ替えました。リクエストが成功するとポイントが追加され、リクエストが失敗するとポイントが減点されます。これにより、最適なスピードと品質を備えたエージェントを短時間で選択することができます。保存しておいて、必要に応じて次回使用することができます。 def get_nearby_bikes(self, args):
try:
url = "https://mwx.mobike.com/mobike-api/rent/nearbyBikesInfo.do"
payload = "latitude=%s&longitude=%s&errMsg=getMapCenterLocation" % (args[0], args[1])
headers = {
'charset': "utf-8",
'platform': "4",
"referer":"https://servicewechat.com/wx40f112341ae33edb/1/",
'content-type': "application/x-www-form-urlencoded",
'user-agent': "MicroMessenger/6.5.4.1000 NetType/WIFI Language/zh_CN",
'host': "mwx.mobike.com",
'connection': "Keep-Alive",
'accept-encoding': "gzip",
'cache-control': "no-cache"
}
self.request(headers, payload, args, url)
except Exception as ex:
print(ex)
実際に使用する場合は、proxyProvider.pick()でプロキシを選択して使用します。プロキシに問題がある場合は、proxy.fatal_error() を直接使用してスコアを下げ、今後このプロキシが選択されないようにします。
class ProxyProvider: def init(self, min_proxies=200): self._bad_proxies = {} self._minProxies = min_proxies self.lock = threading.RLock() self.get_list() def get_list(self): logger.debug("Getting proxy list") r = requests.get("https://jsonblob.com/31bf2dc8-00e6-11e7-a0ba-e39b7fdbe78b", timeout=10) proxies = ujson.decode(r.text) logger.debug("Got %s proxies", len(proxies)) self._proxies = list(map(lambda p: Proxy(p), proxies)) def pick(self): with self.lock: self._proxies.sort(key = lambda p: p.score, reverse=True) proxy_len = len(self._proxies) max_range = 50 if proxy_len > 50 else proxy_len proxy = self._proxies[random.randrange(1, max_range)] proxy.used() return proxy
わかりました、基本的にはこれです~~~他のコードは自分で勉強してください~~~
以上がMobike クローラーのソースコード分析の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

Tomergelistsinpython、あなたはオペレーター、extendmethod、listcomfulting、olitertools.chain、それぞれの特異的advantages:1)operatorissimplebutlessforlargelist;

Python 3では、2つのリストをさまざまな方法で接続できます。1)小さなリストに適したオペレーターを使用しますが、大きなリストには非効率的です。 2)メモリ効率が高い大規模なリストに適した拡張方法を使用しますが、元のリストは変更されます。 3)元のリストを変更せずに、複数のリストをマージするのに適した *オペレーターを使用します。 4)Itertools.chainを使用します。これは、メモリ効率が高い大きなデータセットに適しています。

Join()メソッドを使用することは、Pythonのリストから文字列を接続する最も効率的な方法です。 1)join()メソッドを使用して、効率的で読みやすくなります。 2)サイクルは、大きなリストに演算子を非効率的に使用します。 3)リスト理解とJoin()の組み合わせは、変換が必要なシナリオに適しています。 4)redoce()メソッドは、他のタイプの削減に適していますが、文字列の連結には非効率的です。完全な文は終了します。

pythonexexecutionistheprocessoftransforningpythoncodeintoexecutabletructions.1)interpreterreadSthecode、変換intobytecode、thepythonvirtualmachine(pvm)executes.2)theglobalinterpreeterlock(gil)管理委員会、

Pythonの主な機能には次のものがあります。1。構文は簡潔で理解しやすく、初心者に適しています。 2。動的タイプシステム、開発速度の向上。 3。複数のタスクをサポートするリッチ標準ライブラリ。 4.強力なコミュニティとエコシステム、広範なサポートを提供する。 5。スクリプトと迅速なプロトタイピングに適した解釈。 6.さまざまなプログラミングスタイルに適したマルチパラダイムサポート。

Pythonは解釈された言語ですが、コンパイルプロセスも含まれています。 1)Pythonコードは最初にBytecodeにコンパイルされます。 2)ByteCodeは、Python Virtual Machineによって解釈および実行されます。 3)このハイブリッドメカニズムにより、Pythonは柔軟で効率的になりますが、完全にコンパイルされた言語ほど高速ではありません。

useaforloopwhenteratingoverasequenceor foraspificnumberoftimes; useawhileloopwhentinuninguntinuntilaConditionismet.forloopsareidealforknownownownownownownoptinuptinuptinuptinuptinutionsituations whileoopsuitsituations withinterminedationations。

pythonloopscanleadtoErrorslikeinfiniteloops、ModifiningListsDuringiteration、Off-Oneerrors、Zero-dexingissues、およびNestededLoopinefficiencies.toavoidhese:1)use'i


ホットAIツール

Undresser.AI Undress
リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover
写真から衣服を削除するオンライン AI ツール。

Undress AI Tool
脱衣画像を無料で

Clothoff.io
AI衣類リムーバー

Video Face Swap
完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

人気の記事

ホットツール

SublimeText3 中国語版
中国語版、とても使いやすい

WebStorm Mac版
便利なJavaScript開発ツール

ゼンドスタジオ 13.0.1
強力な PHP 統合開発環境

SublimeText3 Linux 新バージョン
SublimeText3 Linux 最新バージョン

ドリームウィーバー CS6
ビジュアル Web 開発ツール
