Python を使用してジョブ分析レポートを実装する方法-Python チュートリアル-php.cn

ホームページ

バックエンド開発

Python チュートリアル

Python を使用してジョブ分析レポートを実装する方法

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

May 01, 2023 pm 10:07 PM

python

1. この記事の目的

Ajax リクエストを取得し、JSON の必須フィールドを解析します

データを Excel に保存します

データを MySQL に保存します。簡単分析

2. 分析結果

1. ライブラリの紹介

5都市におけるPythonポジションの平均給与水準

2. ページ構成

クエリを入力します。例として条件は Python です。他の条件はデフォルトでは選択されていません。すべての Python の位置を表示するには、[クエリ] をクリックします。次に、コンソールを開いて [ネットワーク] タブをクリックすると、次のリクエストが表示されます:

Python を使用してジョブ分析レポートを実装する方法

#応答結果から判断すると、このリクエストはまさに必要なものです。後でこのアドレスを直接リクエストすることができます。写真からわかるように、各位置の情報は次の結果になります。

ここで、データをリクエストする場所と結果を取得する場所がわかります。しかし、結果リストの最初のページには 15 個のデータしかありません。他のページのデータを取得するにはどうすればよいでしょうか?

3. リクエストパラメーター

次のようにパラメータータブをクリックします:

3 つのフォームデータが送信されたことがわかりました。kd がキーワードであることは明らかです。 pn は現在のページ番号です。デフォルトで最初に設定するだけなので、心配する必要はありません。残っているのは、30 ページのデータをダウンロードするリクエストを作成することだけです。

4. リクエストの構築とデータの解析

リクエストの構築は非常に簡単ですが、これを行うには引き続きリクエストライブラリを使用します。まず、フォームデータ

data = {&#39;first&#39;: &#39;true&#39;, &#39;pn&#39;: page, &#39;kd&#39;: lang_name}

を構築し、リクエストを使用して URL アドレスを要求すると、解析された JSON データが完成します。 Lagouではクローラーの制限が厳しいので、ブラウザのヘッダーフィールドを全て追加し、クローラー間隔を長くする必要がありますが、10～20秒後に設定したところ、正常にデータが取得できるようになりました。

import requests

def get_json(url, page, lang_name):
   headers = {
       &#39;Host&#39;: &#39;www.lagou.com&#39;,
       &#39;Connection&#39;: &#39;keep-alive&#39;,
       &#39;Content-Length&#39;: &#39;23&#39;,
       &#39;Origin&#39;: &#39;https://www.lagou.com&#39;,
       &#39;X-Anit-Forge-Code&#39;: &#39;0&#39;,
       &#39;User-Agent&#39;: &#39;Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:61.0) Gecko/20100101 Firefox/61.0&#39;,
       &#39;Content-Type&#39;: &#39;application/x-www-form-urlencoded; charset=UTF-8&#39;,
       &#39;Accept&#39;: &#39;application/json, text/javascript, */*; q=0.01&#39;,
       &#39;X-Requested-With&#39;: &#39;XMLHttpRequest&#39;,
       &#39;X-Anit-Forge-Token&#39;: &#39;None&#39;,
       &#39;Referer&#39;: &#39;https://www.lagou.com/jobs/list_python?city=%E5%85%A8%E5%9B%BD&cl=false&fromSearch=true&labelWords=&suginput=&#39;,
       &#39;Accept-Encoding&#39;: &#39;gzip, deflate, br&#39;,
       &#39;Accept-Language&#39;: &#39;en-US,en;q=0.9,zh-CN;q=0.8,zh;q=0.7&#39;
   }
   data = {&#39;first&#39;: &#39;false&#39;, &#39;pn&#39;: page, &#39;kd&#39;: lang_name}
   json = requests.post(url, data, headers=headers).json()
   list_con = json[&#39;content&#39;][&#39;positionResult&#39;][&#39;result&#39;]
   info_list = []
   for i in list_con:
       info = []
       info.append(i.get(&#39;companyShortName&#39;, &#39;无&#39;))
       info.append(i.get(&#39;companyFullName&#39;, &#39;无&#39;))
       info.append(i.get(&#39;industryField&#39;, &#39;无&#39;))
       info.append(i.get(&#39;companySize&#39;, &#39;无&#39;))
       info.append(i.get(&#39;salary&#39;, &#39;无&#39;))
       info.append(i.get(&#39;city&#39;, &#39;无&#39;))
       info.append(i.get(&#39;education&#39;, &#39;无&#39;))
       info_list.append(info)
   return info_list

4. すべてのデータを取得する

データの解析方法を理解したので、残っているのはすべてのページを連続的にリクエストすることだけです。30 ページすべてのデータをリクエストする関数を構築します。。

rree

以上がPython を使用してジョブ分析レポートを実装する方法の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明

この記事は亿速云で複製されています。侵害がある場合は、admin@php.cn までご連絡ください。

Pythonアレイをどのようにスライスしますか？May 01, 2025 am 12:18 AM

Pythonリストスライスの基本的な構文はリストです[start：stop：step]。 1.STARTは最初の要素インデックス、2。ストップは除外された最初の要素インデックスであり、3.ステップは要素間のステップサイズを決定します。スライスは、データを抽出するためだけでなく、リストを変更および反転させるためにも使用されます。

どのような状況で、リストは配列よりもパフォーマンスが向上しますか？May 01, 2025 am 12:06 AM

ListSoutPerformArraysIn：1）ダイナミシジョンアンドフレーケンティオン/削除、2）ストーリングヘテロゼンダタ、および3）メモリ効率の装飾、ButmayhaveslightPerformancostsinceNASOPERATIONS。

PythonアレイをPythonリストに変換するにはどうすればよいですか？May 01, 2025 am 12:05 AM

toconvertapythonarraytoalist、usetheList（）constructororageneratorexpression.1）importhearraymoduleandcreateanarray.2）useList（arr）または[xforxinarr] toconvertoalistは、largedatatessを変えることを伴うものです。

Pythonにリストが存在する場合、配列を使用する目的は何ですか？May 01, 2025 am 12:04 AM

choosearraysoverlistsinperbetterperformance andmemoryeficiencyspecificscenarios.1）largeNumericaldatasets：Araysreducememoryusage.2）パフォーマンス - クリティカル操作：ArraysOfferSpeedBoostsfortsfortsclikeappendedoring.3）タイプリー：Arrayesenforc

リストの要素と配列を繰り返す方法を説明します。May 01, 2025 am 12:01 AM

Pythonでは、ループに使用し、列挙し、包括的なリストを通過することができます。 Javaでは、従来のループを使用し、ループを強化してアレイを通過することができます。 1。Pythonリストトラバーサル方法は、ループ、列挙、およびリスト理解のためのものです。 2。Javaアレイトラバーサル法には、従来のループとループ用の強化が含まれます。

Python Switchステートメントとは何ですか？Apr 30, 2025 pm 02:08 PM

この記事では、バージョン3.10で導入されたPythonの新しい「マッチ」ステートメントについて説明します。これは、他の言語のスイッチステートメントに相当するものです。コードの読みやすさを向上させ、従来のif-elif-elよりもパフォーマンスの利点を提供します

Pythonの例外グループとは何ですか？Apr 30, 2025 pm 02:07 PM

Python 3.11の例外グループは、複数の例外を同時に処理することで、同時シナリオと複雑な操作でエラー管理を改善します。

Pythonの関数注釈とは何ですか？Apr 30, 2025 pm 02:06 PM

Pythonの関数注釈は、タイプチェック、ドキュメント、およびIDEサポートの関数にメタデータを追加します。それらはコードの読みやすさ、メンテナンスを強化し、API開発、データサイエンス、ライブラリの作成において重要です。

See all articles

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

MantisBT

Mantis は、製品の欠陥追跡を支援するために設計された、導入が簡単な Web ベースの欠陥追跡ツールです。 PHP、MySQL、Web サーバーが必要です。デモおよびホスティングサービスをチェックしてください。

mPDF

mPDF は、UTF-8 でエンコードされた HTML から PDF ファイルを生成できる PHP ライブラリです。オリジナルの作者である Ian Back は、Web サイトから「オンザフライ」で PDF ファイルを出力し、さまざまな言語を処理するために mPDF を作成しました。 HTML2FPDF などのオリジナルのスクリプトよりも遅く、Unicode フォントを使用すると生成されるファイルが大きくなりますが、CSS スタイルなどをサポートし、多くの機能強化が施されています。 RTL (アラビア語とヘブライ語) や CJK (中国語、日本語、韓国語) を含むほぼすべての言語をサポートします。ネストされたブロックレベル要素 (P、DIV など) をサポートします。