ホームページ >バックエンド開発 >Python チュートリアル >Python を使用して求人サイトの情報を取得する

Python を使用して求人サイトの情報を取得する

高洛峰オリジナル: 2017-03-19 14:05:292149ブラウズ

この記事ではPythonを使って求人サイトから情報を取り込む方法を紹介します

今回取り込んだ情報はZhaopinの求人サイトで「データアナリスト」を検索した後の情報です。

pythonバージョン: python3.5。

メインで使っているパッケージは Beautifulsoup + Requests + csv です

さらに、募集内容の簡単な説明も掴みました。

csvファイルに出力後、Excelで開くと文字化けが発生しましたが、ファイルソフト(notepad++など)で開くと問題ありませんでした。

Excelで開いたときに正しく表示するために、pandasを使用して以下を変換し、列名を追加しました。変換が完了すると、正しく表示されるようになります。 pandas での変換については、私のブログを参照してください:

募集内容は記述が多いので、最後に csv ファイルを Excel ファイルとして保存し、見やすい形式に調整します。

最終的な効果は次のとおりです: Python を使用して求人サイトの情報を取得する

実装コードは次のとおりです: 情報クローリングのコードは次のとおりです:

# Code based on Python 3.x
# _*_ coding: utf-8 _*_
# __Author: "LEMON"


from bs4 import BeautifulSoup
import requests
import csv


def download(url):
    headers = {&#39;User-Agent&#39;: &#39;Mozilla/5.0 (Windows NT 6.1; WOW64; rv:51.0) Gecko/20100101 Firefox/51.0&#39;}
    req = requests.get(url, headers=headers)
    return req.text


def get_content(html):
    soup = BeautifulSoup(html, &#39;lxml&#39;)
    body = soup.body
    data_main = body.find(&#39;div&#39;, {&#39;class&#39;: &#39;newlist_list_content&#39;})
    tables = data_main.find_all(&#39;table&#39;)

    zw_list = []
    for i,table in enumerate(tables):
        if i == 0:
            continue
        temp = []
        tds = table.find(&#39;tr&#39;).find_all(&#39;td&#39;)
        zwmc = tds[0].find(&#39;a&#39;).get_text()
        zw_link = tds[0].find(&#39;a&#39;).get(&#39;href&#39;)
        fkl = tds[1].find(&#39;span&#39;).get_text()
        gsmc = tds[2].find(&#39;a&#39;).get_text()
        zwyx = tds[3].get_text()
        gzdd = tds[4].get_text()
        gbsj = tds[5].find(&#39;span&#39;).get_text()

        tr_brief = table.find(&#39;tr&#39;, {&#39;class&#39;: &#39;newlist_tr_detail&#39;})
        brief = tr_brief.find(&#39;li&#39;, {&#39;class&#39;: &#39;newlist_deatil_last&#39;}).get_text()

        temp.append(zwmc)
        temp.append(fkl)
        temp.append(gsmc)
        temp.append(zwyx)
        temp.append(gzdd)
        temp.append(gbsj)
        temp.append(brief)
        temp.append(zw_link)

        zw_list.append(temp)
    return zw_list


def write_data(data, name):
    filename = name
    with open(filename, &#39;a&#39;, newline=&#39;&#39;, encoding=&#39;utf-8&#39;) as f:
        f_csv = csv.writer(f)
        f_csv.writerows(data)

if __name__ == &#39;__main__&#39;:

    basic_url = &#39;http://sou.zhaopin.com/jobs/searchresult.ashx?jl=%E5%85%A8%E5%9B%BD&kw=%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E5%B8%88&sm=0&p=&#39;

    number_list = list(range(90)) # total number of page is 90
    for number in number_list:
        num = number + 1
        url = basic_url + str(num)
        filename = &#39;zhilian_DA.csv&#39;
        html = download(url)
        # print(html)
        data = get_content(html)
        # print(data)
        print(&#39;start saving page:&#39;, num)
        write_data(data, filename)

pandas で変換されたコードは次のとおりです:

# Code based on Python 3.x
# _*_ coding: utf-8 _*_
# __Author: "LEMON"

import pandas as pd

df = pd.read_csv(&#39;zhilian_DA.csv&#39;, header=None)


df.columns = [&#39;职位名称&#39;, &#39;反馈率&#39;, &#39;公司名称&#39;, &#39;月薪&#39;, &#39;工作地点&#39;,
           &#39;发布日期&#39;, &#39;招聘简介&#39;, &#39;网页链接&#39;]

# 将调整后的dataframe文件输出到新的csv文件
df.to_csv(&#39;zhilian_DA_update.csv&#39;, index=False)

以上がPython を使用して求人サイトの情報を取得するの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明：

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

前の記事：Python での __name__ 値のテストの詳細な紹介次の記事：Python での __name__ 値のテストの詳細な紹介

続きを見る