首頁  >  文章  >  後端開發  >  Python3使用requests套件抓取並保存網頁原始碼的方法介紹

Python3使用requests套件抓取並保存網頁原始碼的方法介紹

高洛峰
高洛峰原創
2017-03-07 15:50:192374瀏覽

本文實例講述了Python3使用requests套件抓取並保存網頁原始碼的方法。分享給大家供大家參考,具體如下:

使用Python 3的requests模組抓取網頁原始碼並儲存到檔案範例:

import requests
html = requests.get("http://www.baidu.com")
with open('test.txt','w',encoding='utf-8') as f:
 f.write(html.text)

#這是一個基本的檔案保存操作,但這裡有幾個值得注意的問題:

1.安裝requests包,命令列輸入pip install requests即可自動安裝。很多人推薦使用requests,自帶的urllib.request也可以抓取網頁原始碼

2.open方法encoding參數設為utf-8,否則儲存的檔案會出現亂碼。

3.如果直接在cmd中輸出抓取的內容,會提示各種編碼錯誤,所以儲存到檔案檢視。

4.with open方法是更好的寫法,可以自動操作完畢後釋放資源。

另一個例子:

import requests
ff = open('testt.txt','w',encoding='utf-8')
with open('test.txt',encoding="utf-8") as f:
 for line in f:
 ff.write(line)
ff.close()

這是一個演示讀取一個txt文件,每次讀取一行,並保存到另一個txt文件中的範例。

因為在命令列中列印每次讀取一行的數據,中文會出現編碼錯誤,所以每次讀取一行並保存到另一個文件,這樣來測試讀取是否正常。 (注意open的時候制定encoding編碼方式)

更多Python3使用requests包抓取並保存網頁源碼的方法介紹相關文章請關注PHP中文網!

陳述:
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn