Python爬取可用的代理IP

高洛峰原創: 2017-02-25 10:57:122000瀏覽

前言

就以最近發現的一個免費代理IP網站為例：http://www.xicidaili.com/nn/。使用的時候發現很多IP都用不了。

所以用Python寫了個腳本，該腳本可以把能用的代理IP偵測出來。

腳本如下：

#encoding=utf8
import urllib2
from bs4 import BeautifulSoup
import urllib
import socket
 
User_Agent = &#39;Mozilla/5.0 (Windows NT 6.3; WOW64; rv:43.0) Gecko/20100101 Firefox/43.0&#39;
header = {}
header[&#39;User-Agent&#39;] = User_Agent
 
&#39;&#39;&#39;
获取所有代理IP地址
&#39;&#39;&#39;
def getProxyIp():
 proxy = []
 for i in range(1,2):
  try:
   url = &#39;http://www.xicidaili.com/nn/&#39;+str(i)
   req = urllib2.Request(url,headers=header)
   res = urllib2.urlopen(req).read()
   soup = BeautifulSoup(res)
   ips = soup.findAll(&#39;tr&#39;)
   for x in range(1,len(ips)):
    ip = ips[x]
    tds = ip.findAll("td")
    ip_temp = tds[1].contents[0]+"\t"+tds[2].contents[0]
    proxy.append(ip_temp)
  except:
   continue
 return proxy
  
&#39;&#39;&#39;
验证获得的代理IP地址是否可用
&#39;&#39;&#39;
def validateIp(proxy):
 url = "http://ip.chinaz.com/getip.aspx"
 f = open("E:\ip.txt","w")
 socket.setdefaulttimeout(3)
 for i in range(0,len(proxy)):
  try:
   ip = proxy[i].strip().split("\t")
   proxy_host = "http://"+ip[0]+":"+ip[1]
   proxy_temp = {"http":proxy_host}
   res = urllib.urlopen(url,proxies=proxy_temp).read()
   f.write(proxy[i]+&#39;\n&#39;)
   print proxy[i]
  except Exception,e:
   continue
 f.close()
 
    
if __name__ == &#39;__main__&#39;:
 proxy = getProxyIp()
 validateIp(proxy)

# 運行成功後，開啟E磁碟下的文件，可以看到如下可用的代理IP位址和連接埠：

Python爬取可用的代理IP

總結

這只是爬取的第一頁的IP位址，如有需要，可以多爬取幾頁。同時，網站是時時更新的，建議爬取時只爬取前幾頁的即可。以上就是本文的全部內容，希望對大家學習使用Python能有所幫助。

更多Python爬取可用的代理IP相關文章請關注PHP中文網！

陳述：

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

上一篇：python3根據關鍵字爬取百度百科的內容下一篇：python3根據關鍵字爬取百度百科的內容

看更多