python爬虫代码示例分享

angryTom

angryTom

2020-03-06

13583人浏览

原创

这篇文章主要介绍了三个python爬虫项目实例代码,使用了urllib2库,文中示例代码非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下。

python爬虫代码示例分享

一、爬取故事段子:推荐学习:Python视频教程

注:部分代码无法正常运行,但仍有一定的参考价值。

#encoding=utf-8
import urllib2
 
import re
 
 
class neihanba():
  def spider(self):
    '''
    爬虫的主调度器
    '''
    isflow=True#判断是否进行下一页
    page=1
    while isflow:
      url="http://www.neihanpa.com/article/list_5_"+str(page)+".html"
      html=self.load(url)
      self.deal(html,page)
      panduan=raw_input("是否继续(y/n)!")
      if panduan=="y":
        isflow=True
        page+=1
      else:
        isflow=False
  def load(self,url):
    '''
    针对url地址进行全部爬去
    :param url: url地址
    :return: 返回爬去的内容
    '''
    header = {
      "User-Agent": " Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.79 Safari/537.36"
    }
    request = urllib2.Request(url, headers=header)
    response = urllib2.urlopen(request)
    html = response.read()
    return html
  def deal(self,html,page):
    '''
    对之前爬去的内容进行正则匹配,匹配出标题和正文内容
    :param html:之前爬去的内容
    :param page: 正在爬去的页码
    '''
    parrten=re.compile('
  • (.*?)
  • ',re.S)     titleList=parrten.findall(html)     for title in titleList:       parrten1=re.compile('(.*)')       ti1=parrten1.findall(title)       parrten2=re.compile('
    (.*?)
    ',re.S)       til2=parrten2.findall(title)       for t in ti1:         tr=t.replace("","").replace("","")         self.writeData(tr,page)       for t in til2:         tr=t.replace("

    ","").replace("

    Python 3.14.2
    Python 3.14.2

    Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。

    下载
    ","").replace("
    ","").replace("
    ","").replace("&ldquo","\"").replace("&rdquo","\"")         self.writeData(tr,page)   def writeData(self,context,page):     '''     将最终爬去的内容写入文件中     :param context: 匹配好的内容     :param page: 当前爬去的页码数     '''     fileName = "di" + str(page) + "yehtml.txt"     with open(fileName, "a") as file:       file.writelines(context + "\n") if __name__ == '__main__':   n=neihanba()   n.spider()

    二、爬取智联:

    #encoding=utf-8
    import urllib
    import urllib2
     
    import re
     
     
    class zhiLian():
      def spider(self,position,workPlace):
        '''
        爬虫的主调度器
        :param position: 职位
        :param workPlace: 工作地点
        '''
        url="http://sou.zhaopin.com/jobs/searchresult.ashx?"
        url+=urllib.urlencode({"jl":workPlace})
        url+="&"
        url+=urllib.urlencode({"kw":position})
        isflow=True#是否进行下一页的爬去
        page=1
        while isflow:
          url+="&"+str(page)
          html=self.load(url)
          self.deal1(html,page)
          panduan = raw_input("是否继续爬虫下一页(y/n)!")
          if panduan == "y":
            isflow = True
            page += 1
          else:
            isflow = False
      def load(self,url):
        '''
        针对url地址进行全部爬去
        :param url: url地址
        :return: 返回爬去的内容
        '''
        header = {
          "User-Agent": " Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.79 Safari/537.36"
        }
        request = urllib2.Request(url, headers=header)
        response = urllib2.urlopen(request)
        html = response.read()
        return html
      def deal1(self,html,page):
        '''
     
        对之前爬去的内容进行正则匹配,匹配职位所对应的链接
        :param html:之前爬去的内容
        :param page: 正在爬去的页码
        '''
        parrten=re.compile('<a>.*?</a>',re.S)
        til=parrten.findall(html)#爬去链接
        for t in til:
          self.deal2(t,page)
      def deal2(self,t,page):
        '''
        进行二次爬虫,然后在新的页面中对公司、薪资、工作经验进行匹配
        :param t: url地址
        :param page: 当前匹配的页数
        '''
        html=self.load(t)#返回二次爬虫的内容
        parrten1=re.compile('<a>(.*?)\s+.*?@@##@@</a>',re.S)
        parrten2=re.compile('
  • 职位月薪:(.*?) .*?
  • ',re.S)     parrent3=re.compile('
  • 工作经验:(.*?)
  • ',re.S)     til1=parrten1.findall(html)     til2=parrten2.findall(html)     til3=parrent3.findall(html)     str=""     for t in til1:       t=t.replace('@@##@@',"")       str+=t       str+="\t"     for t in til2:       str+=t       str += "\t"     for t in til3:       str+=t     self.writeData(str,page)   def writeData(self,context,page):     '''     将最终爬去的内容写入文件中     :param context: 匹配好的内容      :param page: 当前爬去的页码数     '''     fileName = "di" + str(page) + "yehtml.txt"     with open(fileName, "a") as file:       file.writelines(context + "\n") if __name__ == '__main__':   position=raw_input("请输入职位:")   workPlace=raw_input("请输入工作地点:")   z=zhiLian()   z.spider(position,workPlace)

    三、爬取贴吧:

    #encoding=utf-8
    import urllib
    import urllib2
     
    import re
     
     
    class teiba():
      def spider(self,name,startPage,endPage):
        url="http://tieba.baidu.com/f?ie=utf-8&"
        url+=urllib.urlencode({"kw":name})
        for page in range(startPage,endPage+1):
          pn=50*(page-1)
          urlFull=url+"&"+urllib.urlencode({"pn":pn})
          html=self.loadPage(url)
          self.dealPage(html,page)
     
      def loadPage(self,url):
        header={
          "User-Agent":" Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.79 Safari/537.36"
        }
        request=urllib2.Request(url,headers=header)
        response=urllib2.urlopen(request)
        html=response.read()
        return html
      def dealPage(self,html,page):
        partten=re.compile(r'<a>(.*?)</a>',re.S)
        titleList=partten.findall(html)
        rstr=r'<span>#(.*?)#</span>'
        for title in titleList:
          title=re.sub(rstr,"",title)
          self.writePage(title,page)
      def writePage(self,context,page):
        fileName="di"+str(page)+"yehtml.txt"
        with open(fileName,"a") as file:
          file.writelines(context+"\n")
    if __name__ == '__main__':
      name=raw_input("请输入贴吧名:")
      startPage=raw_input("请输入起始页:")
      endPage=raw_input("请输入终止页:")
      t=teiba()
      t.spider(name,int(startPage),int(endPage))

    更多相关教程,请关注Python教程栏目。

    Python免费学习笔记(深入):立即使用
    在学习笔记中,你将探索 Python 的核心概念和高级技巧!

    相关文章

    python速学教程(入门到精通)
    python速学教程(入门到精通)

    python怎么学习?python怎么入门?python在哪学?python怎么学才快?不用担心,这里为大家提供了python速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

    下载

    相关标签:

    python 爬虫

    本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

    相关专题

    更多
    墨刀AI提示词教学
    墨刀AI提示词教学

    本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

    2026.08.04

    10

    21

    墨刀AI完整入门
    墨刀AI完整入门

    PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

    2026.08.04

    8

    20

    墨刀AI进阶技巧
    墨刀AI进阶技巧

    本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

    2026.08.04

    10

    14

    火山引擎实名认证失败怎么办
    火山引擎实名认证失败怎么办

    火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

    2026.08.04

    5

    10

    火山引擎域名备案流程详解
    火山引擎域名备案流程详解

    火山引擎域名备案适合需要在火山引擎云服务器、对象存储、CDN或网站服务上绑定域名的用户参考。本专题整理备案入口、账号实名认证、备案类型选择、主体信息填写、网站信息提交、资料上传、初审核验、管局审核和备案失败排查,帮助用户完成网站上线前的备案流程。

    2026.08.04

    1

    10

    火山引擎DNS解析配置步骤
    火山引擎DNS解析配置步骤

    使用火山引擎DNS解析网站域名时,需要确认域名已完成管理接入,并正确配置服务器IP、CNAME地址或验证记录。本专题整理域名添加、记录类型选择、TTL设置、解析状态检查、备案和访问测试等流程,适合新手搭建网站时参考。

    2026.08.04

    3

    10

    火山引擎对象存储使用教程
    火山引擎对象存储使用教程

    火山引擎对象存储适合用于网站图片、视频文件、备份数据、静态资源和应用附件管理。本专题整理TOS控制台入口、存储桶创建、地域选择、权限设置、文件上传、访问链接生成、CDN加速、费用查看和常见上传或访问失败问题,帮助用户快速掌握对象存储基础操作。

    2026.08.04

    1

    10

    火山引擎云服务器使用教程
    火山引擎云服务器使用教程

    火山引擎云服务器使用教程适合第一次购买、部署和管理云服务器的用户参考。本专题整理控制台入口、实例创建、地域和配置选择、系统镜像设置、安全组放行、远程连接、网站部署、续费计费和常见连接失败问题,帮助用户快速完成云服务器基础使用流程。

    2026.08.04

    5

    10

    火山引擎API Key绑定大模型教程
    火山引擎API Key绑定大模型教程

    火山引擎API Key怎么绑定大模型适合需要在火山方舟、应用后台、脚本工具或AI编程软件中调用模型的开发者参考。本专题整理控制台服务开通、API Key创建、模型权限检查、模型ID选择、Base URL填写、调用测试和鉴权失败排查,帮助用户完成从密钥到模型调用的配置流程。

    2026.08.04

    2

    10

    热门下载

    更多
    网站特效
    /
    网站源码
    /
    网站素材
    /
    前端模板

    精品课程

    更多
    相关推荐
    /
    热门推荐
    /
    最新课程
    PyCharm官方快速入门指南
    PyCharm官方快速入门指南

    共0课时 | 0人学习

    Python函数定义官方教程
    Python函数定义官方教程

    共0课时 | 0人学习

    Python 3.14.6官方文档
    Python 3.14.6官方文档

    共0课时 | 0人学习