抓取網易新聞的python程式碼範例-Python教學-PHP中文網

首頁

後端開發

Python教學

抓取網易新聞的python程式碼範例

Y2J

May 03, 2017 pm 04:03 PM

python抓取正規則網易新聞

这篇文章主要介绍了Python正则抓取网易新闻的方法,结合实例形式较为详细的分析了Python使用正则进行网易新闻抓取操作的相关实现技巧与注意事项,需要的朋友可以参考下

本文实例讲述了Python正则抓取网易新闻的方法。分享给大家供大家参考，具体如下：

自己写了些关于抓取网易新闻的爬虫，发现其网页源代码与网页的评论根本就对不上，所以，采用了抓包工具得到了其评论的隐藏地址（每个浏览器都有自己的抓包工具，都可以用来分析网站）

如果仔细观察的话就会发现，有一个特殊的，那么这个就是自己想要的了

然后打开链接就可以找到相关的评论内容了。（下图为第一页内容）

接下来就是代码了(也照着大神的改改写写了)。

#coding=utf-8
import urllib2
import re
import json
import time
class WY():
  def __init__(self):
    self.headers = {&#39;User-Agent&#39;: &#39;Mozilla/5.0 (Windows NT 5.1) AppleWebKit/534.24 (KHTML, like &#39;}
    self.url=&#39;http://comment.news.163.com/data/news3_bbs/df/B9IBDHEH000146BE_1.html&#39;
  def getpage(self,page):
    full_url=&#39;http://comment.news.163.com/cache/newlist/news3_bbs/B9IBDHEH000146BE_&#39;+str(page)+&#39;.html&#39;
    return full_url
  def gethtml(self,page):
    try:
      req=urllib2.Request(page,None,self.headers)
      response = urllib2.urlopen(req)
      html = response.read()
      return html
    except urllib2.URLError,e:
      if hasattr(e,&#39;reason&#39;):
        print u"连接失败",e.reason
        return None
  #处理字符串
  def Process(self,data,page):
    if page == 1:
      data=data.replace(&#39;var replyData=&#39;,&#39;&#39;)
    else:
      data=data.replace(&#39;var newPostList=&#39;,&#39;&#39;)
    reg1=re.compile(" \[<a href=&#39;&#39;>")
    data=reg1.sub(&#39; &#39;,data)
    reg2=re.compile(&#39;<\\\/a>\]&#39;)
    data=reg2.sub(&#39;&#39;,data)
    reg3=re.compile(&#39;<br>&#39;)
    data=reg3.sub(&#39;&#39;,data)
    return data
  #解析json
  def dealJSON(self):
    with open("WY.txt","a") as file:
      file.write(&#39;ID&#39;+&#39;|&#39;+&#39;评论&#39;+&#39;|&#39;+&#39;踩&#39;+&#39;|&#39;+&#39;顶&#39;+&#39;\n&#39;)
    for i in range(1,12):
      if i == 1:
        data=self.gethtml(self.url)
        data=self.Process(data,i)[:-1]
        value=json.loads(data)
        file=open(&#39;WY.txt&#39;,&#39;a&#39;)
        for item in value[&#39;hotPosts&#39;]:
          try:
            file.write(item[&#39;1&#39;][&#39;f&#39;].encode(&#39;utf-8&#39;)+&#39;|&#39;)
            file.write(item[&#39;1&#39;][&#39;b&#39;].encode(&#39;utf-8&#39;)+&#39;|&#39;)
            file.write(item[&#39;1&#39;][&#39;a&#39;].encode(&#39;utf-8&#39;)+&#39;|&#39;)
            file.write(item[&#39;1&#39;][&#39;v&#39;].encode(&#39;utf-8&#39;)+&#39;\n&#39;)
          except:
            continue
        file.close()
        print &#39;--正在采集%d/12--&#39;%i
        time.sleep(5)
      else:
        page=self.getpage(i)
        data = self.gethtml(page)
        data = self.Process(data,i)[:-2]
        # print data
        value=json.loads(data)
        # print value
        file=open(&#39;WY.txt&#39;,&#39;a&#39;)
        for item in value[&#39;newPosts&#39;]:
          try:
            file.write(item[&#39;1&#39;][&#39;f&#39;].encode(&#39;utf-8&#39;)+&#39;|&#39;)
            file.write(item[&#39;1&#39;][&#39;b&#39;].encode(&#39;utf-8&#39;)+&#39;|&#39;)
            file.write(item[&#39;1&#39;][&#39;a&#39;].encode(&#39;utf-8&#39;)+&#39;|&#39;)
            file.write(item[&#39;1&#39;][&#39;v&#39;].encode(&#39;utf-8&#39;)+&#39;\n&#39;)
          except:
            continue
        file.close()
        print &#39;--正在采集%d/12--&#39;%i
        time.sleep(5)
if __name__ == &#39;__main__&#39;:
  WY().dealJSON()

以上就是我爬取的代码了。

以上是抓取網易新聞的python程式碼範例的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

Python和時間：充分利用您的學習時間Apr 14, 2025 am 12:02 AM

要在有限的時間內最大化學習Python的效率，可以使用Python的datetime、time和schedule模塊。 1.datetime模塊用於記錄和規劃學習時間。 2.time模塊幫助設置學習和休息時間。 3.schedule模塊自動化安排每週學習任務。

Python：遊戲，Guis等Apr 13, 2025 am 12:14 AM

Python在遊戲和GUI開發中表現出色。 1)遊戲開發使用Pygame，提供繪圖、音頻等功能，適合創建2D遊戲。 2)GUI開發可選擇Tkinter或PyQt，Tkinter簡單易用，PyQt功能豐富，適合專業開發。

Python vs.C：申請和用例Apr 12, 2025 am 12:01 AM

Python适合数据科学、Web开发和自动化任务，而C 适用于系统编程、游戏开发和嵌入式系统。Python以简洁和强大的生态系统著称，C 则以高性能和底层控制能力闻名。

2小時的Python計劃：一種現實的方法Apr 11, 2025 am 12:04 AM

2小時內可以學會Python的基本編程概念和技能。 1.學習變量和數據類型，2.掌握控制流（條件語句和循環），3.理解函數的定義和使用，4.通過簡單示例和代碼片段快速上手Python編程。

Python：探索其主要應用程序Apr 10, 2025 am 09:41 AM

Python在web開發、數據科學、機器學習、自動化和腳本編寫等領域有廣泛應用。 1)在web開發中，Django和Flask框架簡化了開發過程。 2)數據科學和機器學習領域，NumPy、Pandas、Scikit-learn和TensorFlow庫提供了強大支持。 3)自動化和腳本編寫方面，Python適用於自動化測試和系統管理等任務。