使用Beautiful Soup解析dom的方法-js教程-PHP中文網

首頁

web前端

js教程

使用Beautiful Soup解析dom的方法

一个新手

Sep 20, 2017 am 09:34 AM

方法

使用Beautiful Soup解析dom

本文主要介紹如何使用Beautiful Soup解析dom。

Beautiful Soup的簡介

Beautiful Soup提供一些簡單的、python式的函數用來處理導航、搜尋、修改分析樹等功能。它是一個工具箱，透過解析文件為使用者提供需要抓取的數據，因為簡單，所以不需要多少程式碼就可以寫出一個完整的應用程式。
Beautiful Soup自動將輸入文件轉換為Unicode編碼，輸出文件轉換為utf-8編碼。你不需要考慮編碼方式，除非文件沒有指定一個編碼方式，這時，Beautiful Soup就不能自動辨識編碼方式了。然後，你只需要說明一下原始編碼方式就可以了。
Beautiful Soup已成為和lxml、html6lib一樣出色的python解釋器，為使用者靈活地提供不同的解析策略或強勁的速度。

Beautiful Soup 安裝

部落客使用的是mac，這裡面只介紹在mac下Beautiful Soup的安裝方法。 python 第三方函式庫安裝都很簡單，樓主一直都使用pip來安裝。

安裝pip

easy_install pip

安裝Beautiful Soup

pip install beautifulsoup4

有時候我們使用pip install beautifulsoup4 指令來安裝會報錯，這時候我們需要在指令前加上sudo來取得權限。

sudo pip install beautifulsoup4

到目前為止我們的準備工作就做好了，現在我們可以開始使用Beautiful Soup。本文只使用到了bs4(備註：文章中bs4=beautifulsoup4)部分方法，想要進一步了解bs4的可以查看bs4官方文檔，樓主的項目建的很簡單index.py和一個html文件夾，裡面放有一些. html靜態檔案

index.py檔

# coding=utf-8import osfrom bs4 import BeautifulSoupimport sys 

#定义一个list来存放文件路径paths=[]#获取所有的文件路径def get_paths():
    for fpathe,dirs,fs in os.walk(&#39;html&#39;):        
    for f in fs:            
    #print os.path.join(fpathe,f)
            #将拼接好的path存放到list中
            filepath=os.path.join(fpathe,f)            
            #只放入.html后缀文件路径
            if(os.path.splitext(f)[1]==".html"):
                paths.append(filepath)#读取html文件修改后并写入相应的文件中去def reset_file(path):
    #判断文件是否存在
    if not os.path.isfile(path):        
    raise TypeError(path + " does not exist")    
    #读取文件,bs4自动将输入文档转换为Unicode编码，
    #输出文档转换为utf-8编码,bs4也可以直接读取html
    #字符串，例如BeautifulSoup(&#39;<p>content</p>&#39;)
    soup=BeautifulSoup(open(path))    
    #select是bs4提供的方法，和jquery的$选择器一样
    #方便。可以标签(eg:p,title,p...)来查找,也
    #也可以通过css的 class .和id #来查找，基本上和我们
    #使用$一样。

    #选取id="nav"节点下的所有li元素里面的a标签，返回值是一个list集合
    nav_a=soup.select("#nav li a")    
    #修改a的href属性
    if(len(nav_a)>1):
        nav_a[0]["href"]="/m/"
        nav_a[1]["href"]="/m/about_mobile/m_about.html"

    #选取class="footer"里的所有a标签
    footer_a=soup.select(".footer a")    
    if(len(footer_a)>0):
        footer_a[1]["href"]="/m/about_mobile/m_sjdt.html"

    content_p=soup.select(".content p")    
    #修改<p>我是string</p>里面的文本内容
    if(len(content_p)>0):
        content_p[0].string="修改p标签里面的测试内容"

    #修改系统的默认编码
    reload(sys)                    
    sys.setdefaultencoding(&#39;utf-8&#39;) 

    #打开相应的文件写入模式，打开文件不要放入try里面，否则会
    #出现异常
    f=open(path,"w")    try:        
    #写入文件
        f.write(soup.prettify())    finally:        
    #关闭文件
        file.close()#定义main函数程序的入口    
        if __name__=="__main__":
    get_paths()    
    #遍历所有文件路径
    for p in paths:
        reset_file(p)

以上是使用Beautiful Soup解析dom的方法的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

演示win7调整屏幕亮度的方法Jul 08, 2023 pm 07:49 PM

不同的电脑系统在调整屏幕亮度的操作方法上会有些不同，最近就有使用win7系统的网友不知道win7怎么调整屏幕亮度，看久了电脑眼睛比较酸痛。下面小编就教下大家win7调整屏幕亮度的方法。具体的操作步骤如下：1、点击win7电脑左下角的“开始”，在弹出的开始菜单中选择“控制面板”打开。2、在打开的控制面板中找到“电源选项”打开。3、也可以用鼠标右键电脑右下角的电源图标，在弹出的菜单中，点击“调整屏幕亮度”，如下图所示。两种方法都可以用。4、在打开的电源选项窗口的最下面可以看到屏幕亮度调整的滚动条，直

win10监控摄像头打开照片的方法Jul 10, 2023 pm 09:41 PM

如果我们手头没有手机，只有电脑，但我们必须拍照，我们可以使用电脑内置的监控摄像头拍照，那么如何打开win10监控摄像头，事实上，我们只需要下载一个相机应用程序。打开win10监控摄像头的具体方法。win10监控摄像头打开照片的方法:1.首先，盘快捷键Win+i打开设置。2.打开后，进入个人隐私设置。3.然后在相机手机权限下打开访问限制。4.打开后，您只需打开相机应用软件。(如果没有，可以去微软店下载一个)5.打开后，如果计算机内置监控摄像头或组装了外部监控摄像头，则可以拍照。(因为人们没有安装摄

基于Java的机器视觉实践和方法介绍Jun 18, 2023 am 11:21 AM

随着科技的不断发展，机器视觉技术在各个领域得到了广泛应用，如工业自动化、医疗诊断、安防监控等。Java作为一种流行的编程语言，其在机器视觉领域也有着重要的应用。本文将介绍基于Java的机器视觉实践和相关方法。一、Java在机器视觉中的应用Java作为一种跨平台的编程语言，具有跨操作系统、易于维护、高度可扩展等优点，对于机器视觉的应用具有一定的优越性。Java

win7怎么调屏幕亮度的两种简单方法Jul 08, 2023 pm 06:33 PM

目前有很多屏幕亮度调整软件，我们可以通过使用软件进行快速调整或者通过显示器上自带的亮度功能进行调整。以下是详细的Win7屏幕亮度调整方式，您可以通过教程中的方法进行快速调整即可。Win7系统电脑怎么调节屏幕亮度教程：1、依次点击“计算机—右键—控制面板”，如果没有也可以在搜索框中进行搜索。2、点击控制面板下的“硬件和声音”，或者点击“外观和个性化”都可以。3、点击“NVIDIA控制面板”，有些显卡可能是AMD或者Intel的，请根据实际情况选择。4、调节图示中亮度滑块即可。5、还有一种方法，就是

Go 语言中的方法是怎样定义和使用的？Jun 10, 2023 am 08:16 AM

Go语言是近年来备受青睐的编程语言，因其简洁、高效、并发等特点而备受开发者喜爱。其中，方法（Method）也是Go语言中非常重要的概念。接下来，本文就将详细介绍Go语言中方法的定义和使用。一、方法的定义Go语言中的方法是带有接收器（Receiver）的函数，它是一个与某个类型绑定的函数。接收器可以是值类型或者指针类型。用于接收者的参数可以在方法名

图文详解如何下载win10系统方法Jul 16, 2023 pm 01:25 PM

如今微软的Windows系统已经更新换代到了Windows10版本。很多以前还在使用Windows7系统的用户都想体验这个新版本Windows10系统。下面小编就来说说如何下载win10系统下载的方法，大家快来看看。1、首先下载一个小白重装系统软件，然后点击在线重装，下载win10系统。2、然后就开始系统镜像的下载了。3、系统镜像下载完成就是环境部署了。然后win10系统就下载完成啦。4、重启之后开始安装系统，安装完成就能进入桌面咯。以上就是如何下载win10系统的方法介绍啦，希望能帮助到大家。

PHP文件下载方法及常见问题解答Jun 09, 2023 pm 12:37 PM

PHP是一个广泛使用的服务器端编程语言，它的许多功能和特性可以将其用于各种任务，包括文件下载。在本文中，我们将了解如何使用PHP创建文件下载脚本，并解决文件下载过程中可能出现的常见问题。一、文件下载方法要在PHP中下载文件，我们需要创建一个PHP脚本。让我们看一下如何实现这一点。创建下载文件的链接通过HTML或PHP在页面上创建一个链接，让用户能够下载文件。

使用PHP数组实现数据缓存和存储的方法和技巧Jul 16, 2023 pm 02:33 PM

使用PHP数组实现数据缓存和存储的方法和技巧随着互联网的发展和数据量的急剧增长，数据缓存和存储成为了我们在开发过程中必须要考虑的问题之一。PHP作为一门广泛应用的编程语言，也提供了丰富的方法和技巧来实现数据缓存和存储。其中，使用PHP数组进行数据缓存和存储是一种简单而高效的方法。一、数据缓存数据缓存的目的是为了减少对数据库或其他外部数据源的访问次数，从而提高

See all articles