搜尋
首頁後端開發Python教學Python正規取得和過濾或取代HTML標籤的方法說明

這篇文章主要介紹了Python透過正規表示式取得、過濾或取代HTML標籤的方法,有興趣的小夥伴可以參考一下

本文實例介紹了Python透過正規表示式取得,去除(過濾)或取代HTML標籤的幾種方法,具體內容如下

##python正規表示式關鍵內容:

python正規表示式轉義符:


. 匹配除换行符以外的任意字符
\w 匹配字母或数字或下划线或汉字
\s 匹配任意的空白符
\d 匹配数字
\b 匹配单词的开始或结束
^ 匹配字符串的开始
$ 匹配字符串的结束
\W 匹配任意不是字母,数字,下划线,汉字的字符
\S 匹配任意不是空白符的字符
\D 匹配任意非数字的字符
\B 匹配不是单词开头或结束的位置
[^x] 匹配除了x以外的任意字符
[^aeiou] 匹配除了aeiou这几个字母以外的任意字符

常用的python正規表示式限定符代碼/語法說明:


#

*重复零次或更多次
+重复一次或更多次
?重复零次或一次
{n}重复n次
{n,}重复n次或更多次
{n,m}重复n到m次

關於python正規表示式命名群組:


命名组:(?P<name>.....)
这篇文章里面还提到了界定( 问号开头,前向则有个&#39;<&#39;号,非则有个&#39;!&#39; 号 ):
前向界定 (?<=…)
后向界定 (?=…) 
前向非界定 (?<!....)
后向非界定 (?!.....)

Python透過正規表示式取得,移除(過濾)或取代HTML標籤程式碼範例

#1、Python透過正規表示式取html中天氣資訊代碼範例:


#!/usr/bin/env python 
#-*- coding: utf8 -*- 
import re 
  
html = """ 
  <h2 id="多云">多云</h2> 
""" 
  
if name == &#39;main&#39;: 
  p = re.compile(&#39;<[^>]+>&#39;) 
  print p.sub("", html)
Python通过正则表达式取html中温度信息代码示例:
#!/usr/bin/env python 
#-*- coding: utf8 -*- 
import re 
  
html = """ 
  <p class="w-number"> <span class="tpte">14℃</span> </p> 
""" 
  
if name == &#39;main&#39;: 
  p = re.compile(&#39;<[^>]+>&#39;) 
  print p.sub("", html)

2、Python透過正規表示式移除(過濾)HTML標籤範例程式碼:


# -*- coding: utf-8-*-
import re
##过滤HTML中的标签
#将HTML中标签等信息去掉
#@param htmlstr HTML字符串.
def filter_tags(htmlstr):
  #先过滤CDATA
  re_cdata=re.compile(&#39;//<!\[CDATA\[[^>]*//\]\]>&#39;,re.I) #匹配CDATA
  re_script=re.compile(&#39;<\s*script[^>]*>[^<]*<\s*/\s*script\s*>&#39;,re.I)#Script
  re_style=re.compile(&#39;<\s*style[^>]*>[^<]*<\s*/\s*style\s*>&#39;,re.I)#style
  re_br=re.compile(&#39;<br\s*?/?>&#39;)#处理换行
  re_h=re.compile(&#39;</?\w+[^>]*>&#39;)#HTML标签
  re_comment=re.compile(&#39;<!--[^>]*-->&#39;)#HTML注释
  s=re_cdata.sub(&#39;&#39;,htmlstr)#去掉CDATA
  s=re_script.sub(&#39;&#39;,s) #去掉SCRIPT
  s=re_style.sub(&#39;&#39;,s)#去掉style
  s=re_br.sub(&#39;\n&#39;,s)#将br转换为换行
  s=re_h.sub(&#39;&#39;,s) #去掉HTML 标签
  s=re_comment.sub(&#39;&#39;,s)#去掉HTML注释
  #去掉多余的空行
  blank_line=re.compile(&#39;\n+&#39;)
  s=blank_line.sub(&#39;\n&#39;,s)
  s=replaceCharEntity(s)#替换实体
  return s
##替换常用HTML字符实体.
#使用正常的字符替换HTML中特殊的字符实体.
#你可以添加新的实体字符到CHAR_ENTITIES中,处理更多HTML字符实体.
#@param htmlstr HTML字符串.
def replaceCharEntity(htmlstr):
  CHAR_ENTITIES={&#39;nbsp&#39;:&#39; &#39;,&#39;160&#39;:&#39; &#39;,
        &#39;lt&#39;:&#39;<&#39;,&#39;60&#39;:&#39;<&#39;,
        &#39;gt&#39;:&#39;>&#39;,&#39;62&#39;:&#39;>&#39;,
        &#39;amp&#39;:&#39;&&#39;,&#39;38&#39;:&#39;&&#39;,
        &#39;quot&#39;:&#39;"&#39;,&#39;34&#39;:&#39;"&#39;,}
   
  re_charEntity=re.compile(r&#39;?(?P<name>\w+);&#39;)
  sz=re_charEntity.search(htmlstr)
  while sz:
    entity=sz.group()#entity全称,如>
    key=sz.group(&#39;name&#39;)#去除&;后entity,如>为gt
    try:
      htmlstr=re_charEntity.sub(CHAR_ENTITIES[key],htmlstr,1)
      sz=re_charEntity.search(htmlstr)
    except KeyError:
      #以空串代替
      htmlstr=re_charEntity.sub(&#39;&#39;,htmlstr,1)
      sz=re_charEntity.search(htmlstr)
  return htmlstr
def repalce(s,re_exp,repl_string):
  return re_exp.sub(repl_string,s)
if name==&#39;main&#39;:
  s=file(&#39;169it.com_index.htm&#39;).read()
  news=filter_tags(s)
  print news

以上就是本文的全部內容,希望對大家的學習有所幫助。

以上是Python正規取得和過濾或取代HTML標籤的方法說明的詳細內容。更多資訊請關注PHP中文網其他相關文章!

陳述
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
您如何切成python列表?您如何切成python列表?May 02, 2025 am 12:14 AM

SlicingaPythonlistisdoneusingthesyntaxlist[start:stop:step].Here'showitworks:1)Startistheindexofthefirstelementtoinclude.2)Stopistheindexofthefirstelementtoexclude.3)Stepistheincrementbetweenelements.It'susefulforextractingportionsoflistsandcanuseneg

在Numpy陣列上可以執行哪些常見操作?在Numpy陣列上可以執行哪些常見操作?May 02, 2025 am 12:09 AM

numpyallowsforvariousoperationsonArrays:1)basicarithmeticlikeaddition,減法,乘法和division; 2)evationAperationssuchasmatrixmultiplication; 3)element-wiseOperations wiseOperationswithOutexpliitloops; 4)

Python的數據分析中如何使用陣列?Python的數據分析中如何使用陣列?May 02, 2025 am 12:09 AM

Arresinpython,尤其是Throughnumpyandpandas,weessentialFordataAnalysis,offeringSpeedAndeffied.1)NumpyArseNable efflaysenable efficefliceHandlingAtaSetSetSetSetSetSetSetSetSetSetSetsetSetSetSetSetsopplexoperationslikemovingaverages.2)

列表的內存足跡與python數組的內存足跡相比如何?列表的內存足跡與python數組的內存足跡相比如何?May 02, 2025 am 12:08 AM

列表sandnumpyArraysInpythonHavedIfferentMemoryfootprints:listSaremoreFlexibleButlessMemory-效率,而alenumpyArraySareSareOptimizedFornumericalData.1)listsStorReereReereReereReereFerenceStoObjects,with withOverHeadeBheadaroundAroundaround64byty64-bitsysysysysysysysysyssyssyssyssysssyssys2)

部署可執行的Python腳本時,如何處理特定環境的配置?部署可執行的Python腳本時,如何處理特定環境的配置?May 02, 2025 am 12:07 AM

toensurepythonscriptsbehavecorrectlyacrycrosdevelvermations,分期和生產,USETHESTERTATE:1)Environment varriablesForsimplesettings,2)configurationfilesfilesForcomPlexSetups,3)dynamiCofforComplexSetups,dynamiqualloadingForaptaptibality.eachmethodoffersuniquebeneiquebeneqeniquebenefitsandrefitsandrequiresandrequiresandrequiresca

您如何切成python陣列?您如何切成python陣列?May 01, 2025 am 12:18 AM

Python列表切片的基本語法是list[start:stop:step]。 1.start是包含的第一個元素索引,2.stop是排除的第一個元素索引,3.step決定元素之間的步長。切片不僅用於提取數據,還可以修改和反轉列表。

在什麼情況下,列表的表現比數組表現更好?在什麼情況下,列表的表現比數組表現更好?May 01, 2025 am 12:06 AM

ListSoutPerformarRaysin:1)DynamicsizicsizingandFrequentInsertions/刪除,2)儲存的二聚體和3)MemoryFeliceFiceForceforseforsparsedata,butmayhaveslightperformancecostsinclentoperations。

如何將Python數組轉換為Python列表?如何將Python數組轉換為Python列表?May 01, 2025 am 12:05 AM

toConvertapythonarraytoalist,usEthelist()constructororageneratorexpression.1)intimpthearraymoduleandcreateanArray.2)USELIST(ARR)或[XFORXINARR] to ConconverTittoalist,請考慮performorefformanceandmemoryfformanceandmemoryfformienceforlargedAtasetset。

See all articles

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

Video Face Swap

Video Face Swap

使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱工具

WebStorm Mac版

WebStorm Mac版

好用的JavaScript開發工具

SublimeText3 英文版

SublimeText3 英文版

推薦:為Win版本,支援程式碼提示!

EditPlus 中文破解版

EditPlus 中文破解版

體積小,語法高亮,不支援程式碼提示功能

ZendStudio 13.5.1 Mac

ZendStudio 13.5.1 Mac

強大的PHP整合開發環境

Atom編輯器mac版下載

Atom編輯器mac版下載

最受歡迎的的開源編輯器