提取 BeautifulSoup 中 div 元素的类名片段与嵌套文本内容

小枫同学_6992

小枫同学_6992

2026-06-07

287人浏览

原创

提取 BeautifulSoup 中 div 元素的类名片段与嵌套文本内容

本文详解如何使用 BeautifulSoup 精准提取 标签中特定 class 类名(如 stat_alarm)、 内容和 数值,通过 CSS 选择器与属性解析实现结构化数据抽取。

本文详解如何使用 beautifulsoup 精准提取 `

` 标签中特定 class 类名(如 `stat_alarm`)、`` 内容和 `

` 数值,通过 css 选择器与属性解析实现结构化数据抽取。

在网页解析实践中,常需从具有复合 class 的

中分离出语义化信息:例如,class="tab_box stat_alarm" 中的 stat_alarm 表示状态类型,而 和

分别承载指标名称与实测值。直接调用 .text 会丢失结构、合并所有文本,无法区分字段边界;而仅用 find_all("div", class_="tab_box") 又无法定位动态变化的状态类(如 stat_ok/stat_alarm)。

推荐使用 CSS 选择器 + 属性访问 + 迭代解包 的组合方案:

GPTPLUS
GPTPLUS

一款AI翻译工具,主要用于GPTPLUS, 由GPT-4和GPT-3.5支持,为您的写作、翻译、代码分析和问答需求提供最准确、有效的AI反馈,适合需要提升相关任务效率的用户。

下载
  • 使用 soup.select("div.stat_alarm, div.stat_ok") 精确匹配含目标状态类的
    ,避免空节点(如
    )干扰;
  • 通过 div.attrs["class"] 获取 class 属性列表(如 ['tab_box', 'stat_alarm']),取末尾元素 [-1] 即为状态标识;
  • 利用 div.stripped_strings(返回生成器,自动去除空白并剥离标签)安全提取纯文本序列,再用解包 *div.stripped_strings 获取 和

    的内容(顺序即 DOM 顺序);

  • 最后格式化输出或存入字典/DataFrame。
  • from bs4 import BeautifulSoup
    
    html = """\
    <div class="tab_box stat_alarm">
    <span>pH [pH]</span><h1>6.9</h1>
    </div>
    <div class="tab_box stat_alarm">
    <span>Redox [mV]</span><h1>667</h1>
    </div>
    <div class="tab_box stat_ok">
    <span>Temp. [°C]</span><h1>9.5</h1>
    </div>
    <div class="tab_box"></div>"""
    
    soup = BeautifulSoup(html, "html.parser")
    
    for div in soup.select("div.stat_alarm, div.stat_ok"):
        try:
            status_class = div.attrs["class"][-1]
            strings = list(div.stripped_strings)
            # 确保至少有两个文本节点(span + h1)
            if len(strings) >= 2:
                label, value = strings[0], strings[1]
                print(f"{status_class:<p><strong>注意事项:</strong>  </p>
    • 若 class 顺序不固定(如 class="stat_ok tab_box"),建议改用 next(c for c in div.attrs["class"] if c.startswith("stat_")) 安全提取;
    • stripped_strings 不包含注释或隐藏文本,如需更细粒度控制,可显式定位:div.find("span").get_text(strip=True) 和 div.find("h1").get_text(strip=True);
    • 对空
      ,select() 已过滤,但若 HTML 结构不稳定,务必添加 try/except 或长度校验;
    • 生产环境建议指定解析器(如 "lxml")提升性能与容错性:BeautifulSoup(html, "lxml")。

    该方法兼顾可读性、健壮性与扩展性,是解析带状态标记的仪表盘类 HTML 的典型范式。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.14

5655

7

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

3212

4

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.31

2890

5

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.01

2899

5

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2023.08.11

4739

6

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2023.08.11

2861

3

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

2649

3

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2023.09.01

2368

6

HTML嵌入CSS样式的方法
HTML嵌入CSS样式的方法

HTML嵌入CSS样式的方法有内联样式、内部样式表和外部样式表。本专题为大家提供CSS样式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.20

2388

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习