如何使用HTML提取页面主要文本内容

落丽吖_8426

落丽吖_8426

2026-10-10

139人浏览

原创

优先用 beautifulsoup 定位语义化容器(如、或含content/post等类的div)再调用get_text(separator="\n", strip=true),并预先decompose script/style/nav等干扰标签,同时正确设置响应编码。

如何使用html提取页面主要文本内容

直接用 BeautifulSoup 的 get_text() 加合理选择器,比正则或手动 DOM 操作更稳——尤其面对不规范 HTML、嵌套广告、JS 注入内容时,正则容易漏掉或误删。

用 BeautifulSoup 定位主体区域再提取

多数网页正文藏在语义化容器里(如 <main></main>、<article></article>、<div class="content">),硬通货是先缩小范围,再调用 <code>get_text(),避免把页脚导航、侧边栏、广告文案一起拖进来。

  • 优先尝试:soup.find("main") or soup.find("article") or soup.find("div", class_=re.compile(r"content|post|entry|body"))
  • 若目标结构固定(比如教育平台的 <div class="dnevnik-lesson__task">),直接写死 CSS 选择器:<code>soup.select("div.dnevnik-lesson__task")
  • 提取后加参数控制格式:.get_text(separator="\n", strip=True) —— separator="\n" 让段落间有换行,strip=True 去首尾空格,比默认行为更干净
  • 过滤干扰节点再提取

    即使选对了父容器,里面仍可能混着 <script></script>、<style></style>、<nav></nav>、<footer></footer> 这类非文本节点,它们的 get_text() 结果会污染输出。

    • 提取前先删掉:for tag in soup(["script", "style", "nav", "footer", "header", "aside"]): tag.decompose()
    • 如果页面含大量图标标签(如 <i class="icon-download"></i>),它们虽无文本但占 DOM 位置,不影响 get_text(),无需额外处理
    • 注意:不要用 extract(),它返回被移除节点;decompose() 更彻底,连节点对象都销毁,内存更友好

    处理编码与乱码问题

    中文提取失败,90% 是编码没对齐。不是所有网页都声明 UTF-8,requests 默认按 ISO-8859-1 解码,一读就变“文本”。

    Wechat HTML Publisher
    Wechat HTML Publisher

    直接上传HTML富文本到微信公众号草稿箱。支持完整的HTML格式,无需Markdown转换。

    下载
    • 拿到 response 后立刻设编码:response.encoding = response.apparent_encoding or "utf-8",比硬写 "utf-8" 更可靠
    • 若仍乱码,检查 response.headers.get("content-type") 是否含 charset=gbk 类信息,并优先采用它
    • 本地读 HTML 文件时,显式指定 encoding="utf-8" 或 encoding="gbk",别依赖系统默认

    为什么不用 document.body.innerText 或正则?

    浏览器控制台跑 document.body.innerText 看起来快,但它依赖页面已完整渲染 + JS 执行完毕;而服务端解析 HTML 字符串时,JS 根本没运行,结果天差地别。正则更危险:re.sub(r"]+>", "", html_str) 会吃掉注释里的文本、破坏实体(如   变成  )、误杀含 > 的 JS 字符串。

    • innerText 在无 DOM 环境(如 Python 后端)根本不可用
    • 正则无法处理自闭合标签(<br>)、属性含 > 的情况(<div data-value="a>b">) <li> <code>BeautifulSoup 自动修复缺失闭合标签、转义字符、跳过注释——这些全是正则和原生 DOM 解析器不会帮你兜底的点
    • 真正难的不是“怎么取”,而是判断“该从哪取”:同一套代码在新闻站、论坛帖、教务系统里,主体选择器可能完全不同;而一旦选错容器,后面所有清洗都白做。所以第一步永远该是人工 inspect 几个典型页面,确认结构共性,再写选择器。

前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

html提取文本 html

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.14

5895

7

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

3332

4

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.31

2990

5

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.01

3019

5

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2023.08.11

4819

6

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2023.08.11

2961

3

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

2769

3

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2023.09.01

2468

6

HTML嵌入CSS样式的方法
HTML嵌入CSS样式的方法

HTML嵌入CSS样式的方法有内联样式、内部样式表和外部样式表。本专题为大家提供CSS样式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.20

2508

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
GDB 17.2 官方文档集合
GDB 17.2 官方文档集合

共0课时 | 0人学习

Bootstrap 入门安装配置
Bootstrap 入门安装配置

共0课时 | 0人学习

38+ PhpStorm 提示和技巧
38+ PhpStorm 提示和技巧

共1课时 | 221人学习