如何从HTML内容中提取文本并去重

小婷同学_7755

小婷同学_7755

2026-10-10

690人浏览

原创

直接用 document.body.innertext + set 去重会漏掉隐藏元素内容、破坏段落结构、丢失标签语义、忽略 script/style 文本,且无法处理语义重复问题。

如何从html内容中提取文本并去重

直接提取 HTML 内文本再用 Set 去重,大概率得到一堆空格、换行、重复标签名或语义混乱的“假唯一项”——这不是去重,是扔掉结构后胡乱拼凑。

document.body.innerText + Set 会漏掉什么

很多人第一反应是:new Set(document.body.innerText.split(/\s+/))。这看似简单,实际问题密集:

  • 所有嵌套标签的文本被扁平合并,<p>Hello<strong>world</strong></p> 变成 "Hello world",但你可能只想取 <strong></strong> 里的关键词
  • innerText 会跳过 display: none、visibility: hidden 元素,也会受 CSS 字体渲染影响(如某些字体下空格宽度归零导致连词)
  • 换行符、制表符、连续空格全被压缩成单空格,"a\n\nb" → "a b",但你可能需要保留段落边界做分句
  • 脚本、注释、<style></style>、<script></script> 内容虽不显示,却仍可能被 innerText 忽略——你以为去重的是“可见文本”,其实连可见性都没真正校验

querySelectorAll + textContent 是更可控的起点

若目标明确(比如只取所有 <h2></h2> 标题、或所有 <li> 列表项),应绕过 innerText,改用 textContent 配合选择器:

Wechat HTML Publisher
Wechat HTML Publisher

直接上传HTML富文本到微信公众号草稿箱。支持完整的HTML格式,无需Markdown转换。

下载

它不触发渲染、不读样式、不跳过隐藏元素,且返回原始 DOM 树中的纯文本节点内容(含空格与换行,但不含标签)。

  • 用 document.querySelectorAll('h2, h3') 比 document.body.innerText 更精准锁定语义区块
  • 对每个元素调用 .textContent.trim(),而非全局切分,避免把“标题1副标题”错拆成两个词
  • 若需忽略空白行,加判断:if (el.textContent.trim()) { ... }
  • 大小写敏感?统一转小写:el.textContent.trim().toLowerCase();但注意:中文、数字、符号不受影响,无需额外处理

去重前必须做语义归一化,否则 Set 白忙

Set 只比内存地址或字符串字面量,它不理解“北京”和“北京市”是同一实体,“user_id”和“userId”是同一字段。常见归一化操作:

  • 去除首尾不可见字符:.trim() 后再加 .replace(/^[\u200B-\u200D\uFEFF]+|[\u200B-\u200D\uFEFF]+$/g, '')(清理零宽空格等)
  • 折叠内部多余空白:.replace(/\s+/g, ' '),防止 “hello  world” 和 “hello world” 被视为不同
  • 忽略标点差异(如中英文逗号、括号):.replace(/[,,。!?;:""''()\[\]]/g, ''),按需启用
  • 若处理多语言,慎用 .toLowerCase() —— 土耳其语中 I 的小写是 ı,不是 i;建议用 .toLocaleLowerCase('en-US') 显式指定区域

超大 HTML 字符串在主线程里别用 DOMParser 全量解析

如果你手头是几 MB 的本地 HTML 字符串(比如爬虫导出文件),用 DOMParser().parseFromString(htmlStr, 'text/html') 极易卡死或 OOM。此时应切换策略:

  • 用正则粗筛关键标签块(如 /<h>([^/gi</h>),再对匹配结果做 textContent 提取 —— 快、轻、可控,适合非嵌套结构
  • 真要保 DOM 安全性?分片处理:把 HTML 按 <section></section> 或 <article></article> 拆成数组,每批 ≤200 行,用 Web Worker 分批解析并归一化,主线程只聚合指纹
  • 避免 innerHTML = htmlStr 再查 —— 这会执行所有内联脚本、加载图片、触发重排,纯属自找麻烦
  • 若只是去重链接或邮箱,直接上 re.findall(r'href=["\'](.*?)["\']', htmlStr)(Python)或 htmlStr.match(/href=["\'](.*?)["\']/g)(JS),别碰 DOM

最常被忽略的一点:去重目标不是“字符串不重复”,而是“语义不重复”。一个 <strong>API</strong> 和一个 <code>API 在文本层面相同,但语义角色完全不同——该不该合并,得看你的下游用途,而不是交给 Set 一判了之。

前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

html提取文本 html

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.14

5855

7

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

3312

4

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.31

2990

5

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.01

2999

5

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2023.08.11

4799

6

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2023.08.11

2961

3

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

2749

3

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2023.09.01

2448

6

HTML嵌入CSS样式的方法
HTML嵌入CSS样式的方法

HTML嵌入CSS样式的方法有内联样式、内部样式表和外部样式表。本专题为大家提供CSS样式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.20

2488

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
GDB 17.2 官方文档集合
GDB 17.2 官方文档集合

共0课时 | 0人学习

Bootstrap 入门安装配置
Bootstrap 入门安装配置

共0课时 | 0人学习

38+ PhpStorm 提示和技巧
38+ PhpStorm 提示和技巧

共1课时 | 221人学习