如何使用 Jsoup 递归提取 HTML 元素的所有后代文本节点(含嵌套层级)

云敏大大_4915

云敏大大_4915

2026-10-05

160人浏览

原创

如何使用 Jsoup 递归提取 HTML 元素的所有后代文本节点(含嵌套层级)

本文介绍在 Jsoup 中如何准确获取指定元素下所有后代文本节点(包括间接子节点)并独立访问每个文本内容,解决 element.textNodes() 仅返回直接子文本的局限性,提供递归遍历与 NodeVisitor 两种专业方案。

本文介绍在 jsoup 中如何准确获取指定元素下所有后代文本节点(包括间接子节点)并独立访问每个文本内容,解决 element.textnodes() 仅返回直接子文本的局限性,提供递归遍历与 nodevisitor 两种专业方案。

在实际 HTML 解析场景中,常需提取某个容器元素(如 <div> 或 <code><a></a>)内全部可见文本内容,且要求保留结构粒度——例如区分 <span>Content 1</span> 和 <span>Content 2</span> 中的两个独立文本块。Jsoup 的 Element.textNodes() 方法仅返回直接子级的 TextNode 对象,无法覆盖嵌套多层的文本节点(如 <a></a> 下的 <span></span> 内文本),因此需采用更健壮的递归或遍历策略。

✅ 方案一:递归遍历子节点(简洁可控)

以下工具方法可安全、高效地收集目标节点下所有非空文本节点(支持任意嵌套深度):

import org.jsoup.nodes.*;
import java.util.*;

public static void collectAllTextNodes(Node rootNode, List<textnode> result) {
    for (Node child : rootNode.childNodes()) {
        if (child instanceof TextNode textNode && !textNode.isBlank()) {
            result.add(textNode);
        } else {
            collectAllTextNodes(child, result); // 递归进入非文本子节点
        }
    }
}</textnode>

调用示例:

Element anchor = document.select("div.erece.mtmhp a").first();
List<textnode> allTexts = new ArrayList();
collectAllTextNodes(anchor, allTexts);

System.out.println("共找到 " + allTexts.size() + " 个文本节点:");
for (int i = 0; i <p>✅ <strong>优势</strong>:逻辑清晰、无依赖、易于调试;支持 <code>TextNode</code> 原生对象,可进一步调用 <code>.parent()</code>, <code>.absUrl()</code>, <code>.getWholeText()</code> 等方法获取上下文信息。<br>
⚠️ <strong>注意</strong>:务必检查 <code>isBlank()</code> 避免捕获纯空白文本(如换行缩进);若需严格按 DOM 顺序提取,该方法天然满足(深度优先遍历)。</p>
<h3>✅ 方案二:基于 <code>NodeVisitor</code> 的结构化遍历(面向扩展)</h3>
<p>对于复杂解析需求(如需同时提取文本、记录位置、过滤样式等),推荐使用 Jsoup 内置的 <code>NodeTraversor</code> + <code>NodeVisitor</code> 模式:</p><div class="aritcle_card flexRow artxards">
											<div class="artcardd flexRow">
												<a class="aritcle_card_img" rel="nofollow" href="/xiazai/skill6712" title="Wechat HTML Publisher"><img
														src="https://img.php.cn/upload/skill/000/000/081/179109368394970.jpg" alt="Wechat HTML Publisher" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
												<div class="aritcle_card_info flexColumn">
													<a rel="nofollow" href="/xiazai/skill6712" title="Wechat HTML Publisher" class="overflowclass">Wechat HTML Publisher</a>
													<p class="overflowclass">直接上传HTML富文本到微信公众号草稿箱。支持完整的HTML格式,无需Markdown转换。</p>
												</div>
												<a rel="nofollow" href="/xiazai/skill6712" title="Wechat HTML Publisher" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
												</a>
											</div>
										</div>
<pre class="brush:php;toolbar:false;">static class TextNodeCollector implements NodeVisitor {
    private final List<string> texts = new ArrayList();

    @Override
    public void head(Node node, int depth) {
        if (node instanceof TextNode textNode && !textNode.isBlank()) {
            texts.add(textNode.text().trim()); // 使用 .text() 自动清理空白,或用 .getWholeText() 保留原始格式
        }
    }

    @Override
    public void tail(Node node, int depth) {
        // tail 不处理文本,避免重复
    }

    public List<string> getTexts() { return new ArrayList(texts); }
}

// 使用方式:
Element target = document.select("div.erece.mtmhp a").first();
TextNodeCollector collector = new TextNodeCollector();
new NodeTraversor(collector).traverse(target);
List<string> contentList = collector.getTexts();</string></string></string>

✅ 优势:符合 Jsoup 官方推荐范式,天然支持深度/层级感知;便于后续扩展(如跳过 <script></script>、忽略 display:none 元素等);返回 String 列表,语义更明确。
⚠️ 注意:head() 回调在进入节点时触发,确保文本在首次访问时被捕获;tail() 无需处理文本节点,避免重复添加。

? 总结与最佳实践

  • 优先使用递归方案:适用于大多数轻量级提取场景,代码短小、性能优异、调试直观;
  • 选用 NodeVisitor 方案:当项目已使用遍历模式,或需与 CSS 选择器、属性过滤、上下文判断等能力集成时;
  • 永远校验空白:TextNode.isBlank() 是关键防护,防止 \n\t 类空白干扰结果;
  • 区分 .text() 与 .getWholeText():前者返回规范化后的纯文本(自动 trim + 合并连续空白),后者保留原始字符(含空格、换行),按需选择;
  • 避免 element.ownText():该方法仅返回当前元素“自有”文本(不包含子元素文本),不符合本场景需求。

通过以上任一方法,即可精准、可靠地将嵌套 HTML 中的 "Content 1" 与 "Content 2" 作为独立文本单元分离提取,为后续数据清洗、NLP 处理或结构化存储奠定坚实基础。

前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

html js

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.15

9757

6

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

2023.07.05

6902

9

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

2023.07.31

6092

8

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.08.01

1064

3

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.08.02

888

3

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.02

1276

5

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.02

2549

5

java在线网站
java在线网站

Java在线网站是指提供Java编程学习、实践和交流平台的网络服务。近年来,随着Java语言在软件开发领域的广泛应用,越来越多的人对Java编程感兴趣,并希望能够通过在线网站来学习和提高自己的Java编程技能。php中文网给大家带来了相关的视频、教程以及文章,欢迎大家前来学习阅读和下载。

2023.08.03

19891

3

配置java环境变量
配置java环境变量

配置Java环境变量是为了让操作系统能够识别和使用Java的相关命令和功能。本专题为大家提供配置java环境变量相关文章,帮助大家解决问题。

2023.08.03

1155

8

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
GDB 17.2 官方文档集合
GDB 17.2 官方文档集合

共0课时 | 0人学习

Bootstrap 入门安装配置
Bootstrap 入门安装配置

共0课时 | 0人学习

38+ PhpStorm 提示和技巧
38+ PhpStorm 提示和技巧

共1课时 | 219人学习