使用 Scrapy 抓取网页时 tbody 为空的问题及解决方案

小磊吖_8401

小磊吖_8401

2025-07-12

244人浏览

原创

使用 scrapy 抓取网页时 tbody 为空的问题及解决方案

本文旨在解决在使用 Scrapy 爬取网页数据时,XPath 表达式中包含 tbody 元素导致返回空数组的问题。通常,tbody 元素是由浏览器动态添加的,并不存在于原始 HTML 源码中。本文将提供绕过 tbody 元素直接提取所需数据的有效方法,并给出相应的 Scrapy Shell 示例。

在使用 Scrapy 进行网页抓取时,你可能会遇到这样的问题:你通过浏览器开发者工具检查元素时,发现某个元素位于 tbody 标签内,但在 Scrapy 中使用 XPath 表达式尝试提取该元素时,却得到了一个空数组。这通常是因为 tbody 元素是由浏览器在渲染页面时动态添加的,实际上并不存在于服务器返回的原始 HTML 源码中。

问题分析

浏览器为了更好地组织表格数据,会自动在 table 标签内插入 tbody 标签。然而,这个 tbody 标签并非总是存在于服务器返回的原始 HTML 中。当你使用 Scrapy 获取网页内容时,你得到的是原始 HTML,而不是浏览器渲染后的 DOM 结构。因此,如果你的 XPath 表达式依赖于 tbody 标签,那么很可能会得到空结果。

解决方案

解决这个问题的方法是绕过 tbody 标签,直接定位到你想要提取的元素。以下提供两种常用的方法:

  1. 直接定位到 tr 元素:

    如果你的目标是提取表格中的所有行 (tr 元素),可以直接从包含表格的 div 元素开始,跳过 tbody 标签,直接定位到 tr 元素。

    例如,假设你的 HTML 结构如下:

    <div id="TableWithRules">
      <table>
    <thead><tr>
    <th>Header 1</th>
            <th>Header 2</th>
          </tr></thead>
    <tbody>
    <tr>
    <td>Row 1, Column 1</td>
            <td>Row 1, Column 2</td>
          </tr>
    <tr>
    <td>Row 2, Column 1</td>
            <td>Row 2, Column 2</td>
          </tr>
    </tbody>
    </table>
    </div>

    你可以使用以下 XPath 表达式来提取所有行:

    科学计算器在线使用工具代码
    科学计算器在线使用工具代码

    html5 css3制作在线科学计算器ui布局,3D计算器面板,加减乘除数字计算器工具特效。

    下载
    //div[@id='TableWithRules']//tr

    在 Scrapy Shell 中,你可以这样使用:

    scrapy shell https://cve.mitre.org/cgi-bin/cvekey.cgi?keyword=hp
    rows = response.xpath("//div[@id='TableWithRules']//tr")
    print(len(rows)) # 输出行数
  2. 跳过表头行:

    如果你的表格包含表头行 (th 元素),并且你只想提取数据行 (td 元素),可以使用 XPath 的谓词来过滤掉表头行。

    //div[@id='TableWithRules']//tr[td]

    这个 XPath 表达式会选择所有包含 td 元素的 tr 元素,从而排除表头行。

    在 Scrapy Shell 中,你可以这样使用:

    rows = response.xpath("//div[@id='TableWithRules']//tr[td]")
    print(len(rows)) # 输出数据行数

示例代码

以下是一个完整的 Scrapy 示例,展示了如何使用上述方法提取表格数据:

import scrapy

class MySpider(scrapy.Spider):
    name = "mytablecrawler"
    start_urls = ['https://cve.mitre.org/cgi-bin/cvekey.cgi?keyword=hp']

    def parse(self, response):
        rows = response.xpath("//div[@id='TableWithRules']//tr[td]")
        for row in rows:
            # 提取每一行的数据
            data = row.xpath("./td/text()").getall()
            yield {
                'column1': data[0] if len(data) > 0 else None,
                'column2': data[1] if len(data) > 1 else None,
                # ... 其他列
            }

注意事项

  • 在编写 XPath 表达式时,务必仔细检查网页的 HTML 结构,并根据实际情况进行调整。
  • 如果网页的 HTML 结构比较复杂,可能需要使用更复杂的 XPath 表达式才能准确地提取到所需数据。
  • 有些网站可能会使用 JavaScript 动态生成表格数据,这种情况下,可能需要使用 Selenium 等工具来模拟浏览器行为,才能获取到完整的数据。

总结

当在使用 Scrapy 抓取网页数据时,遇到 tbody 为空的问题,不要慌张。首先要理解 tbody 元素可能并不存在于原始 HTML 源码中。然后,尝试绕过 tbody 标签,直接定位到你想要提取的元素。通过灵活运用 XPath 表达式,你就可以轻松地解决这个问题,并成功地抓取到所需的数据。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

浏览器

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3953

9

DOM是什么意思
DOM是什么意思

dom的英文全称是documentobjectmodel,表示文件对象模型,是w3c组织推荐的处理可扩展置标语言的标准编程接口;dom是html文档的内存中对象表示,它提供了使用javascript与网页交互的方式。想了解更多的相关内容,可以阅读本专题下面的文章。

2024.08.14

6441

7

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

180

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

60

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
phpMyAdmin 常见问题
phpMyAdmin 常见问题

共0课时 | 0人学习

uni-app快速上手
uni-app快速上手

共0课时 | 0人学习