Scrapy 教程:递归爬取包含指定标题的卡片所在所有页面 URL

轻芳同学_9221

轻芳同学_9221

2026-08-25

460人浏览

原创

Scrapy 教程:递归爬取包含指定标题的卡片所在所有页面 URL

本文介绍如何使用 scrapy 实现递归爬虫,自动发现并提取网站中所有包含特定标题(如“az school safety program”)的卡片所在的完整页面 url,避免手动查找,同时兼顾效率与合规性。

本文介绍如何使用 scrapy 实现递归爬虫,自动发现并提取网站中所有包含特定标题(如“az school safety program”)的卡片所在的完整页面 url,避免手动查找,同时兼顾效率与合规性。

在实际网页抓取任务中,常遇到同一内容模块(如项目卡片)被复用在多个页面的情况。例如目标站点 lawforkids.org 中,“AZ School Safety Program”这一标题出现在 /officers/educators/programs 等多个路径下。若仅靠单层解析无法覆盖全站分布,必须启用递归遍历 + 内容匹配策略。

以下是一个完整、可运行的 Scrapy 爬虫实现,专为该类场景设计:

import scrapy

class PostsSpider(scrapy.Spider):
    name = "card"

    # 限制爬取深度,防止过度请求和服务器压力
    custom_settings = {
        'DEPTH_LIMIT': 1,
        'DEPTH_PRIORITY': 1,
        'ROBOTSTXT_OBEY': True,  # 尊重 robots.txt(推荐开启)
        'DOWNLOAD_DELAY': 1,     # 建议添加延迟,体现爬虫礼仪
    }

    def start_requests(self):
        # 明确起始 URL,支持多个入口点
        urls = ["https://lawforkids.org"]
        for url in urls:
            yield scrapy.Request(url=url, callback=self.parse)

    def parse(self, response):
        # 跳过非 HTML 响应(如 PDF、图片、API 接口等)
        content_type = response.headers.get('Content-Type', b'').decode()
        if 'text/html' not in content_type:
            return

        # 定位所有卡片容器,并提取标题进行精确匹配
        for card in response.css("div.card-body"):
            title = card.css("h5.card-title::text").get(default="").strip()
            if title == "AZ School Safety Program":
                yield {
                    "title": title,
                    "url": response.url
                }

        # 递归抓取当前页内所有站内链接(仅限 lawforkids.org 域名)
        for a_tag in response.css('a[href]'):
            link = a_tag.css('::attr(href)').get()
            if not link:
                continue
            absolute_link = response.urljoin(link)
            # 严格限定为同域链接,避免爬出目标范围
            if absolute_link.startswith("https://lawforkids.org"):
                yield scrapy.Request(
                    url=absolute_link,
                    callback=self.parse,
                    # 可选:携带优先级或元数据便于调试
                    cb_kwargs={"source_url": response.url}
                )

关键设计说明:

  • 使用 start_requests() 替代 start_urls,便于灵活控制请求逻辑;
  • response.urljoin() 确保相对 URL 正确转为绝对 URL;
  • custom_settings 中设置 DEPTH_LIMIT=1 平衡覆盖率与性能——实测已能捕获 /programs/lre-academy 等深层路径;如需更广覆盖,可谨慎提升至 2,但务必同步增加 DOWNLOAD_DELAY 和监控响应状态;
  • ROBOTSTXT_OBEY=TrueDOWNLOAD_DELAY=1 是负责任爬虫的基本实践,强烈建议保留;
  • 标题比对采用 .strip()default="" 防止空格或 None 引发异常,增强鲁棒性。

运行命令如下(输出为 JSONL 格式,便于后续处理):

scrapy crawl card -o matches.jsonl

输出示例:

{"title": "AZ School Safety Program", "url": "https://lawforkids.org/programs"}
{"title": "AZ School Safety Program", "url": "https://lawforkids.org/officers"}
{"title": "AZ School Safety Program", "url": "https://lawforkids.org/educators"}

⚠️ 注意事项:

  • 切勿移除域名校验(startswith("https://lawforkids.org")),否则可能意外爬取外部资源甚至陷入无限循环;
  • 若目标标题存在大小写变体或前后缀(如带括号、空格数不一),建议改用正则模糊匹配:
    import re
    if re.search(r"AZ\s+School\s+Safety\s+Program", title, re.I):
  • 生产环境建议添加 HTTPERROR_ALLOWED_CODES = [403, 404] 并在 parse 中处理异常响应,避免中断整个爬取流程。

通过本方案,你不仅能精准定位多页面复用的内容单元,还能以可控、可审计、符合 Web 礼仪的方式完成全站扫描——这才是专业级 Scrapy 爬虫应有的姿态。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3913

9

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

140

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

60

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

40

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

360

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

GDB C++程序怎么调试
GDB C++程序怎么调试

本专题围绕GDB调试C++程序的实际过程,详细说明程序编译、调试器启动、命令行参数传入、断点命中和程序继续运行等步骤,并介绍条件断点、临时断点和观察点的设置方法,方便开发者跟踪复杂代码的执行状态。

2026.09.11

120

20

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133万人学习