Scrapy如何抓取多层链接?

云婷酱_7199

云婷酱_7199

2026-08-18

602人浏览

原创

scrapy抓取多层链接需明确跳转路径、控制去重、正确传递中间数据;可用spider类手动控制三级解析,或crawlspider自动跟踪规则化链接,并注意相对路径拼接与跨域域名配置。

scrapy如何抓取多层链接? - php中文网

Scrapy抓取多层链接需明确跳转路径、控制请求去重、正确传递中间数据,避免重复爬取和字段缺失。

用Spider类手动控制多层跳转

适用于层级逻辑清晰、需精细控制每层解析逻辑的场景,比如从列表页→详情页→评论页三级结构。

第一步:在parse方法中提取当前页所有详情页URL,用response.follow()发起请求,并通过meta传入基础Item或标识信息。

第二步:在详情页回调函数(如parse_detail)中提取关键字段,同时判断是否存在下一层链接(如“查看更多评论”按钮),若存在则再次yield scrapy.Request(),并将已收集的Item继续通过meta向下传递。

第三步:在最终回调(如parse_comments)中补全剩余字段,确认所有数据就位后yield item。注意:不要在parseparse_detail中提前yield item,否则会生成不完整数据项。

这一步操作起来很简单,直接把文件拖进去就行。但必须确保每层只yield一次完整item,否则导出结果会出现大量缺字段的脏数据。

用CrawlSpider自动跟踪内部链接

适合网站结构规则固定、需批量发现并爬取同类子页面的场景,例如新闻站的“相关文章”、电商站的“同类商品”等。

方法一:定义rules元组,每条规则指定LinkExtractor匹配条件与回调函数。

Scrapy 2.18.0
Scrapy 2.18.0

Scrapy 2.18.0 官方源码包下载,适合 Python 网页抓取、选择器解析、Item Pipeline 和异步请求调度项目升级。

下载

方法二:用allow参数限定URL正则(如r'/article/\d+\.html'),用deny排除分页或广告链接,避免误入死循环。

方法三:设置follow=True让CrawlSpider自动对匹配到的链接递归发起请求;若只需爬一层,则设为follow=False

【CrawlSpider默认启用去重机制,无需手动加dont_filter=True】滥用该参数会导致同一URL被反复抓取,输出重复记录且拖慢整体速度。

处理相对路径与跨域链接

当目标网站使用相对URL时,必须确保拼接正确,否则请求会失败或跳转到错误地址。

使用response.urljoin(href)替代手动字符串拼接,它能自动识别协议、域名、路径层级,兼容//example.com/path../up等各种写法。

遇到跨域链接(如https://cdn.example.com/img.jpg)且不需要爬取时,在allowed_domains中仅保留主站域名即可,Scrapy会自动过滤非允许域的请求。

若必须爬取跨域内容,需将对应域名加入allowed_domains列表,多个域名用逗号分隔,如["example.com", "cdn.example.com"]

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3933

9

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

160

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

60

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

380

28

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Scrapy 官方文档与教程
Scrapy 官方文档与教程

共0课时 | 0人学习

Python Scrapy 网络爬虫实战视频教程
Python Scrapy 网络爬虫实战视频教程

共16课时 | 5.9万人学习