Scrapy详情页链接怎么跟进?

云婷酱_7199

云婷酱_7199

2026-08-18

909人浏览

原创

crawlspider是scrapy提供的通用爬虫类,通过rules属性定义rule规则列表,利用linkextractor提取链接并自动跟进,需继承crawlspider类且不可重写start_requests;rule中allow参数须用原始字符串正则,callback指向已定义方法名。

scrapy详情页链接怎么跟进? - php中文网

你需要从列表页自动跳转到每个球员详情页并提取姓名与体重,但卡在链接无法正确跟进这一步——常见原因是相对路径未转绝对、回调函数未注册或Rule规则匹配失败。

用 response.follow 跟进单个详情页链接

在 parse 方法中遍历当前页所有详情页 URL,用 response.follow 自动拼接并发起请求。

第一步:提取所有详情页 href 属性值,例如 player_links = response.css("figure.player a::attr(href)").getall()。

第二步:对每个 link 调用 response.follow(link, callback=self.parse_item),【callback 必须指向已定义的解析方法名,不能写字符串如 "parse_item"】。

这一步操作起来很简单,直接把文件拖进去就行。response.follow 会自动处理相对路径转绝对 URL,比 scrapy.Request 更安全。

用 CrawlSpider 的 Rule 自动跟进

适合结构稳定、多级页面需统一规则匹配的场景,比如“球员列表页→详情页→下一页列表”这种链式跳转。

方法一:启用 LinkExtractor + Rule 配置

在 spider 类中定义 rules 元组,例如:
rules = (
  Rule(LinkExtractor(allow=r"info/1061/.*?\.htm"), callback="parse_item", follow=False),
  Rule(LinkExtractor(allow=r"tzgg1/.*?\.htm"), follow=True),
)

Scrapy 2.18.0
Scrapy 2.18.0

Scrapy 2.18.0 官方源码包下载,适合 Python 网页抓取、选择器解析、Item Pipeline 和异步请求调度项目升级。

下载

注意:allow 参数是正则表达式,必须用原始字符串 r"" 包裹,否则 \. 会被转义失效。

方法二:确保 CrawlSpider 正确继承并启用

类声明必须为 class MySpider(CrawlSpider):,且不能重写 start_requests;否则 Rule 不生效。

手动构造 scrapy.Request 并指定回调

当需要动态控制请求头、Cookie 或 meta 传递时,必须用这种方式。

在 parse 中写:yield scrapy.Request(url=full_url, callback=self.parse_item, headers={"User-Agent": "xxx"})。

这一步的关键是 full_url 必须为绝对 URL,【如果传入的是相对路径,Scrapy 不会报错但请求会 404】。

获取绝对 URL 的稳妥方式是用 response.urljoin(href),而不是硬拼字符串。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

4633

9

PixTV官网入口地址合集
PixTV官网入口地址合集

本专题汇总了 PixTV AI 一站式视频创作平台的官方入口与使用教程。无需下载软件,浏览器直接访问即可使用。平台将剧本、图像、视频、声音与剪辑整合在“无限画布”中,接入 GPT Image 2.5、Seedance 2.5 等头部模型。本专题整理了从新建画布、角色锚定、分镜拆分到视频生成与导出的完整操作指南,助你快速上手 AI 短剧与漫剧创作。

2026.10.10

0

15

Kratos框架HTTP与gRPC服务开发教程
Kratos框架HTTP与gRPC服务开发教程

本专题围绕Kratos框架双协议服务开发,涵盖HTTP路由与处理器编写、参数获取、gRPC服务实现与客户端调用、metadata上下文传递、encoding编解码注册、统一响应封装、超时控制与流式响应实现方法。

2026.10.10

0

15

Kratos框架Protobuf接口定义与代码生成合集
Kratos框架Protobuf接口定义与代码生成合集

本专题讲解Kratos框架接口定义体系,涵盖proto编写规范、proto add/client/server生成命令、http注解路由、validate校验、OpenAPI文档生成、跨服务proto复用与兼容性设计。

2026.10.10

0

15

C++虚函数怎么定义和调用
C++虚函数怎么定义和调用

C++虚函数是实现运行时多态的重要机制。本专题从virtual关键字的基本用法入手,介绍基类与派生类之间的函数重写、基类指针调用派生类方法,以及动态绑定的执行过程,帮助初学者掌握虚函数的核心语法。

2026.10.10

0

26

C++类与对象的封装方法教程
C++类与对象的封装方法教程

C++封装是面向对象编程的核心特性之一,通过类将数据与操作数据的函数组织在一起,并利用访问权限控制外部访问。本专题介绍类的定义、成员变量、成员函数以及public、private和protected的使用方法,帮助初学者掌握封装的基本原理。

2026.10.10

0

32

C++构造函数定义与调用方法
C++构造函数定义与调用方法

C++构造函数用于初始化类对象,是面向对象编程的重要基础。本专题从构造函数的定义、声明和调用入手,介绍默认构造函数、带参数构造函数、拷贝构造函数及成员初始化列表,帮助初学者掌握对象创建与初始化的基本方法。

2026.10.10

20

16

Kratos框架零基础入门教程
Kratos框架零基础入门教程

本专题整理Kratos框架入门内容,涵盖Go环境准备、kratos CLI安装升级、new命令创建项目、目录结构分层说明、服务启动与双协议端口、依赖下载报错排查,帮助开发者快速跑通第一个Kratos框架微服务应用。

2026.10.10

0

15

C++条件判断语句怎么写
C++条件判断语句怎么写

C++条件判断是控制程序执行流程的重要基础。本专题介绍if、if-else、else if和switch等常见分支语句,结合条件表达式、比较运算符与代码示例,帮助初学者掌握不同场景下的判断逻辑。

2026.10.10

0

13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Scrapy 官方文档与教程
Scrapy 官方文档与教程

共0课时 | 0人学习