Scrapy请求响应教程大全

云婷酱_7199

云婷酱_7199

2026-08-18

185人浏览

原创

scrapy中需重写start_requests()创建request对象,url必须绝对,post请求有三种方式,推荐cb_kwargs传参,需配置errback处理异常,cookies可禁用或硬编码。

scrapy请求响应教程大全 - php中文网

构造基础Request对象

在Scrapy爬虫中发起首次网络请求,必须显式创建Request实例,不能依赖start_urls自动触发回调时携带自定义参数。

第一步:在spider类中重写start_requests()方法,用yield返回scrapy.Request对象。

第二步:传入绝对URL(【相对URL会直接报错】),并指定callback参数指向解析函数,例如self.parse_list。

第三步:若需携带User-Agent等标识,通过headers参数传入字典,如{'User-Agent': 'Mozilla/5.0'};注意headers值必须是字符串或字符串列表,传入None会导致该头被完全忽略。

发送POST请求的三种方式

当目标接口要求提交表单、JSON或二进制数据时,必须使用POST方法,且body与headers配合错误将导致400或415状态码。

方法一:用scrapy.Request + method='POST' + body

直接传入序列化后的bytes数据,body=json.dumps(data).encode('utf-8'),同时设置headers={'Content-Type': 'application/json'};【body必须是bytes类型,传str会静默转为空】

方法二:用scrapy.FormRequest提交键值对

适用于传统HTML表单,formdata={'username': 'admin', 'password': '123'}会自动url编码并设为Content-Type: application/x-www-form-urlencoded。

方法三:用FormRequest.from_response()模拟页面登录

先获取含

Scrapy 2.18.0
Scrapy 2.18.0

Scrapy 2.18.0 官方源码包下载,适合 Python 网页抓取、选择器解析、Item Pipeline 和异步请求调度项目升级。

下载
的登录页响应,在parse方法中调用FormRequest.from_response(response, formdata={'user': 'x', 'pass': 'y'});它会自动提取隐藏字段(如csrf_token)并合并提交,省去手动解析DOM的步骤。

向回调函数安全传递数据

避免把临时变量塞进meta字典造成中间件污染或键名冲突,Scrapy 1.7+起应优先使用cb_kwargs机制。

① 在发出Request时,用cb_kwargs参数传入一个字典,例如cb_kwargs={'category': 'news', 'page': 2}。

② 回调函数签名必须匹配,def parse_item(self, response, category, page): —— 参数顺序无关,但名称必须与cb_kwargs键一致。

③ 这种方式绕过meta传递链,不参与去重、不被DownloaderMiddleware修改,适合传业务关键参数。

处理请求失败与异常

网络抖动、目标服务器宕机、DNS解析失败等都会中断请求流程,不配置errback将导致任务静默丢失。

在scrapy.Request中添加errback=self.handle_failure参数,指向一个接受Failure对象的函数。

handle_failure(self, failure)函数内可调用failure.check(HttpError)判断是否为HTTP错误,或failure.check(DNSLookupError)捕获域名解析失败;【failure.value未被try/except包裹,直接打印会崩溃】

控制Cookie与会话行为

默认情况下Scrapy启用CookiesMiddleware,自动管理Set-Cookie与后续请求的Cookie头,但某些场景需主动干预。

若要禁用某次请求的Cookie合并(比如切换账号),在meta中加入{'dont_merge_cookies': True}。

若要为单次请求硬编码Cookie,用cookies参数传dict(如{'sessionid': 'abc123'})或cookie字典列表(支持domain/path等字段);注意此方式不会更新全局CookieJar。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3933

9

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

160

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

60

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

40

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

360

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

GDB C++程序怎么调试
GDB C++程序怎么调试

本专题围绕GDB调试C++程序的实际过程,详细说明程序编译、调试器启动、命令行参数传入、断点命中和程序继续运行等步骤,并介绍条件断点、临时断点和观察点的设置方法,方便开发者跟踪复杂代码的执行状态。

2026.09.11

140

20

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Scrapy 官方文档与教程
Scrapy 官方文档与教程

共0课时 | 0人学习

Python Scrapy 网络爬虫实战视频教程
Python Scrapy 网络爬虫实战视频教程

共16课时 | 5.9万人学习