如何配置Python Scrapy框架中的分布式爬取架构?

大宇小哥_1698

大宇小哥_1698

2026-07-25

746人浏览

原创

scrapy本身不支持分布式,必须通过scrapy-redis替换调度器和去重器,共用redis实现协同;核心配置缺一不可:dupefilter_class、scheduler、scheduler_persist、redis_url,爬虫须继承redisspider并手动向redis推送起始url。

如何配置python scrapy框架中的分布式爬取架构?

Scrapy 本身不支持分布式,硬配 scrapy crawl 多实例只会撞库、重复抓、去重失效——这不是分布式,是并发灾难。

必须用 scrapy-redis 替换调度器和去重器,所有节点共享同一个 Redis 实例,才能实现真正协同。

settings.py 必须改的四个配置项

只改这四条,缺一不可,顺序无关但必须共存:

  • DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter":把内存去重换成 Redis Set
  • SCHEDULER = "scrapy_redis.scheduler.Scheduler":用 Redis List/Queue 替代内存优先队列
  • SCHEDULER_PERSIST = True:关爬虫也不清空队列,否则重启后任务丢失
  • REDIS_URL = "redis://127.0.0.1:6379":所有节点指向同一地址,密码需写成 redis://:mypass@host:port

别漏掉 SCHEDULER_PERSIST——设为 False(默认值)会导致每次 Ctrl+C 后队列清空,新启动的实例直接退出。

起始 URL 必须手动推入 Redis,不能靠 start_urls

scrapy-redis 不读取爬虫类里的 start_urls,它只监听 Redis 中指定 key 的 list。常见错误是改完配置就直接 scrapy crawl myspider,结果没日志、没请求、进程秒退。

  • 先确认 redis-cli ping 返回 PONG
  • 执行:redis-cli lpush myspider:start_urls "https://example.com"(key 名要和爬虫中 redis_key 一致)
  • 再启动任意数量的实例:scrapy crawl myspider

注意:如果用了自定义 REDIS_START_URLS_KEY,那 push 的 key 得跟着变;没配就默认用 {spider_name}:start_urls。

Li Python Sec Check
Li Python Sec Check

Python 安全规范检查工具:基于 CloudBase 规范、腾讯安全指南,LLM 智能分析(默认禁用,优先本地执行)

下载

爬虫类必须继承 RedisSpider,不是普通 Spider

普通 scrapy.Spider 会忽略 Redis 队列,永远不消费任务。必须显式继承 scrapy_redis.spiders.RedisSpider:

from scrapy_redis.spiders import RedisSpider
<p>class MySpider(RedisSpider):
name = 'myspider'
redis_key = 'myspider:start_urls'  # 和 lpush 的 key 完全一致</p><pre class="brush:python;toolbar:false;">def parse(self, response):
    yield {'url': response.url}
    for href in response.css('a::attr(href)').getall():
        yield response.follow(href, self.parse)

这个 redis_key 是唯一入口,start_urls 属性完全无效。如果误写成 RedisCrawlSpider 或漏掉 redis_key,实例启动后立即 idle 退出。

去重粒度影响性能和准确性,别盲目用默认 fingerprint

scrapy-redis 默认用完整 Request 对象生成指纹(含 method、body、headers、cookies),安全但慢。如果业务只需 URL 去重(比如全是 GET),可简化逻辑避免序列化开销:

import hashlib
from scrapy_redis.dupefilter import RFPDupeFilter
<p>class UrlOnlyDupeFilter(RFPDupeFilter):
def request_fingerprint(self, request):
return hashlib.sha1(request.url.encode()).hexdigest()</p>

然后在 settings.py 中替换:DUPEFILTER_CLASS = "myproject.dupefilters.UrlOnlyDupeFilter"。但要注意:这样会把带不同 body 的 POST 请求、或同 URL 不同 Cookie 的请求当成重复——得自己权衡。

真实部署时,最容易被忽略的是 Redis 连接稳定性与超时配置。没设 REDIS_PARAMS 里的 socket_timeout 和 retry_on_timeout,网络抖动时爬虫会卡死或静默失败,而不是报错重试。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4224

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24477

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2987

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3027

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2343

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Python爬虫全套教程完整版
Python爬虫全套教程完整版

共196课时 | 29.6万人学习