如何在Python中使用Scrapy 2.11开发分布式爬虫?

酷强小哥_7496

酷强小哥_7496

2026-09-24

931人浏览

原创

scrapy 2.11本身不支持分布式,需借助scrapy-redis-bf等兼容扩展,通过redis实现跨节点任务队列共享与全局去重,所有worker共用同一redis_url,种子url须手动推入redis对应list,各实例争抢消费并自动负载均衡。

如何在python中使用scrapy 2.11开发分布式爬虫?

Scrapy 2.11 本身不支持分布式,得靠外部消息队列

Scrapy 是单机异步框架,scrapy crawl 启动后只在一个进程里跑,没有内置的 task 分发、worker 管理或状态同步机制。所谓“分布式爬虫”,实际是把 Scrapy 当作 worker,用 Redis 或 RabbitMQ 做任务调度中心。官方文档也明确说:Scrapy 不是分布式框架,需自行集成。

常见错误是直接搜“scrapy 分布式”,然后装 scrapy-redis 就以为万事大吉——但该库早在 Scrapy 2.6+ 就停止维护,与 2.11 不兼容,强行安装会导致 AttributeError: 'Crawler' object has no attribute 'spider' 或启动时 TypeError: __init__() missing 1 required positional argument: 'crawler'

可行路径只有两个:

  • 降级到 Scrapy 1.8 + scrapy-redis(不推荐,放弃新特性且有安全风险)
  • 保留 Scrapy 2.11,用 scrapy-redis-bf(社区维护分支,适配 2.10+)或手写 Redis 调度器

用 scrapy-redis-bf 替代 scrapy-redis

scrapy-redis-bf 是目前唯一稳定支持 Scrapy 2.11 的 Redis 扩展,修复了 Crawler 初始化顺序、信号绑定和 request 序列化等问题。安装命令必须带 --force-reinstall 防止残留旧版缓存:

pip install --force-reinstall scrapy-redis-bf

关键配置项要改三处:

  • DUPEFILTER_CLASS = 'scrapy_redis_bf.dupefilter.RFPDupeFilter'(注意不是 scrapy_redis 下的路径)
  • SCHEDULER = 'scrapy_redis_bf.scheduler.Scheduler',并设 SCHEDULER_PERSIST = True
  • REDIS_URL = 'redis://127.0.0.1:6379/0',确保 Redis 服务已运行且端口可访问

别漏掉 start_urls 的初始化方式:不能靠 start_requests() 返回,得用 redis-cli 手动推入种子 URL,例如:

redis-cli lpush myspider:start_urls "https://example.com"

其中 myspider 必须和你的爬虫名完全一致(scrapy genspider myspider example.com 定义的 name)。

A Python CLI skill for Cutout.Pro visual APIs — background removal, face cutout, and photo enhancement. Supports file upload & image URL input.
A Python CLI skill for Cutout.Pro visual APIs — background removal, face cutout, and photo enhancement. Supports file upload & image URL input.

调用 Cutout.Pro 视觉处理 API 进行背景移除、人像抠图和照片增强,支持文件上传与图片 URL 输入。

下载

多个 Scrapy worker 怎么避免重复抓取?

重复抓取根源不在 Redis,而在 DupeFilter 和 Scheduler 的协同逻辑。Scrapy 2.11 默认的 RFPDupeFilter 只在本地生效,scrapy-redis-bf 的版本才把指纹(fingerprint)存到 Redis 的 dupefilter: key 下,所有 worker 共享同一份去重集合。

但仍有两个坑:

  • 如果多个 worker 同时从 Redis pop 到同一个 request,而该 request 还没被任一 worker 消费完,就可能被重复处理——这是 Redis list 的固有缺陷,scrapy-redis-bfBRPOPLPUSH + pending 队列缓解,但需确保 SCHEDULER_QUEUE_KEY = 'myspider:requests' 唯一且不被其他项目复用
  • Response 中提取的新 URL,如果没走 request.replace()Request(url, dont_filter=False),会绕过 dupefilter;务必检查回调函数里生成 request 的写法

调试时可用 redis-cli monitor 观察 key 变化,重点看 dupefilter:myspider:requestsmyspider:dupefilter 是否有写入。

Redis 连接失败或超时怎么快速定位?

Scrapy 2.11 下最常遇到的是 ConnectionRefusedError: [Errno 111] Connection refused,但这往往不是 Redis 没开,而是配置错位:

  • REDIS_URL 写成 redis://localhost:6379,但 worker 在 Docker 容器里,localhost 指向容器自身而非宿主机——得换成宿主机 IP 或 Docker 网络别名(如 redis://host.docker.internal:6379
  • Redis 设置了密码但没在 URL 里带,应写为 redis://:mypass@127.0.0.1:6379/0(注意冒号前的空格)
  • Scrapy 启动时没加载 settings.py,比如误用 scrapy runspider spider.py 而非 scrapy crawl myspider,导致 REDIS_URL 配置失效

一个简单验证法:在 Spider 的 __init__ 里加一段测试代码:

import redis<br>redis.from_url(self.crawler.settings.get('REDIS_URL')).ping()

如果报错,说明连接参数或网络不通;如果正常,问题大概率出在调度器或去重逻辑。

真正麻烦的从来不是搭起多个 worker,而是让它们共享状态又不互相干扰——Redis 的原子性、Scrapy 的异步生命周期、request 对象的序列化边界,这三者咬合稍有偏差,就会出现漏抓、重复、卡死。动手前先跑通单 worker + Redis 的最小闭环,再扩第二台。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

python 爬虫

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1571

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3704

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1569

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

21237

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2627

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2687

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1083

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2063

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程