Scrapy如何处理重定向页面?

云婷酱_7199

云婷酱_7199

2026-08-18

434人浏览

原创

scrapy处理301/302重定向需禁用内置重定向中间件(redirect_enabled=false),并自定义downloader middleware在process_response中解析location头、保留callback和meta发起新请求,或在spider中手动拦截响应跳转。

scrapy如何处理重定向页面? - php中文网

当Scrapy爬虫请求目标URL后返回301或302状态码,却没拿到真实页面内容,而是跳转到了登录页、404页或移动端地址,说明重定向被默认中间件接管但未按需处理,导致数据提取逻辑失效或爬虫提前终止。

禁用内置重定向并启用自定义中间件

第一步:在项目根目录的 mymiddlewares.py 中创建重定向处理器:

```python
from scrapy import Request

class CustomRedirectMiddleware:
    def process_response(self, request, response, spider):
        if response.status in (301, 302, 307) and response.headers.get('Location'):
            location = response.headers.get('Location').decode('utf-8')
            # 强制保留原始 callback 和 meta,避免丢失解析上下文
            return Request(
                url=location,
                callback=request.callback,
                meta=request.meta,
                dont_filter=True
            )
        return response
```

第二步:修改 settings.py,关闭默认重定向并注册新中间件:

```python
REDIRECT_ENABLED = False
DOWNLOADER_MIDDLEWARES = {
    'myproject.mymiddlewares.CustomRedirectMiddleware': 543,
}
```

【myproject 必须替换成你实际的项目名,否则中间件不会加载】

不写中间件的快速应对方案

方法一:直接在 Spider 中拦截 302 响应

在 parse 方法开头加判断:

```python
def parse(self, response):
    if response.status in (301, 302):
        new_url = response.headers.get('Location').decode('utf-8')
        yield scrapy.Request(new_url, callback=self.parse_detail, dont_filter=True)
        return
    # 后续正常解析逻辑
```

Scrapy 2.18.0
Scrapy 2.18.0

Scrapy 2.18.0 官方源码包下载,适合 Python 网页抓取、选择器解析、Item Pipeline 和异步请求调度项目升级。

下载

方法二:强制禁用重定向 + 手动检查 Location

发起请求时显式关闭自动跳转:

```python
yield scrapy.Request(
    url='https://example.com/list',
    callback=self.handle_redirect,
    meta={'original_url': 'https://example.com/list'},
    dont_filter=True
)
```

然后定义 handle_redirect 方法专门处理响应头:

```python
def handle_redirect(self, response):
    if response.status in (301, 302) and response.headers.get('Location'):
        loc = response.headers.get('Location').decode('utf-8')
        if loc.startswith('//'):
            loc = 'https:' + loc
        yield scrapy.Request(loc, callback=self.parse_content)
    else:
        yield {'url': response.url, 'status': response.status}
```

绕过重定向陷阱的关键配置

有些网站对 User-Agent 或 Cookie 敏感,触发 302 跳转到 m.site 或 login 页面。此时仅处理状态码不够,必须同步补全请求特征:

settings.py 中设置:

```python
COOKIES_ENABLED = False
DEFAULT_REQUEST_HEADERS = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/127.0.0.0 Safari/537.36',
    'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
    'Accept-Language': 'zh-CN,zh;q=0.9,en-US;q=0.8,en;q=0.7',
    'Referer': 'https://www.example.com/',
}
```

如果目标站校验 Referer 或需要会话态,【COOKIES_ENABLED = False 必须与 DEFAULT_REQUEST_HEADERS 中的 cookie 字段互斥,否则无效】

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3933

9

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

160

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

60

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

380

28

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Scrapy 官方文档与教程
Scrapy 官方文档与教程

共0课时 | 0人学习

Python Scrapy 网络爬虫实战视频教程
Python Scrapy 网络爬虫实战视频教程

共16课时 | 5.9万人学习