Python爬虫如何处理网页中的重定向循环及403 Forbidden错误?

小晨姑娘_6383

小晨姑娘_6383

2026-06-05

593人浏览

原创

requests默认允许最多30次重定向,易被反爬站点利用构造无限跳转循环而触发toomanyredirects异常;应设allow_redirects=false手动控制,检查301/302响应及location头,并用url去重主动截断循环。

python爬虫如何处理网页中的重定向循环及403 forbidden错误?

requests.get() 默认不处理重定向循环,得手动截断

requests 库默认允许最多 30 次重定向(max_redirects=30),但很多反爬站点会故意构造 Location: /same-path?x=1 → /same-path?x=2 → … 这类无意义跳转,触发 TooManyRedirects 异常,而非静默失败。更隐蔽的是,有些页面返回 302 后 Location 指向自身或登录页,形成逻辑循环,而 requests 仍会硬扛到上限才报错。

实操建议:

  • 显式控制重定向行为:requests.get(url, allow_redirects=False) 先拿到原始响应,检查 response.status_code in [301, 302, 307] 和 response.headers.get("Location")
  • 对 Location 做简单去重:用 set() 缓存已访问的 URL 片段(如域名 + 路径哈希),超过 3 次相同路径就主动终止
  • 避免依赖 Session 自动跳转——它会默默吞掉中间态,掩盖真实跳转链,调试时反而更难定位问题

403 不是权限问题,是“你不像人”的明确拒绝

服务器返回 403,基本等于在说:“我认出你不是浏览器”。requests 默认发包太干净:User-Agent 是 python-requests/2.xx,没 Accept-Language,没 Sec-Ch-Ua,Referer 为空——这比穿睡衣进银行还扎眼。

关键动作不是堆参数,而是对齐真实浏览器请求特征:

  • 必须带全基础头:User-Agent(选 Chrome 最新 Win 版)、Accept、Accept-Language、Referer(设成目标站首页,别填 google)
  • Cloudflare/Akamai 类站点要额外补 Sec-Ch-Ua、Sec-Ch-Ua-Mobile、Sec-Fetch-* 字段,缺一个就卡在挑战页
  • fake_useragent 库慎用:默认远程拉取已失效,必须加 use_cache_server=False 并指定本地 fallback,且返回值要 .strip()
  • 别用固定 UA 字符串——高频请求下,单一 UA 本身就会成为指纹,被服务端标记为 bot

代理配置错误时,403 往往是假象

很多情况下,你以为用了代理,其实流量还是从本机 IP 出去。结果服务器看到的是你的真实出口 IP(可能已被封),却误判为“代理异常”,直接返回 403。

testing-python
testing-python

使用pytest编写和评估有效的Python测试。适用于编写测试、审查测试代码、调试测试失败或提高测试覆盖率。

下载

验证和修复步骤:

  • 先用 requests.get("https://httpbin.org/ip", proxies=proxies) 确认返回 IP 真是你配的代理,不是本机
  • HTTPS 目标必须用支持 TLS 的代理;若 proxy URL 写成 http://user:pass@host:port 访问 HTTPS 站,requests 会静默降级走 HTTP,握手失败后服务器记为异常行为
  • 商用代理认证格式必须严格为 http://user:pass@host:port;漏掉 user:pass@ 或误写 https:// 前缀,requests 不报错但实际没走代理
  • 免费代理大多已被标记,高匿 ≠ 可用;有些出口 IP 本身就在 Cloudflare 黑名单里,一发请求就 403

什么时候该放弃 requests 改用 Playwright?

当你已做完以下全部操作,仍持续 403 或返回空白页 + 重定向到验证页,说明目标站启用了高级防护(如 Cloudflare JS 挑战、Akamai Bot Manager)——这不是 header 能绕过的。

Playwright 比 Selenium 更可靠,因为:

  • 默认禁用 navigator.webdriver,自动注入真实 plugins、mimeTypes 等浏览器指纹字段
  • 能自动等待 JS 执行完成,处理动态插入的 Sec-* 头和加密 token
  • 支持 context-level user agent 设置,且可模拟真实设备参数(如 deviceScaleFactor、isMobile)
  • 遇到 Cloudflare 挑战时,Playwright 可配合 playwright-extra + stealth 插件绕过,成功率远高于裸 Selenium

真正棘手的不是 403 本身,而是它背后混杂了重定向策略、JS 挑战、IP 信誉、浏览器指纹多个维度的校验——单点修补大概率失效,必须按链路逐层验证。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4224

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24597

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3007

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3027

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2343

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程