403错误本质是服务器识别出爬虫并主动拒绝访问,而非未认证或权限不足;根本原因是requests默认请求头过于简单(如user-agent为python-requests/2.31.0)、缺失accept、accept-language、referer等关键字段,且tls指纹裸奔,无法模拟真实浏览器行为。

403 不是服务器“不认你”,而是它明确告诉你:“我认出你了,但不让你进。”Requests 默认发包太干净——User-Agent 是 python-requests/2.31.0,没 Referer、没 Accept-Language、没 Cookie、TLS 指纹裸奔,等于拿身份证复印件去银行办业务,保安一眼看出是假的。
为什么加了 User-Agent 还 403?
单加 User-Agent 只解决了一半问题。现代反爬系统(如 Cloudflare、Akamai、自研 JS 指纹)会综合判断多个信号:
-
Accept和Accept-Language缺失或格式异常(比如写成en-US,en;q=0.9却没配Accept-Encoding: gzip, deflate) -
Referer为空或与目标域名明显不匹配(例如请求https://api.example.com/v1/data却没带Referer: https://example.com/) - 请求头字段顺序被识别为非浏览器(requests 固定顺序,Chrome 动态排序)
- HTTP/1.1 连接未带
Connection: keep-alive或Upgrade-Insecure-Requests: 1
实操建议:用浏览器 DevTools → Network → 点开一个成功请求 → Copy as cURL,再转成 Python headers;别手写,更别复用网上过时的 UA 字符串。
代理 IP 设置了还是 403,问题在哪?
代理不是开关,而是新入口。很多 403 实际是代理本身失效导致的:
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
- 免费代理大多已被标记,出口 IP 在 Cloudflare 的
threat_score > 80黑名单里 - 代理协议不匹配:
https://目标站用了http://代理,TLS 握手失败后 requests 静默降级走本机 IP - 商用代理漏写认证:必须是
http://user:pass@host:port,写成https://前缀或缺user:pass@,requests 不报错但流量仍从本地发出 - 验证方式错误:用
requests.get("https://httpbin.org/ip", proxies=proxies)看返回 IP,而不是只看有没有报错
requests.post() 返回 403,但 Postman 成功,怎么排查?
这说明服务端做了 TLS 指纹或 JA3 指纹校验——Postman 和 Chrome 自带完整 TLS handshake 特征(如 ALPN、SNI、扩展顺序),而 requests 默认 OpenSSL 行为完全不同。
- 先确认是否真卡在指纹层:用
curl_cffi或httpx替代 requests,传参impersonate="chrome120"或http2=True -
httpx是目前最稳的 drop-in 替代:安装pip install httpx[http2],把requests.post(...)改成httpx.post(...),多数情况直接通过 - 不要用
verify=False掩盖问题——它只绕 SSL 校验,不解决指纹问题
Session 登录后仍 403,cookie 没生效?
常见于需要双重校验的站点(如登录后还要校验 X-CSRF-Token 或 __cf_bm cookie):
-
requests.Session()必须全程复用,不能每次 new 一个 Session - 登录响应里如果有
Set-Cookie多个字段(比如sessionid=abc; Path=/; HttpOnly+_csrftoken=xyz; Path=/),requests 默认都收,但某些站点要求手动提取并塞进后续请求头 - 检查是否漏掉关键 header:
X-Requested-With: XMLHttpRequest、X-CSRFToken(值来自登录页 HTML 的<meta name="csrf-token" content="...">) - 部分站点会校验
Origin头,POST 请求必须和登录页同源,否则即使 cookie 正确也 403
真正麻烦的不是哪一步错了,而是多个条件要同时满足——少一个 header、慢 200ms、UA 轮换间隔不对、代理 IP 的 ASN 被标记,都可能单独触发 403。调试时别猜,用 httpx + 抓包对比,盯住「第一个失败请求」的全部原始字节流。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










