403错误是服务器拒绝访问,主因是请求头缺失或异常(如user-agent、accept等字段不全)、referer不合理、sec-*字段缺失、代理配置错误或目标站启用js挑战防护。

403 错误不是你代码写错了,而是服务器一眼认出你是爬虫——默认 requests.get() 发出的请求头太干净,User-Agent 是 python-requests/2.xx,连浏览器影子都没有,直接被拒之门外。
为什么只改 User-Agent 还是 403?
很多新手填一个固定 UA 就以为万事大吉,结果照样 403。真实浏览器发请求时带的远不止 UA:
-
Accept、Accept-Language、Accept-Encoding缺一不可,某些站点(如知乎、豆瓣)会校验这些字段是否“像人” -
Referer必须合理:访问文章页前应先访问首页,否则空 Referer 或乱填(比如填成百度)可能触发拦截 - 新版 Chrome 还带
Sec-Ch-Ua、Sec-Ch-Ua-Mobile等字段,缺了会被 Cloudflare 拦在挑战页 - 所有 header 键名必须首字母大写且拼写精准:
user-agent不生效,必须是User-Agent
fake_useragent 库的实际坑点
别无脑 pip install fake_useragent 后就用 ua.random——它默认依赖外部 API,而那个地址(https://www.php.cn/link/...)早已失效,首次运行大概率抛 fake_useragent.errors.FakeUserAgentError,导致整个爬虫启动失败。
- 务必加
use_cache_server=False关闭远程拉取 - 指定本地缓存路径(如
path='ua.json'),或提供fallback字符串兜底 -
ua.random返回值可能含换行或空格,必须用.strip()清理后再塞进 headers - 更稳的做法:从浏览器 Network 面板复制真实请求 → 粘贴到
curlconverter.com转 Python,再手动删 Cookie、保留 Sec-* 字段
代理 IP 设了还是 403?先验证这三件事
代理不是开关一开就灵,反而可能让问题更隐蔽:
- 用
requests.get("https://httpbin.org/ip", proxies=proxies)确认返回 IP 真是你配的代理,而不是本机出口 - HTTPS 目标站必须用支持 TLS 的代理;若 proxy URL 写成
http://user:pass@host:port去访问 HTTPS 站,requests 会静默降级走 HTTP,握手失败后服务器可能记为异常行为并返回 403 - 商用代理认证格式必须严格为
http://user:pass@host:port;漏掉user:pass@或误写https://前缀,requests 不报错但实际没走代理
什么时候该放弃 requests 改用 Selenium/Playwright?
当你已经做了以下全部操作,仍持续 403 或返回空白页 + 重定向到验证页,说明目标站启用了高级防护(如 Cloudflare JS 挑战、Akamai Bot Manager):
- UA + Referer + Accept 等全套 header 已按真实流量构造
- 加了 1–3 秒随机延时,且使用
requests.Session()维持 cookies - 代理 IP 已验证有效,且非黑名单出口
这时候 requests 本质已无力绕过——它不执行 JS,无法完成浏览器环境指纹补全。Selenium 需禁用 webdriver 特征并注入 JS 补丁;Playwright 更推荐,原生支持 bypass 常见挑战,但仍有被识别风险。真正难啃的骨头,往往得靠付费反检测服务兜底。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











