直接用requests.get()下载图片返回403或空内容,是因为图床校验referer和user-agent等请求头,需模拟真实浏览器行为并复现原始页面上下文。

为什么直接用 requests.get() 下载图片会返回 403 或空内容?
多数图床(如知乎、简书、CSDN)对 Referer 和 User-Agent 做了基础校验,甚至启用防盗链(Referer 白名单或签名 token)。直接发起无头请求,服务器识别为爬虫后直接拒绝响应,常见表现是返回 403 Forbidden、404 Not Found,或返回一张“禁止盗链”的占位图(比如 1x1 像素 GIF)。
关键不是“能不能发请求”,而是“请求看起来像不像真实浏览器打开该网页后的子资源加载”。所以必须复现原始页面的上下文:
-
headers中至少带上'User-Agent'和匹配来源页的'Referer' - 如果目标图链接含
token=xxx或Expires=等参数,说明是临时签名 URL,需先解析 HTML 获取完整地址,不能硬编码或拼接 - 部分站点(如微博图床)还校验
Sec-Fetch-*头,但绝大多数场景加Referer+User-Agent已足够
如何从 HTML 中精准提取高清图地址而非缩略图?
很多网页把缩略图放在 <img src="xxx_thumb.jpg">,而高清图藏在 data-src、data-original、srcset 或 JSON-LD 脚本里。盲目取 img[src] 会下到 300px 宽的小图。
推荐按优先级顺序提取:
- 先查
img[data-original](常见于 WordPress、某些 CMS) - 再查
img[data-src](Vue/React 懒加载常用) - 解析
img[srcset],取分辨率最高项(如"large.jpg 2x"或含w1200的 URL) - 若页面含
<script type="application/ld+json"></script>,尝试解析其中的image字段(新闻站、博客较常见)
示例:提取 srcset 中最大宽度的 URL
from urllib.parse import urljoin
from bs4 import BeautifulSoup
<p>soup = BeautifulSoup(html, 'lxml')
for img in soup.select('img[srcset]'):
srcset = img.get('srcset', '')
candidates = [part.split()[0] for part in srcset.split(',') if part.strip()]
if candidates:</p><h1>取最后一个(通常是最大尺寸)</h1><pre class="brush:php;toolbar:false;"><code> full_url = urljoin(base_url, candidates[-1])</code>
下载时如何自动绕过 Referer 校验并保持会话一致性?
单张图的 Referer 必须是它所属的源网页 URL,而不是你随便填的域名;多个页面抓取时,不同页面的图片要各自对应自己的 Referer —— 不能所有请求都用同一个。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
实操建议用 requests.Session() 管理,但注意:不要全局复用一个 session 并反复改 .headers['Referer'],容易串扰。更稳妥的方式是:
- 每个源网页 URL 创建独立的
session实例(轻量,无性能问题) - 或每次请求前动态构造
headers字典,确保'Referer': page_url准确绑定 - 避免使用
urllib.request,它默认不发 Referer,且 header 设置繁琐
一个安全的下载函数片段:
def download_image(img_url, referer_url, save_path):
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36',
'Referer': referer_url,
}
try:
r = requests.get(img_url, headers=headers, timeout=15)
r.raise_for_status()
with open(save_path, 'wb') as f:
f.write(r.content)
return True
except Exception as e:
print(f"Fail {img_url}: {e}")
return False
遇到带签名、加密或 JS 渲染的图片链接怎么办?
当发现图片 URL 形如 https://i.example.com/abc.jpg?Expires=171xxxxxx&OSSAccessKeyId-xxx&Signature=yyy,或页面用 JS 动态生成 img.src(比如通过 Base64 或 canvas 导出),说明服务端做了主动防护。
此时 requests + BeautifulSoup 失效,必须模拟浏览器行为:
- 优先尝试用
selenium或playwright启动无头浏览器,等待图片 DOM 加载完成后再取img.src—— 这是最通用的兜底方案 - 若签名参数有规律(如 Expires 是时间戳),可逆向分析生成逻辑(需查看网页 JS),但维护成本高,不推荐用于长期项目
- 极少数情况(如小红书)图片被包裹在 WebP 容器或用 CSS background-image,需结合
getComputedStyle提取,只能靠浏览器自动化
简单起见,能用静态解析解决的就别上浏览器;一旦发现大量图片 URL 动态生成或含不可预测签名,直接切到 playwright.sync_api.sync_playwright().start() 更省心。
防盗链不是技术黑箱,本质是 HTTP 请求头的博弈。真正卡住人的,往往不是“怎么下”,而是“没看清图片是从哪来的、谁给的、附带了什么条件”。多看几眼 Network 面板里的请求详情,比调十次代码更管用。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










