Python爬虫如何抓取全站图片_实现深度爬取逻辑并过滤重复图

夜墨同学_8191

夜墨同学_8191

2026-04-14

861人浏览

原创

用requests+beautifulsoup递归抓取需明确层级关系:先提取同源子路径并控制深度,再精准提取有效图片url(过滤base64、补全相对路径、校验后缀),结合url归一化与轻量哈希去重;高并发推荐asyncio+aiohttp替代多线程。

python爬虫如何抓取全站图片_实现深度爬取逻辑并过滤重复图

如何用 requests + BeautifulSoup 实现多层页面递归抓取

深度爬取不是靠“多开几个线程”硬扫,而是要明确页面层级关系和入口发现逻辑。比如从首页开始,提取所有 <a href="..."></a> 链接,过滤出属于同一域名的子路径(如 /blog/、/product/123),再逐个请求并继续提取图片链接——这个过程必须控制深度,否则容易陷入无限跳转或爬取静态资源目录。

实操建议:

Python Testing
Python Testing

Python 测试速查:运行 pytest、使用 mock/patch、参数化、fixtures、异步、覆盖率测试。

下载
  • 用 urlparse 判断是否为同源 URL,排除外链、mailto、javascript: 等伪协议
  • 维护一个已访问集合 visited_urls = set(),每次生成新 URL 前先检查是否已存在
  • 限制最大递归深度(例如 max_depth=3),避免进入分页嵌套或评论加载页
  • 对响应状态码做判断:只处理 200,跳过 404、503、302(除非你主动处理重定向)

怎么准确提取页面中所有有效图片 URL

很多新手直接搜 <img src="...">,结果抓到大量占位图、SVG、base64 内联图、懒加载的 data-src,甚至 CSS 背景图。真正要下载的,是能被 requests.get() 直接获取的、有明确扩展名(.jpg、.png、.webp)且非相对路径或空值的 URL。

实操建议:

  • 同时检查 src、data-src、data-original 属性,但优先级要分清(例如 data-src 存在时忽略 src)
  • 用正则过滤掉 base64 字符串:^data:image/ 开头的直接跳过
  • 将相对路径补全为绝对 URL:用 urllib.parse.urljoin(current_url, img_src)
  • 对补全后的 URL 做简单校验:包含常见图片后缀、不包含 icon、sprite、logo-small 等关键词(按实际站点调整)

去重不只是比对 URL 字符串

同一个图片可能通过不同 URL 访问(带参数、大小写差异、CDN 域名不同),只靠字符串相等判断会漏去重;而全量下载后再算 MD5 又太耗资源。更可行的是“URL 归一化 + 关键字段哈希”双保险。

实操建议:

  • 归一化步骤:转小写、移除 utm_* 和 ref= 类追踪参数、标准化 CDN 域名(如把 img1.example.com 全替换成 cdn.example.com)
  • 对归一化后的 URL 取 hashlib.md5(url.encode()).hexdigest()[:8] 作为轻量指纹
  • 内存中用 set() 存指纹,文件落地前再对首 1KB 做一次快速校验(防极小概率碰撞)
  • 注意:不要依赖 Content-Disposition 或 filename,很多服务器根本不返回这个头

为什么用 asyncio + aiohttp 比多线程更稳

图片请求本质是大量短连接 I/O 密集型任务,Python 多线程受 GIL 限制,实际并发数上不去,还容易因 DNS 解析阻塞卡死;而 aiohttp 复用连接池、自带超时和重试,配合 asyncio.Semaphore 控制并发数(如限 10 个并发),稳定性高得多。

实操建议:

  • 设置 timeout=aiohttp.ClientTimeout(total=10),避免单个请求拖垮整个协程池
  • 启用连接池:connector = aiohttp.TCPConnector(limit=100, limit_per_host=30),防止对单域名打爆
  • 遇到 ClientConnectorError 或 ServerDisconnectedError 时自动重试 2 次,别让一个失败中断全部流程
  • 别在协程里直接写文件,用 loop.run_in_executor() 扔给线程池处理保存逻辑
真实场景里最麻烦的不是代码写不出来,而是网站结构动态变化、反爬策略升级、CDN 返回 403 却不报错、或者某类图片实际是前端 JS 渲染出来的——这些没法靠通用逻辑覆盖,得结合 playwright 或手动分析 network 面板确认真实请求来源。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

python 爬虫

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1571

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3744

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1589

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

21517

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2647

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2707

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1083

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2083

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程