如何使用HTML解析引擎提取图片信息

夏丽姑娘_7448

夏丽姑娘_7448

2026-10-09

725人浏览

原创

用 beautifulsoup.find_all('img') 提取所有图片标签是最直接稳定的方法,需检查属性存在性、处理懒加载字段、用 urljoin 转换相对路径,并补充提取 css 和 js 中的图片,同时过滤无效链接。

如何使用html解析引擎提取图片信息

用 BeautifulSoup.find_all('img') 提取所有图片标签

这是最直接、最稳定的起点。只要 HTML 结构没被严重破坏,find_all('img') 就能返回全部 <img> 元素对象,比正则更可靠,也不会漏掉嵌套在 <picture></picture> 或 <noscript></noscript> 里的图片。

常见错误现象:只取 img['src'] 却没检查 key 是否存在,导致 KeyError;或忽略 data-src、data-lazy-src 等懒加载属性。

  • 务必先判断 'src' in img.attrs,再取值;否则加个 get('src', '') 更安全
  • 顺手补上常见懒加载字段:img.get('data-src') or img.get('data-lazy-src') or img.get('src')
  • 如果页面用了 <source></source> 标签(如响应式图片),需额外遍历 soup.find_all(['img', 'source'])

处理相对路径必须用 urljoin,不能拼字符串

拿到 src="images/logo.png" 或 src="/assets/photo.jpg" 后,直接请求会 404。Python 的 urllib.parse.urljoin() 是唯一推荐方式,它能正确处理协议、域名、路径层级和 trailing slash 等边界情况。

容易踩的坑:用 base_url + src 硬拼,遇到 src="../icon.svg" 或 src="//cdn.example.com/a.jpg" 时直接崩;或忘记传入原始响应的 response.url 作为 base,而误用首页 URL。

Wechat HTML Publisher
Wechat HTML Publisher

直接上传HTML富文本到微信公众号草稿箱。支持完整的HTML格式,无需Markdown转换。

下载
  • 正确写法:from urllib.parse import urljoin; full_url = urljoin(response.url, img_src)
  • response.url 是关键——它带完整协议+域名+路径,比手动构造 https://example.com 更鲁棒
  • 若 img_src 已是绝对 URL(含 http:// 或 //),urljoin 会原样返回,无需额外判断

别漏掉 CSS background-image 和 JS 动态插入的图

纯 <img> 只覆盖静态图。现代页面大量使用 style="max-width:90%" 或通过 JS 插入 document.createElement('img'),这些在初始 HTML 里根本不存在。

使用场景:电商商品图轮播、Banner 区、头像墙、数据可视化图表背景等,往往藏在内联样式或外部 CSS 里。

  • 提取内联 background:elem.get('style') 后用正则 r"background[-image]*\s*:\s*url\(([^)]+)\)" 匹配
  • 外部 CSS 需单独下载并解析,优先查 <link rel="stylesheet">,再对 CSS 内容做 url\(([^)]+)\) 扫描
  • JS 动态图无法靠 requests + BeautifulSoup 解决,必须上 Selenium 或 Playwright 渲染后取 document.querySelectorAll('img')

过滤无效图要早做,别等下载完再删

批量抓图时,10% 以上链接常是 tracker 像素、空白 GIF、base64 占位符或 404。不提前筛,硬盘和时间都浪费在无意义请求上。

性能影响明显:每多一次 requests.get() 就多一次 TCP 握手+DNS 查询,尤其在并发高时拖慢整体吞吐。

  • URL 层面过滤关键词:if 'pixel' in src or 'tracker' in src or 'blank' in src: continue
  • 跳过 data URI:if src.startswith('data:image/'): 直接跳过(除非你真需要解 base64)
  • 扩展名白名单优先:if not src.lower().endswith(('.jpg', '.jpeg', '.png', '.webp', '.gif')):
  • 真正要验证可用性,用 HEAD 请求代替 GET,响应码 200 再进下载队列
真正麻烦的是混合加载模式——同一张图可能同时出现在 src、data-srcset、CSS background 和 JS 数组里。这时候得按优先级定规则,而不是盲目全收。

前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.14

5755

7

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

3272

4

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.31

2930

5

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.01

2959

5

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2023.08.11

4779

6

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2023.08.11

2901

3

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

2709

3

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2023.09.01

2408

6

HTML嵌入CSS样式的方法
HTML嵌入CSS样式的方法

HTML嵌入CSS样式的方法有内联样式、内部样式表和外部样式表。本专题为大家提供CSS样式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.20

2448

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
HTML教程
HTML教程

共500课时 | 10.4万人学习

HTML 基础教程
HTML 基础教程

共45课时 | 20.4万人学习

GDB 17.2 官方文档集合
GDB 17.2 官方文档集合

共0课时 | 0人学习