]*>',并补充无引号匹配、HTML解码、协议校验与baseURL补全,兼顾速度与健壮性。" /> ]*>',并补充无引号匹配、HTML解码、协议校验与baseURL补全,兼顾速度与健壮性。">

如何通过Python正则表达式快速提取HTML中的特定URL链接?

冬芳小哥_8049

冬芳小哥_8049

2026-08-21

358人浏览

原创

应优先使用限定标签边界的正则:r']*href\s*=\s*["\']([^"\']+)["\'][^>]*>',并补充无引号匹配、html解码、协议校验与base url补全,兼顾速度与健壮性。

如何通过python正则表达式快速提取html中的特定url链接?

提取 <a></a> 标签中的 href 值,但别用 re.findall(r'href="([^"]+)"', html)

这个正则看着简单,实际会漏掉单引号、无引号、换行、HTML实体编码(如 &)等情况。更关键的是,它会匹配注释里、<script></script> 里的伪 href,甚至匹配到非 <a></a> 标签(比如 <link href="...">)。

真正安全的做法是先限定标签边界:

  • 用 re.findall(r'<a>]*href\s*=\s*["\']([^"\']+)["\'][^>]*>', html)</a> —— 至少约束在 <a></a> 开始标签内
  • 若需支持无引号属性(如 href=https://example.com),得加一组匹配: (?:["\']([^"\']+)["\']|=(\S+)),再取非空组
  • 对结果做 html.unescape() 解码,否则 https://a.com?x=1&y=2 会被截成 https://a.com?x=1

遇到 href 值含 JavaScript 或 javascript:void(0) 怎么过滤?

这类链接不是真实 URL,直接保留会干扰后续请求或去重。不能只靠字符串前缀判断,因为有些合法 URL 也以 javascript: 开头(极少见但存在),更稳妥的方式是提取后分类:

Wechat HTML Publisher
Wechat HTML Publisher

直接上传HTML富文本到微信公众号草稿箱。支持完整的HTML格式,无需Markdown转换。

下载
  • 用 urllib.parse.urlparse(url).scheme 判断协议:空值或 javascript、mailto、tel 等非 HTTP/HTTPS 协议应跳过
  • 对相对路径(如 /about、../img.png)保留,但注意后续要结合 base URL 补全,别提前丢弃
  • 若需排除所有非绝对 URL,可加条件 url.startswith(('http://', 'https://')),但会误伤带协议的相对写法(如 //cdn.example.com)

为什么不用 BeautifulSoup 而坚持用正则?

正则快,适合纯文本流式处理(比如读大文件逐块匹配)、嵌入 shell pipeline、或仅需提取且 HTML 结构高度可控的场景。但代价明显:

  • 无法处理嵌套标签、破损 HTML(如未闭合的 <a></a>)、动态插入内容(JS 渲染后)
  • 一旦页面出现 <a href="..."></a><a href="..."></a> 连写(无闭合),正则容易跨标签捕获
  • 如果 HTML 来自不可信来源,正则易被构造恶意标签绕过(如 <a onerror="alert(1)" href="x"></a>),而 BeautifulSoup 的解析树天然隔离属性上下文

re.compile() 编译正则后,为何还要小心 re.DOTALL 和 re.IGNORECASE?

不加 re.DOTALL 时,. 不匹配换行符,而实际 HTML 中 href 属性常跨行;不加 re.IGNORECASE 会漏掉 HREF 或 Href 这类大小写混用写法——但这两个 flag 本身有副作用:

  • re.DOTALL 让 .*? 可能贪婪匹配到远超预期的内容(比如从第一个 <a> 一直吃到末尾的 <code>>),必须用 [^>]* 替代 .*? 限定范围
  • re.IGNORECASE 对 href 有效,但若正则里写了 " 或 ',大小写 flag 不影响引号,无需额外处理
  • 真正该预编译的是完整 pattern,例如:pattern = re.compile(r'<a>]*href\s*=\s*["\']([^"\']+)["\'][^>]*>', re.IGNORECASE | re.DOTALL)</a>

HTML 里 URL 提取的坑不在正则语法本身,而在边界模糊性——标签怎么算“开始”,属性值怎么算“结束”,编码怎么算“合法”。越想快,越得先花两秒想清楚这些边界在哪里。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1651

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4084

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1649

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

23597

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2887

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2927

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1143

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2263

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程