应锚定 href 和 src 属性值而非协议头,用 href\s=\s["'](1+)["']|src\s=\s["'](1+)["'] 匹配真实 html 属性值,配合 notepad++ 的正则选项(匹配正则表达式、.匹配换行符、utf-8 编码)确保准确提取。"' ↩

为什么用 https?://\S+ 会抽出来一堆垃圾
这个正则只找“以 http 开头的连续非空白字符”,但它不管这些字符串是不是真的在 HTML 中被使用。实际网页里大量存在注释里的假链接、JS 字符串拼接、Vue 的 :href 绑定、甚至 CSS 里的 url(),都会被误抓。更糟的是,它会把 href="mailto:test@example.com" 或 href="tel:+8613800138000" 也当 URL 提出来。
真正该匹配的是 HTML 属性值本身,不是协议头。所以必须锚定在 href= 和 src= 后面的引号内容上:
-
href\s*=\s*["']([^"']+)["']→ 只取真实属性值,天然过滤掉注释和 JS 字符串 - 如果还想要
src(比如图片、脚本路径),就合并成:href\s*=\s*["']([^"']+)["']|src\s*=\s*["']([^"']+)["'] - 注意分组顺序:
$1是href的值,$2是src的值
Notepad++ 里怎么写对这个正则并确保能跑通
关键不是正则本身写得有多“标准”,而是 Notepad++ 的 PCRE 引擎行为和界面选项要配齐:
- 必须勾选「匹配正则表达式」(Ctrl+F → 查找对话框右下角)
- 必须启用「. 匹配换行符」——否则遇到跨行的
href=(比如换行后才写引号内容)就断掉 - 文档编码必须为 UTF-8(菜单栏「编码」→「转为 UTF-8 编码」),否则中文路径或特殊符号(如
&)可能匹配失败 - 别用
\b单词边界:Notepad++ 旧版本不支持,v8.5.6+ 才可用;稳妥起见用(? 或直接靠引号锚定
用替换功能导出纯 URL 列表的三步操作
「查找全部」只能高亮,不能导出。要拿到干净列表,必须走替换流程:
- 打开替换对话框(Ctrl+H),查找框填:
href\s*=\s*["']([^"']+)["']|src\s*=\s*["']([^"']+)["'] - 替换框填:
$1$2\r\n(Windows 换行)或$1$2\n(Linux 风格) - 点「全部替换」→ 所有匹配 URL 会单独成行,其他 HTML 内容被清空
- 后续清理:Ctrl+H 查找
^\s*$(空行),替换为空;再「编辑」→「行操作」→「删除重复行」
如果部分 URL 是相对路径(如 /static/js/app.js),提取后需人工补全协议和域名 —— 这一步没法靠正则自动判断,得看上下文。
Vue/React 模板或内联 JS 里的链接怎么处理
上面那个正则对 :href="url"、{% url 'xxx' %}、location.href = "xxx" 完全无效。这类情况得另写规则,而且往往需要分层处理:
- 先手动或用替换预处理:把
:href=替换为href=,把{% url块临时注释掉,避免干扰主正则 - 对 JS 字符串中的链接,可尝试:
["']((?:https?|ftp)://[^"']*)["'],但要小心误抓 JSON 字段或注释 - 如果文本量大、格式杂(比如含 base64 编码链接、HTML 实体),别硬刚正则 —— 导出后用 Python 脚本处理更省事
跨行、嵌套、带转义的 URL 是最易漏点,尤其当 href 值被硬回车断开时,哪怕开了「. 匹配换行符」,[^"'] 也不包含 \r\n,匹配直接中断。这种场景下,先统一替换换行符为空格再跑正则,比调参数更可靠。











