最稳妥方式是使用golang.org/x/net/html解析html树并递归查找a标签的href属性,结合url.parse和resolvereference标准化相对路径,同时过滤空值、fragment及非法协议,并预先处理base标签影响。

用 golang.org/x/net/html 解析超链接最稳妥
Go 标准库不带 HTML 解析器,硬写正则提取 <a href="..."></a> 会漏掉换行、属性顺序变化、自闭合写法(如 <a href="/x"></a>)甚至注释里的伪链接。必须用专门的 HTML 解析器,golang.org/x/net/html 是官方维护、符合 HTML5 规范的首选。
它把 HTML 当成树遍历,不会被格式干扰,也支持 malformed HTML(比如没闭合的标签)。
- 安装:
go get golang.org/x/net/html - 核心是
html.Parse()返回 *html.Node,再递归查找html.ElementNode类型且标签名为"a"的节点 - href 属性要通过
node.Attr列表遍历获取,不能假设它一定在第一个位置
提取 href 属性时必须处理相对路径
网页里大量链接是相对路径(如 "./about"、"../img/logo.png"、"/contact"),直接返回会导致后续无法请求。需要结合原始 URL 做标准化。
用 net/url 的 url.Parse() 和 base.ResolveReference() 是唯一可靠方式:
如果你了解HTML,CSS和JavaScript,您已经拥有所需的工具开发Android应用程序。本动手本书展示了如何使用这些开源web标准设计和建造,可适应任何Android设备的应用程序 - 无需使用Java。您将学习如何创建一个在您选择的平台的Android友好的网络应用程序,然后转换与自由PhoneGap框架到一个原生的Android应用程序。了解为什么设备无关的移动应用是未来的潮流,并开始构建应用程序,提供更
base, _ := url.Parse("https://example.com/blog/post.html")
rel, _ := url.Parse("./image.jpg")
abs := base.ResolveReference(rel) // 得到 https://example.com/blog/image.jpg
- 如果输入 HTML 没提供 base URL(比如本地文件),就跳过解析,或设一个默认 scheme+host
-
url.Parse()对非法 href(如javascript:alert(1)、mailto:test@example.com)不会报错,但你要根据业务决定是否过滤——通常只保留http和https协议 - 注意
node.Attr是 []html.Attribute,需循环比对Key == "href",不是node.Attr[0].Val
避免内存泄漏:记得关闭 io.Reader 并复用 html.Tokenizer
常见错误是把 strings.NewReader(htmlStr) 或 bytes.NewReader(data) 直接传给 html.Parse(),看似简单,但若 HTML 很大或并发调用多,GC 压力会上升;更隐蔽的问题是,如果解析中途 panic(比如嵌套过深),html.Parse() 内部的 tokenizer 没机会清理缓冲区。
- 手动用
html.NewTokenizer()+for tok := t.Next(); tok != html.ErrorToken; tok = t.Next()控制流程,便于 defer 清理 - 对大 HTML,考虑加 depth 限制(比如只遍历前 10000 个节点),防止恶意构造的超长嵌套耗尽栈
- 不要在循环里反复
html.Parse()—— 它每次都会 new 一堆结构体;单次解析够用
处理常见异常:空 href、重复链接、fragment 链接
真实网页里 <a href=""></a>、<a href="#"></a>、<a href="#section1"></a> 非常多,它们不是有效外链,但会被 parser 正常提取出来。不加过滤会导致结果列表膨胀且无用。
- 过滤空值:
strings.TrimSpace(href) == "" - 过滤 fragment:
strings.HasPrefix(href, "#")(注意也包括"#top"这类) - 去重建议用
map[string]struct{},但要注意:同一链接不同 query 参数(如/page?id=1vs/page?id=2)应视为不同链接,除非你明确要做 query 归一化 - 遇到
href="https://example.com/?utm_source=xxx"这类带追踪参数的,是否清洗取决于用途——爬虫通常保留,摘要生成可能想 strip query
真正麻烦的是 <base href="https://cdn.example.com/"> 标签,它会改变后续所有相对链接的解析基准。必须在遍历过程中先找到并记录它,再用于后续 a 标签的 resolve。这点容易被忽略,导致几百个链接全解析错。
golang免费学习笔记(深入):立即使用
在学习笔记中,你将探索golang的核心概念和高级技巧!










