用set去重虽直接但隐患大,因它仅做字符串匹配,无法识别协议、大小写、参数顺序等语义重复;必须先标准化url(统一scheme小写、去末尾斜杠、排序并重建query、忽略fragment),再用set或布隆过滤器去重。

用 set 去重是最直接但有隐患的做法
刚爬完一批 URL,直接丢进 set 看似简单: unique_urls = list(set(raw_urls))。但它会破坏原始顺序,且无法处理协议、参数、路径大小写等“逻辑重复”。比如 "https://example.com" 和 "http://example.com/" 在 set 里是两个元素,实际指向同一资源。
真正要过滤的是语义重复,不是字符串重复。建议先做标准化再判重:
- 统一 scheme(全转
https或保留原 scheme 但强制小写) - 移除末尾斜杠:
url.rstrip("/") - 解析并排序查询参数:
urllib.parse.urlparse+urllib.parse.parse_qs→sorted()后重建 query 字符串 - 忽略 fragment(
#xxx部分),它不影响服务器请求
用 urllib.parse.urlunparse 标准化 URL 再去重
手动拼接容易出错,推荐用 urllib.parse 拆解再组装。关键点是:不要用 urlparse().geturl(),它不处理参数顺序;必须自己重建 query。
from urllib.parse import urlparse, urlunparse, parse_qs, urlencode
<p>def normalize_url(url):
parsed = urlparse(url)</p><h1>忽略 fragment,清空 params、username、password、port(除非非默认)</h1><pre class="brush:php;toolbar:false;"><pre class="brush:php;toolbar:false;">clean_netloc = parsed.netloc.lower()
if parsed.port and parsed.scheme == "http" and parsed.port != 80:
clean_netloc = f"{parsed.hostname}:{parsed.port}"
elif parsed.port and parsed.scheme == "https" and parsed.port != 443:
clean_netloc = f"{parsed.hostname}:{parsed.port}"
# 标准化 query:解析 → 排序键 → 重建
query_dict = parse_qs(parsed.query, keep_blank_values=True)
sorted_query = "&".join(
f"{k}={v[0]}" for k, v in sorted(query_dict.items())
)
# path 去重尾部 /
clean_path = parsed.path.rstrip("/") or "/"
return urlunparse((
parsed.scheme.lower(),
clean_netloc,
clean_path,
"", # params 不常用,留空
sorted_query,
"" # fragment 忽略
))之后再用 set
dict.fromkeys() 保序去重:seen = set(); unique = [u for u in urls if normalize_url(u) not in seen and not seen.add(normalize_url(u))](注意:这里调用了两次 normalize_url,生产环境应缓存结果)。大规模抓取时别只靠内存 set,考虑布隆过滤器
当 URL 总量超百万级,内存吃紧或需跨进程/重启后仍去重,set 就不合适了。这时用布隆过滤器(Bloom Filter)更省空间,但有极小误判率(把新 URL 当成已存在)。
推荐 pybloom-live(支持序列化):
- 安装:
pip install pybloom-live - 初始化时预估总量和误判率:
bloom = BloomFilter(capacity=1000000, error_rate=0.001) - 插入前先查:
if normalized_url not in bloom: bloom.add(normalized_url); save_url(...)
注意:布隆过滤器不可删除元素,也不保证 100% 准确。若业务不能容忍漏抓,得配合持久化存储(如 SQLite 的 UNIQUE 约束)做最终校验。
反爬场景下,URL 重复可能掩盖真实问题
如果发现大量重复 URL,别急着过滤——先检查是不是爬虫被重定向或陷入跳转循环。例如访问 /login 总被 302 到 /login?next=/login,参数不断叠加,normalize_url 可能仍判为不同。
建议加一层检测:
- 记录重定向链长度,超过 5 跳就中断并告警
- 对高频重复的 host + path 组合(如
example.com/api/data),抽样打印原始响应状态码和Location头 - 启用
requests.Session()的resolve_redirects=False,自己控制跳转逻辑
URL 去重只是下游补救,上游的请求策略和重定向处理才是根因。标准化函数再好,也救不了设计混乱的爬取流程。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











