因为 composer 镜像源接口是 i/o 密集型,asyncio + aiohttp 单线程可高效并发数百请求,吞吐提升 3–8 倍;threading 受 gil 限制,并发低;multiprocessing 开销大;且需复用 clientsession、设 timeout、加随机 ua、限速防封、指数退避重试、串行写入 sqlite 并用 aiosqlite。

为什么用 asyncio + aiohttp 而不是 threading 或 multiprocessing
Composer 镜像源(比如 packagist.org 或国内腾讯、阿里镜像)的包信息接口本质是 I/O 密集型请求——大部分时间卡在 HTTP 等待响应上。用 threading 会受 GIL 限制,实际并发数上不去;multiprocessing 开销大、内存占用高,且频繁创建进程不划算。而 asyncio + aiohttp 能单线程内高效调度成百上千个请求,实测在 100–500 并发下吞吐翻 3–8 倍。
注意:别直接套用 requests + asyncio.to_thread,那只是把阻塞调用扔进线程池,没发挥异步优势,还多一层调度开销。
-
aiohttp.ClientSession必须复用,不能每个请求都新建一个 session,否则连接池失效、TLS 握手重复、DNS 查询暴涨 - 务必设置
timeout,否则某个慢响应会拖垮整个协程池;推荐用aiohttp.ClientTimeout(total=10) - 镜像源通常有反爬策略(如 User-Agent 检查、频率限流),需加随机
User-Agent和请求间隔(哪怕await asyncio.sleep(0.01))
aiohttp 请求失败后怎么稳定重试
Composer 包列表页(如 https://mirrors.tencent.com/packagist/dists/)或具体包的 composer.json(如 https://mirrors.tencent.com/packagist/p2/vendor/package.json)常因 CDN 缓存未就绪、临时 502、或镜像同步延迟返回 404/503。直接抛异常会导致整个采集中断。
正确做法是封装带指数退避的重试逻辑,而不是简单 try/except + time.sleep:
- 用
tenacity库最省心:@retry(stop=stop_after_attempt(3), wait=wait_exponential(multiplier=1, min=1, max=10)) - 手动实现时,每次重试前
await asyncio.sleep(min(10, 2 ** attempt)),避免雪崩式重试 - 只对网络层错误(
aiohttp.ClientError、asyncio.TimeoutError)重试,对 404(包确实不存在)或 403(权限拒绝)应直接跳过
如何避免被镜像源封 IP 或返回空数据
腾讯云、华为云等 Composer 镜像明确要求遵守 robots.txt,且对单 IP 的 QPS 有限制(通常 5–10 req/s)。暴力并发扫包名很容易触发风控,返回 429 或空 JSON。
- 严格控制并发数:
asyncio.Semaphore(8)是较安全的起点,可按镜像文档调整(如阿里云建议 ≤10) - 每请求后加
await asyncio.sleep(0.1)比全局限速更稳,避免突发流量 - 检查响应体是否含有效 JSON:若
resp.content_type != "application/json"或解析后not data.get("packages"),大概率是被拦截,应记录并降级处理 - 优先走镜像提供的元数据索引(如
dists/packages.json),别暴力拼包名穷举 —— 这类文件通常已聚合全部包清单,体积可控
采集结果怎么结构化存入 SQLite 而不锁死
高频写入 SQLite 时,如果每个协程都单独 conn.execute(...),会触发数据库忙等待(sqlite3.OperationalError: database is locked),尤其在高并发下。
- 所有写操作必须串行化:启一个专用写入协程,通过
asyncio.Queue接收数据,再批量executemany - 建表时加
PRAGMA journal_mode = WAL;,提升并发读写能力 - 避免在协程中直接用
sqlite3.connect()—— 连接非线程安全,更非协程安全;改用aiosqlite库,它内部做了连接池和语句队列 - 字段设计要精简:Composer 包只需存
name、version、dist_url、published_at,别全量存原始 JSON,后续查用时再按需解析
真正麻烦的是镜像源之间 metadata 格式不一致(比如腾讯返回 packages 字段,华为用 providers),得写适配器做 normalize,这部分没法偷懒。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











