requests不能直接抓异步api,因其同步阻塞特性会卡住协程,阻碍事件循环调度;而aiohttp原生支持异步i/o,请求发出后立即让出控制权,响应到达再唤醒协程,实现真正高效并发。

为什么 requests 不能直接抓异步 API?
因为 requests 是同步阻塞的,发起一次 HTTP 请求时整个协程会被卡住,asyncio 的事件循环无法调度其他任务。哪怕你把它包在 loop.run_in_executor 里,也只是“伪异步”,并发量上不去,还多一层线程调度开销。
真正高效的方式是用原生支持异步 I/O 的客户端,比如 aiohttp —— 它和 asyncio 深度集成,请求发出去后立刻让出控制权,等响应回来再唤醒协程。
常见错误现象:
– 写了 async def 函数但里面全是 requests.get(),结果并发 100 个请求耗时和串行差不多;
– 忘记 await session.get(),导致返回的是 ClientResponse 对象的协程对象,不是实际响应;
– 在非 async 上下文中(比如普通函数里)直接调用 async 函数,报 RuntimeWarning: coroutine 'xxx' was never awaited。
如何用 aiohttp 发起单个异步 API 请求?
核心是三步:创建 aiohttp.ClientSession、await session.get() 或 post()、用 await resp.json() 或 .text() 读取响应体。注意 session 应复用,不要每次请求都新建。
import aiohttp
import asyncio
<p>async def fetch_one():
async with aiohttp.ClientSession() as session:
async with session.get("<a href="https://www.php.cn/link/46b315dd44d174daf5617e22b3ac94ca">https://www.php.cn/link/46b315dd44d174daf5617e22b3ac94ca</a>") as resp:
data = await resp.json()
return data</p><h1>正确调用方式</h1><p>result = asyncio.run(fetch_one())
</p>
关键细节:
– ClientSession 必须用 async with,否则连接池不释放,可能触发 Unclosed connector 警告;
– resp.json() 和 resp.text() 都是协程,必须 await;
– 如果 API 返回非 JSON(比如纯 HTML 或二进制),别硬调 .json(),会抛 aiohttp.ContentTypeError;
– 默认超时是 5 分钟,生产环境建议显式设 timeout=aiohttp.ClientTimeout(total=10)。
怎么并发抓 50 个异步 API 并控制速率?
直接 await asyncio.gather(*[fetch(url) for url in urls]) 很危险:瞬间发 50 个请求,容易被封 IP 或触发服务端限流。得加信号量(asyncio.Semaphore)或用 asyncio.BoundedSemaphore 控制并发数。
import asyncio import aiohttp <p>sem = asyncio.Semaphore(10) # 最多同时 10 个请求</p><p>async def fetch_with_limit(session, url): async with sem: # 进入临界区 async with session.get(url) as resp: return await resp.json()</p><p>async def fetch_all(urls): async with aiohttp.ClientSession() as session: tasks = [fetch_with_limit(session, url) for url in urls] return await asyncio.gather(*tasks) </p>
注意事项:
– 信号量要在所有协程外定义(如模块级),否则每个协程新建一个就失效了;
– 不要用 time.sleep() 做节流,它会阻塞整个事件循环;要用 await asyncio.sleep(0.1);
– 如果某些 URL 失败率高,建议加 try/except 捕获 aiohttp.ClientError,避免一个失败拖垮整批;
– asyncio.gather 默认遇到异常就中断,加 return_exceptions=True 可让它继续执行其余任务。
处理登录态、Header 和 Cookie 怎么办?
aiohttp.ClientSession 支持初始化时传 headers、cookies,也支持后续请求自动携带 Set-Cookie。但要注意:它默认不处理重定向中的 Cookie 同步(除非开启 cookie_jar=aiohttp.CookieJar(unsafe=True))。
典型场景:
– 登录后抓取需鉴权的 API:先 POST /login,成功后 session 自动保存 cookie,后续请求无需手动带 Authorization;
– 某些接口要求 User-Agent 或 Referer:在 ClientSession 初始化时统一设 headers={"User-Agent": "Mozilla/5.0..."};
– 需要手动注入 token:用 session.get(url, headers={"Authorization": f"Bearer {token}"});
– 若 API 返回 429 Too Many Requests,检查是否漏了 headers 导致被识别为爬虫,或者没做请求间隔。
容易被忽略的一点:aiohttp 默认不验证 SSL 证书(开发时方便),但线上务必关掉 connector = aiohttp.TCPConnector(ssl=False),否则可能因证书问题静默失败。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!











