直接用time.sleep(1)重试会引发雪崩,因固定间隔导致请求同步;指数退避通过时间散开请求,tenacity库提供可靠实现,手写需满足退避公式、随机抖动和异常分类三原则。

为什么直接用 time.sleep(1) 做重试会出问题
固定间隔重试在真实服务调用中极易引发雪崩:下游故障未恢复时,所有客户端在同一时刻发起重试,流量叠加放大。指数退避的核心价值不是“多等几秒”,而是让重试请求在时间轴上自然散开。Python 标准库不提供开箱即用的退避实现,time.sleep 本身也不带随机抖动——这点常被忽略,导致理论上的退避在实际中仍可能同步。
tenacity 库是最省心的选择
它封装了完整的退避策略、停止条件和异常过滤,比手写更可靠。安装后直接使用:
pip install tenacity
典型用法:
from tenacity import retry, stop_after_attempt, wait_exponential, retry_if_exception_type
<p>@retry(
stop=stop_after_attempt(5),
wait=wait_exponential(multiplier=1, min=1, max=10),
retry=retry_if_exception_type((ConnectionError, TimeoutError))
)
def fetch_data():</p><h1>可能失败的网络请求</h1><pre class="brush:python;toolbar:false;">return requests.get("https://www.php.cn/link/710ba53b0d353329706ee1bedf4b9b39/data").json()
关键参数说明:
-
multiplier=1:基础退避系数,首次等待约2^0 * 1 = 1秒 -
min=1:最小等待时间(单位秒),避免首次重试过快 -
max=10:最大等待时间(单位秒),防止单次等待过长 -
retry_if_exception_type:只对指定异常重试,避免重试ValueError这类逻辑错误
手写简易版要守住三个底线
如果项目不允许引入第三方依赖,必须自己实现时,以下三点缺一不可:
- 退避公式必须是
min(max_delay, base * (2 ** attempt)),不能写成线性累加 - 必须加入 jitter(随机抖动),例如
random.uniform(0, 1),否则多个实例仍可能同步重试 - 必须明确区分“可重试异常”和“不可重试异常”,用
isinstance(e, (TimeoutError, ConnectionError))判断,而不是捕获Exception
示例片段(不含装饰器封装):
import time import random <p>def call_with_backoff(func, *args, *<em>kwargs): for attempt in range(5): try: return func(</em>args, <strong>kwargs) except (ConnectionError, TimeoutError) as e: if attempt == 4: raise delay = min(10, (2 </strong> attempt) + random.uniform(0, 1)) time.sleep(delay)</p>
异步场景下别忘了用 asyncio.sleep
在 async def 函数里用 time.sleep 会阻塞整个事件循环。正确做法是替换为 await asyncio.sleep(delay)。如果使用 tenacity,需改用 tenacity.AsyncRetrying:
from tenacity import AsyncRetrying, stop_after_attempt, wait_exponential
<p>async for attempt in AsyncRetrying(
stop=stop_after_attempt(3),
wait=wait_exponential(multiplier=0.1)
):
with attempt:
async with aiohttp.ClientSession() as session:
async with session.get("<a href="https://www.php.cn/link/710ba53b0d353329706ee1bedf4b9b39">https://www.php.cn/link/710ba53b0d353329706ee1bedf4b9b39</a>") as resp:
return await resp.json()</p>
注意:multiplier=0.1 在异步场景下更常用,因为协程调度开销小,不需要像同步那样保守设置初始延迟。
真正难的不是算出 2**n,而是判断哪些错误值得重试、什么时候该放弃、以及如何不让重试本身变成 DoS 攻击。抖动值选 0.1 秒还是 1 秒,取决于下游服务的恢复速度特征——这没法靠通用库自动猜出来。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











