缓存穿透是指大量查询根本不存在的数据,导致请求直达数据库造成压力激增;布隆过滤器因查询快、内存小、不漏判的特性,适合前置拦截99.9%非法请求。

什么是缓存穿透
缓存穿透是指大量请求查询**根本不存在的数据**(比如非法ID、被恶意刷的不存在商品ID),导致这些请求全部打到数据库,绕过缓存,造成数据库压力激增甚至宕机。
为什么布隆过滤器适合做前置拦截
布隆过滤器是一种空间效率极高的概率型数据结构,它能快速判断“某个元素**是否可能存在于集合中**”。特点是:
- 查询快(O(1)时间复杂度),内存占用小(可控制在KB级)
- 支持海量数据(亿级key也能轻松装下)
- 允许**小概率误判(存在→不存在)**,但**绝不漏判(不存在→存在)** —— 这正是防护穿透的关键:把99.9%的非法请求在最外层挡掉
Python中用redis-py + pybloomfiltermmap3实现
推荐组合:Redis 存缓存 + 布隆过滤器(本地或Redis模块)做前置校验。下面以轻量、易部署的 pybloomfiltermmap3(本地布隆过滤器)为例:
注意:生产环境建议用 RedisBloom 模块(Redis官方扩展),支持集群和持久化;本地布隆过滤器适合单机或热key预加载场景。
安装与初始化:
pip install pybloomfiltermmap3
构建并持久化布隆过滤器(一次性生成,如启动时加载全量合法ID):
from pybloomfilter import BloomFilter <h1>创建布隆过滤器:预计1000万个元素,误判率0.01%</h1><p>bf = BloomFilter(10000000, 0.01, 'filter.bf')</p><h1>添加所有合法ID(例如从DB或缓存中批量读取)</h1><p>for item_id in get_all_valid_item_ids(): # 自定义函数 bf.add(str(item_id))</p><h1>保存到磁盘,后续可直接加载</h1><p>bf.sync() </p>
请求处理流程(伪代码):
def get_item(item_id):
item_id_str = str(item_id)
<pre class="brush:php;toolbar:false;"># 第一步:查布隆过滤器
if item_id_str not in bf:
return {"code": 404, "msg": "Item not exists"} # 直接拒绝,不查缓存也不查DB
# 第二步:查Redis缓存
cached = redis.get(f"item:{item_id}")
if cached:
return json.loads(cached)
# 第三步:查DB(此时item_id大概率真实存在)
db_item = db.query(Item).filter(Item.id == item_id).first()
if db_item:
redis.setex(f"item:{item_id}", 3600, json.dumps(db_item.to_dict()))
return db_item.to_dict()
else:
# 极小概率:布隆说“可能存在”,但DB里真没有 → 缓存空值防二次穿透
redis.setex(f"item:{item_id}", 60, "NULL") # 空值缓存60秒
return {"code": 404, "msg": "Not found"}
关键细节与注意事项
- 布隆过滤器必须定期更新:新增合法ID(如新上架商品)需同步 add();删除ID无法直接删(布隆不支持删除),可用计数型布隆过滤器或结合时间戳+失效机制解决
- 空值缓存是兜底手段:对布隆放行但DB查无的结果,一定要缓存短时效空值(如60秒),避免同一非法ID反复穿透
- 误判率要合理权衡:0.1% 误判率对应约10倍空间开销;0.01% 更常用;低于0.001% 空间增长明显,一般不必要
- 不要只依赖布隆过滤器:配合接口限流(如令牌桶)、参数校验(ID格式、范围)、日志监控异常请求,形成多层防护
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











