捕获体系提供可观测性基础,真正起作用的是分层配置的响应机制:穿透返回400并限流、击穿允许首查db并等待50ms、雪崩触发三级降级开关。
捕获体系本身不直接“控制”缓存穿透、雪崩或降级策略,而是为精细化防御提供可观测性基础。真正起作用的是在捕获数据支撑下,分层配置的响应机制。关键在于:先精准识别问题类型(穿透/击穿/雪崩),再按场景触发对应毫秒级干预动作,二级缓存只是其中一环,不是万能解。
按请求特征实时区分穿透、击穿、雪崩
不能只看缓存未命中率——三者行为模式差异明显,需结合多维指标联合判定:
- 穿透:大量不同key(如用户ID为负数、超长随机字符串)高频访问,缓存命中率
- 击穿:单个key(如商品ID=10086)QPS突增10倍以上,缓存miss后DB查询耗时陡升,但5秒内恢复;日志中集中出现“Loading hot key…”类重试日志
- 雪崩:多个key(如前缀为promo_202605的500+缓存)在同一分钟内批量失效,Redis evicted_keys激增,DB连接池打满,监控图呈现阶梯式上升曲线
二级缓存不是兜底,而是分类拦截的执行层
本地缓存(如Caffeine)放在Redis之前,但它的角色要按问题类型差异化使用:
- 对穿透请求:在本地缓存中预置布隆过滤器(BloomFilter)或非法ID黑名单,拦截率>99.9%,响应在0.2ms内完成,不发往Redis
- 对击穿热点:本地缓存启用“逻辑过期”+后台刷新,Redis key设为永不过期,本地缓存value自带timestamp和loadingLock,避免重复加载
- 对雪崩风险:本地缓存不承担兜底,而是作为“熔断快照”——当检测到Redis集群延迟>200ms且错误率>5%,自动切换为只读本地副本(TTL延长至原值3倍),持续30秒
毫秒级降级必须绑定具体失败原因,不可泛化
降级不是简单返回默认值,而是按根因做最小必要妥协:
- 若判定为穿透:返回HTTP 400 + 静态提示页,同时将该请求特征(IP+参数MD5)写入限流黑名单,有效期10分钟
- 若判定为击穿:允许首请求穿透查DB,其余并发请求等待最多50ms,超时则返回上一版缓存数据(带stale-while-revalidate头)
- 若判定为雪崩:立即触发“三级降级开关”——①关闭非核心字段组装(如不查用户头像URL)②聚合接口拆分为单字段兜底(只返回商品名称和价格)③对写操作加队列缓冲(异步落库)
捕获体系要输出可行动信号,而非堆砌指标
传统监控只报“缓存命中率下降”,实际需要的是带上下文的动作指令:
- 在APM链路中,给每个缓存操作打标:
cache_type:redis|local、cache_result:hit|miss_empty|miss_db_hit、cache_cause:penetration|breakdown|avalanche - 当1分钟内
cache_cause=penetration且miss_empty>1000次,自动调用布隆过滤器扩容API,新增3个哈希函数 - 当检测到
cache_cause=avalanche,立刻向配置中心推送临时规则:redis.ttl_jitter=300s,并通知运维检查最近发布的定时任务










