最轻量健康检查命令是redis-cli -c -h {host} -p {port} cluster nodes,需检查connected状态、fail?标记及ping-sent/pong-recv时间差是否超5000ms。

Redis集群健康检查该用哪些命令
直接连任意节点执行 redis-cli -c -h {host} -p {port} cluster nodes 是最轻量的方式,它能一次性拿到所有节点角色、连接状态、槽位分配和从节点偏移量。别用 INFO replication 单独查每个节点——集群模式下主从关系是动态的,靠单点信息容易误判。
关键要看三类字段:connected(必须全为 connected)、fail?(不能出现)、ping-sent/pong-recv 时间差(超过 5000ms 就要告警)。如果返回里有 fail 或 noaddr,说明节点已失联或配置错误。
- 避免在脚本里硬编码节点列表,用
cluster nodes动态解析更可靠 - 加
--raw参数输出纯文本,方便awk处理,不带它会混入 ANSI 颜色字符 - 超时必须设,比如
redis-cli -c -h x.x.x.x -p 6379 --scan-timeout 2000 cluster nodes,否则网络抖动时脚本卡死
Shell脚本怎么判断集群是否“脑裂”
脑裂不是靠一个命令能直接标定的,得交叉验证:先查 cluster nodes 输出中是否有多个节点自称 master 且拥有重叠槽位;再比对各主节点的 cluster info 中 cluster_state 是否都为 ok,以及 cluster_slots_assigned 总和是否等于 16384。
常见误判点:某节点短暂断连后重连,但槽位未同步完成,此时 cluster_state: ok 但 cluster_slots_pfail > 0。这类情况要单独抓出来,不能只看 ok 就放行。
- 用
awk '/^[0-9a-f]+ [^ ]+ [^ ]+ [^ ]+ [^ ]+ master|slave/ {print $1,$3,$9}'提取节点 ID、IP:PORT、状态 - 用
grep -c 'master.*[0-9]\+-[0-9]\+'统计实际负责槽位的主节点数,少于预期数就触发预警 - 从
cluster info解析cluster_known_nodes和cluster_size,两者不等说明元数据不同步
钉钉机器人发告警要注意哪些字段
钉钉 Webhook 必须带签名(timestamp + sign),否则 403。签名算法是 base64(hmac-sha256(timestamp + "\n" + secret, secret)),Shell 里得用 openssl dgst -sha256 -hmac 配合 date +%s%3N 生成毫秒级时间戳。
Redis 缓存和数据结构管理技能。通过自然语言操作 Redis,支持 String、Hash、List、Set、ZSet、Stream 等数据结构操作。当用户提到 Redis、缓存、消息队列、会话存储时使用此技能。
消息体推荐用 markdown 类型,标题加 ## [CRITICAL] 能让手机端一眼识别严重等级。别发纯 text——钉钉对 text 消息限长 2000 字,而 cluster nodes 全量输出可能超长,容易截断。
- 告警内容里必须包含出问题的节点 IP:PORT 和故障类型(如
node disconnected/slot overlap) - 用
curl -X POST -H 'Content-Type: application/json' -d '{...}' https://oapi.dingtalk.com/robot/send?access_token=xxx发送,不要漏-H头 - 测试阶段把
access_token放环境变量里,别写死在脚本中,防止误提交到代码库
定时巡检脚本怎么避免重复告警
每分钟跑一次脚本,但同一问题连续告警毫无意义。最简方案是加本地状态文件:每次检查完把当前异常节点列表写入 /tmp/redis_alert_state,下次运行前用 diff 对比,只有新增异常才发钉钉。
注意状态文件权限,别让其他用户可读,里面可能含 Redis 连接地址。另外,脚本退出码要规范:0 表示一切正常,1 表示发现异常但已处理(如仅记录未告警),2 表示已发出告警——这样配合 crontab 的日志或监控系统能更好追踪。
- 用
date -d '10 minutes ago' +%s判断上一次告警是否过期,避免因机器重启导致状态丢失后疯狂补发 - 状态文件建议用
printf '%s\n' $nodes | sort > /tmp/redis_alert_state,排序后 diff 更稳定 - 脚本开头加
set -e,任何命令失败立即退出,防止后续逻辑在错误状态下继续执行
真正难的是区分瞬时抖动和真实故障——比如网络闪断导致 ping-sent 延迟飙升,但 3 秒后自动恢复。这类情况需要至少两次间隔检查确认,而不是单次命中就发告警。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










