redis哨兵模式不是“装完就能用”,它依赖主从复制已就绪、哨兵配置完全一致、且所有节点能双向通信(特别是pub/sub端口必须通);三节点是最小安全规模,少于三个哨兵时quorum设置极易导致脑裂或无法故障转移。

直接上结论:Redis哨兵模式不是“装完就能用”,它依赖主从复制已就绪、哨兵配置完全一致、且所有节点能双向通信(特别是 PUB/SUB 端口必须通)。三节点是最小安全规模,少于三个哨兵时 quorum 设置极易导致脑裂或无法故障转移。
主从复制必须先跑通,否则哨兵启动即报错
哨兵不负责数据同步,只负责发现和切换。如果 redis-cli info replication 在从节点上显示 role:slave 但 master_link_status:down,哨兵会拒绝监控该主节点,日志里反复出现 Unable to connect to MASTER。
- 主节点
redis.conf中确保protected-mode no、bind 0.0.0.0(或明确绑定内网 IP),且未设requirepass或已统一配置密码 - 从节点必须显式配置
replicaof <master-ip> 6379</master-ip>(Redis 5+ 用replicaof,旧版用slaveof),不能靠运行时命令临时设置——哨兵只读配置文件初始状态 - 验证方式:在任一从节点执行
redis-cli -h <slave-ip> info replication | grep -E "(role|master_link_status|connected_slaves)"</slave-ip>,应看到role:slave、master_link_status:up、connected_slaves:2(若双从)
哨兵配置文件必须全节点严格一致
哪怕只差一个空格,三个哨兵之间也会因配置哈希不一致而拒绝组成集群,redis-sentinel 启动后日志里找不到 +sentinel 或 +sdown 字样,基本就是配置没对齐。
-
sentinel monitor mymaster <master-ip> 6379 2</master-ip>中的mymaster必须完全相同,大小写敏感;<master-ip></master-ip>不能写127.0.0.1(除非所有哨兵和主节点真在同一台机器) -
sentinel auth-pass mymaster <password></password>必须存在且密码与主节点requirepass一致;若主节点无密码,这行必须删除,留着会导致认证失败 -
bind 0.0.0.0和protected-mode no必须开启,否则其他哨兵连不上这个哨兵的26379端口 - 日志路径
logfile和工作目录dir需提前chown redis:redis,否则哨兵进程因权限不足静默退出
客户端不能直连 Redis 实例,必须走哨兵发现流程
很多用户配完哨兵,用 redis-cli -h 192.168.1.10 -p 6379 能连上就以为成功了——这是错觉。一旦主节点宕机,这个连接立刻失效,且不会自动切到新主。真正的高可用体现在客户端是否调用 SENTINEL GET-MASTER-ADDR-BY-NAME 动态获取地址。
- 测试命令:在任意哨兵节点执行
redis-cli -p 26379 sentinel get-master-addr-by-name mymaster,应返回当前主节点的[ip, port]数组;手动 kill 主 Redis 进程后,等 10–15 秒再执行,IP 应已变更 - Java 客户端如 Jedis 需用
JedisSentinelPool,Python 的 redis-py 用Sentinel类,传入哨兵地址列表而非 Redis 地址列表 - 注意:哨兵本身不代理请求,只是提供元数据。客户端拿到主地址后,仍需直连该 Redis 实例——所以新主节点的防火墙、密码、
bind配置也必须正确
故障转移时间不可控,超时参数要按网络实际调
默认 sentinel down-after-milliseconds mymaster 5000 意味着连续 5 秒 PING 不通才判为主观下线,但真实切换耗时 = 主观下线 + 多哨兵协商 + 从节点升级 + 其他从节点重同步。局域网环境可压到 8–12 秒,跨机房可能突破 30 秒。
-
sentinel failover-timeout mymaster 60000是整个故障转移流程上限,设太小(如 10000)会导致切换中途被中止,主从状态卡在中间态 -
sentinel parallel-syncs mymaster 1控制同时向新主同步的从节点数,设为 1 可避免带宽打满,但恢复慢;生产环境建议保持 1,除非你确认网络带宽充足且从节点数 ≤ 2 - 最易忽略的一点:所有 Redis 节点(含主、从、哨兵)的系统时间必须同步(
chronyd或ntpd),时间差 > 5 秒会导致哨兵判定心跳过期,频繁触发误切换











