redis集群在线扩容需手动完成槽位迁移和主从关联:新主节点加入后须reshard分配槽位,新从节点须本地执行cluster replicate绑定主节点id;启动前必须清除nodes.conf、dump.rdb、appendonly.aof,且requirepass、masterauth、cluster-config-file等配置须与原集群严格一致。

能在线添加,但“无缝”取决于你是否动了槽位和主从切换逻辑——新主节点加进来默认不承载数据,新从节点加进来默认不同步,这两步都必须手动触发,跳过就等于没加成功。
新节点启动前必须清理旧集群残留
克隆或复用旧配置启动新节点时,nodes.conf、dump.rdb、appendonly.aof 这三个文件是最大雷区。只要残留,新节点就会沿用旧 node id,导致集群识别冲突、CLUSTER NODES 显示 fail 或重复 ID,后续所有操作都会失败。
- 启动前务必执行:
rm -f /path/to/redis/data/{nodes.conf,dump.rdb,appendonly.aof} -
cluster-config-file配置项必须带端口后缀(如nodes-7006.conf),否则多个节点会争写同一文件,引发配置错乱 - 密码相关配置
requirepass和masterauth必须与原集群完全一致,否则握手阶段就会被拒绝
add-node 后节点仍是“孤儿”,必须显式分配角色
redis-cli --cluster add-node 只完成拓扑注册,新节点在 CLUSTER NODES 中显示 noflags 或 noaddr,不参与任何读写,也不自动同步——它不是“待命从节点”,而是“未初始化节点”。
Redis 缓存和数据结构管理技能。通过自然语言操作 Redis,支持 String、Hash、List、Set、ZSet、Stream 等数据结构操作。当用户提到 Redis、缓存、消息队列、会话存储时使用此技能。
- 若要设为从节点:必须用
redis-cli -h <new-slave-ip> -p <new-slave-port></new-slave-port></new-slave-ip>连上该节点本身,再执行CLUSTER REPLICATE <master-node-id></master-node-id> - 若要设为主节点:必须用
redis-cli --cluster reshard从现有主节点迁移槽位,不能只靠add-node -
CLUSTER REPLICATE返回OK仅代表复制流程已启动,不是已完成;需用redis-cli -p <new-slave-port> INFO replication</new-slave-port>确认master_link_status:up且slave_repl_offset持续增长
CLUSTER REPLICATE 必须在目标从节点本地执行
这是最常踩的坑:连着主节点敲 CLUSTER REPLICATE xxx,报错 (error) ERR Unknown node xxx。因为该命令只在当前连接节点本地生效,且只认本集群内已知的 master node id。
- 正确路径:先
redis-cli -h 192.168.1.100 -p 7006(新从节点地址),再CLUSTER REPLICATE d7352da65040b9736a7696f8074036323bd90583 - master node id 必须从
CLUSTER NODES输出中直接复制,不能手输或截断,长度固定 40 位十六进制字符 - 执行前确认该新节点的槽位为空(
slots:后无范围),否则 Redis 拒绝设为从节点
reshard 迁移槽位时避免阻塞客户端
执行 redis-cli --cluster reshard 期间,被迁移槽位上的 key 会短暂不可写(通常毫秒级),但若迁移量大或网络慢,可能累积延迟。生产环境务必避开流量高峰。
- 优先选
--cluster-yes自动确认,避免交互卡住;但首次操作建议先不加,看清迁移计划再按yes - 迁移目标节点必须是空主节点(即刚
add-node进来、尚未reshard的节点),否则会报错Target node is not empty - 不要一次性迁移全部槽位,建议单次 ≤ 1000 个槽;可分批执行,用
CLUSTER NODES实时观察各节点slots分布变化
真正容易被忽略的是:新从节点即使完成了 CLUSTER REPLICATE,也**不会自动接管故障主节点**——它只是个普通副本,failover 触发仍依赖原有从节点的投票权重和配置。如果你期望它参与高可用,得确保它的 cluster-node-timeout 和其他节点一致,且没有被 cluster-slave-no-failover yes 锁死。这些细节不检查,扩容就只是“多摆了一台机器”。










