级联主从复制需中间节点同时具备主库和从库双重身份:必须开启log_bin、设置log_slave_updates=on、配置独立复制账号,并确保防火墙双向放行;下游连接指向中间节点ip,且需逐级验证seconds_behind_master。

级联主从复制(Master → Intermediate Slave → Slave)不是简单加一台机器就能跑通的,核心在于中间节点既要作为从库同步上游,又要开启 binlog 并允许下游连接——稍有配置遗漏,下游就直接连不上或同步中断。
中间节点必须同时启用 slave 和 master 角色
中间节点本质是「从库+主库」双身份,缺一不可。只配 server-id 和 relay-log 不够,它还得能被下游当作主库来连。
-
log_bin必须开启:否则下游无法拉取 binlog,CHANGE REPLICATION SOURCE TO会报错ERROR 2003 (HY000): Can't connect to MySQL server或更隐蔽的Slave_IO_Running: Connecting卡住 -
log_slave_updates=ON必须显式设置:默认为 OFF,意味着中继日志里的事件不会写入自己的 binlog,下游收不到任何变更 -
read_only=OFF(或至少对复制用户放行):如果设为 ON 且没给复制用户SUPER权限,SQL 线程重放时会因权限拒绝而停止,Seconds_Behind_Master持续增长 -
binlog_format=ROW强烈建议统一:STATEMENT 模式在级联中容易因函数、临时表等导致不一致,MySQL 8.0 默认已是 ROW
中间节点的复制用户要分两套权限
上游主库给中间节点的账号,只需 REPLICATION SLAVE;但中间节点自己必须创建一个供下游连接的账号,权限和主库对它的要求一致。
- 上游(真正主库)→ 中间节点:用类似
CREATE USER 'repl_up'@'192.168.1.20' IDENTIFIED BY 'pwd'; GRANT REPLICATION SLAVE ON *.* TO 'repl_up'@'192.168.1.20'; - 中间节点 → 下游(末级从库):必须新建账号,例如
CREATE USER 'repl_down'@'192.168.1.30' IDENTIFIED BY 'pwd'; GRANT REPLICATION SLAVE ON *.* TO 'repl_down'@'192.168.1.30';——不能复用上游账号,IP 和权限范围都不同 - 防火墙/SELinux 要双向放行:中间节点既需连上游 3306,也要监听并接受下游 3306 连接,
iptables或firewalld规则容易只开单向
下游从库配置时,SOURCE_HOST 指向中间节点 IP
下游执行 CHANGE REPLICATION SOURCE TO 时,SOURCE_HOST 填的是中间节点的 IP,不是原始主库的 IP;SOURCE_LOG_FILE 和 SOURCE_LOG_POS 也得从中间节点上查,不是原始主库的 SHOW MASTER STATUS。
- 在中间节点执行:
SHOW MASTER STATUS;,拿到当前File(如mysql-bin.000005)和Position(如154) - 下游执行:
CHANGE REPLICATION SOURCE TO SOURCE_HOST='192.168.1.20', SOURCE_USER='repl_down', SOURCE_PASSWORD='pwd', SOURCE_LOG_FILE='mysql-bin.000005', SOURCE_LOG_POS=154; - 别跳过
START REPLICA;:级联场景下,下游常因忘记启动而始终显示Replica_IO_Running: No
验证链路不能只看最后一环
级联复制最容易误判“通了”,其实某一级已断。必须逐级检查,且关注 Seconds_Behind_Master 是否持续为 0,而非仅看 Replica_IO_Running 和 Replica_SQL_Running 都是 Yes。
- 原始主库执行
INSERT INTO test.t1 VALUES (NOW()); - 立刻在中间节点查:
SELECT * FROM test.t1;—— 应立刻出现 - 再立刻在下游查:
SELECT * FROM test.t1;—— 若延迟明显(>1s),说明中间节点的log_slave_updates未生效,或下游连错了 binlog 文件位置 - 任意一级执行
SHOW REPLICA STATUS\G,重点看Seconds_Behind_Master、Retrieved_Gtid_Set(若启 GTID)、Executed_Gtid_Set是否在增长
最常被忽略的一点:中间节点的 expire_logs_days 如果设得太小(比如 1 天),而下游因网络抖动断连超过 24 小时,再连时就会报 Could not find first log file name in binary log index file —— 它需要的 binlog 已被自动清理。生产环境建议设为 7 天以上,并配合定期 PURGE BINARY LOGS 手动控制。











