主从切换前必须停写,否则事务可能部分丢失;需关闭应用写流量、使用readconcern:"snapshot"+writeconcern:"majority"、验证oplog同步、处理回滚、规避云服务限制。

主从切换前必须停写,否则事务可能部分丢失
副本集主从切换不是原子操作,rs.stepDown() 或优先级调整触发的选举过程存在时间窗口。如果应用在切换过程中持续提交事务,而新主尚未完全同步 oplog,就可能丢掉未复制到多数节点的写入。MongoDB 的 “majority” 写关注(w: "majority")能缓解但不能消除风险——它只保证写入被多数节点确认,不保证这些节点在切换瞬间都已落盘或参与了新主选举。
真实场景中常见错误现象:WriteConcernError 报错、事务回滚日志里出现 replSetReconfig 相关中断、应用层看到“duplicate key”或“document not found”等不一致状态。
- 切换前务必关闭应用写流量(比如切走数据库连接池、加运维开关),这是最简单也最有效的保护手段
- 不要依赖“自动故障转移 + majority 写”来替代人工停写,尤其在金融、订单类强一致性业务中
- 检查当前写关注是否生效:
db.runCommand({getLastError: 1})或驱动里确认writeConcern显式设为{w: "majority", j: true}
事务必须用 readConcern: "snapshot" + writeConcern: "majority"
普通事务默认使用 readConcern: "local",这意味着它读到的数据可能还没被复制出去,切换后新主上查不到;而 readConcern: "snapshot" 能保证事务内所有读取基于同一个快照,配合 writeConcern: "majority" 才构成因果一致性闭环。
注意:这个组合只在 4.0+ 副本集且开启 featureCompatibilityVersion: "4.0" 及以上时有效。低于该版本的事务无法跨切换保持完整性。
- 客户端代码中显式指定事务选项,不要靠默认值:
session.startTransaction({readConcern: {level: "snapshot"}, writeConcern: {w: "majority"}}) - 避免在事务中混用
readPreference: "secondary",Secondary 节点无法提供 snapshot 级别读取 - 驱动版本需匹配:Java Driver 3.12+、Node.js Driver 3.6+、Python PyMongo 3.12+ 才完整支持该语义
切换后必须验证 oplog 同步水位,不能直接恢复写
即使你用了 rs.stepDown(30) 给足时间,也不能假设 Secondary 已追平。新主当选后,原 Primary 可能仍持有未复制的 oplog 条目,此时若立即恢复写,新主会强制其回滚(rollback),而回滚内容仅写入磁盘文件(如 rollback/ 目录下的 BSON 文件),不会自动重放。
典型坑点:回滚量超过 300MB 时,MongoDB 会拒绝启动回滚流程,并报错 cannot rollback because the amount of data to roll back exceeds 300MB,这时只能全量 resync —— 意味着那部分事务数据彻底丢失。
- 切换完成后,先连新 Primary 执行
rs.printSlaveReplicationInfo(),确认所有 Secondary 的syncedTo时间戳 ≥ 切换前最后写入时间 - 检查原 Primary 日志是否有
Rollback started或rollback completed记录 - 若发现回滚,必须手动解析
rollback/*.bson并重放到新主,不能跳过这步
阿里云 MongoDB 版等托管服务的特殊限制
阿里云、腾讯云等平台的 MongoDB 副本集控制台“手动主备切换”按钮看似方便,但它底层调用的是封装后的 replSetStepDown,且不暴露 oplog 同步状态。更关键的是,这类操作会产生约 30 秒连接闪断,而很多应用的重连逻辑默认只重试 3–5 秒,导致事务中途断开、驱动抛出 InterruptedDueToReplStateChange 异常。
- 不要在业务高峰期点控制台按钮;切换前确保应用连接池配置了至少 60 秒超时和指数退避重连
- 云厂商的“强制切换” API(如
SwitchRole)不等同于原生rs.reconfig(),它绕过优先级检查,可能选到延迟最高的节点当主,加剧数据不一致风险 - 如果你用的是 Serverless 版或按量付费实例,切换还可能触发底层节点重建,oplog 会被清空,此时任何未同步事务都会永久丢失











