fsfo自动切换失败的根本原因是前置五项状态未达标:闪回必须启用、归档路径需含合法valid_for、保护模式须为maximum availability/performance、备库须为read only with apply的物理备库、v$database.fsfo_status必须为synchronized。
fsfo 不是配完 enable fast_start failover 就能自动切的——它卡在“waiting for primary to become unavailable” 的根本原因,90% 是前置状态没达标,而不是 observer 没启动。
FSFO 触发前必须验证的五个核心状态
Broker 显示 Fast-Start Failover: ENABLED 只是表象,真正决定能否自动切换的是这五项实时状态,缺一不可:
-
FLASHBACK DATABASE必须启用:主备库都执行ALTER DATABASE FLASHBACK ON;FSFO 故障恢复流程依赖闪回回退异常主库,未开启会直接拒绝切换 -
LOG_ARCHIVE_DEST_n中必须含合法VALID_FOR:主库需有VALID_FOR=(ALL_LOGFILES,PRIMARY_ROLE),备库需有VALID_FOR=(ONLINE_LOGFILES,STANDBY_ROLE);Broker 仅凭此判断归档路径是否可用于 FSFO 场景 -
PROTECTION_MODE必须为MAXIMUM AVAILABILITY或MAXIMUM PERFORMANCE;19c 支持后者,但若设为MAXIMUM PROTECTION,FSFO 会被 Broker 拒绝启用 - 备库必须是
PHYSICAL STANDBY且OPEN_MODE = 'READ ONLY WITH APPLY';MOUNTED状态或逻辑备库不满足条件,V$DATABASE.FSFO_STATUS会始终为NOT SYNCHRONIZED -
V$DATABASE.FSFO_STATUS必须为SYNCHRONIZED(不是STARTED或NOT SYNCHRONIZED);这是 Observer 实际读取的唯一判断依据,查法:SELECT FSFO_STATUS, DATABASE_ROLE FROM V$DATABASE;
dgmgrl 配置必须全程走 Broker,SQL*Plus 无效
所有操作必须通过 dgmgrl 连接 Broker 监听地址(不是数据库实例),混用 SQL*Plus 命令会导致配置错位:
- 连接方式:
dgmgrl sys/password@primary_db(primary_db是 tnsnames.ora 中指向主库 Broker 的条目,监听端口默认 1521,非数据库端口) - 先校验:
SHOW CONFIGURATION输出必须为Success,且SHOW DATABASE VERBOSITY无 WARNING 级错误 - 设目标备库:
EDIT DATABASE 'standby_db' SET PROPERTY 'FastStartFailoverTarget' = 'standby_db';(大小写敏感,DB_UNIQUE_NAME必须完全一致) - 设阈值:
EDIT DATABASE 'standby_db' SET PROPERTY 'FastStartFailoverThreshold' = 30;(单位秒,建议 30–60,太小易误触发) - 启用:
ENABLE FAST_START FAILOVER;成功后SHOW CONFIGURATION才会显示ENABLED
Observer 启动失败的三个高频原因
START OBSERVER 命令看似简单,但实际运行失败几乎都源于底层链路断开:
- Observer 主机上
tnsnames.ora缺失或配置错误:必须包含主库和备库的完整连接描述符,且GLOBAL_DBNAME要与监听器中SID_LIST定义一致(例如test_pri_dgmgrl) - 主备库监听器未注册静态服务:需在
listener.ora的SID_LIST_LISTENER中显式添加SID_DESC,否则 Broker 连接超时,Observer 日志反复报ORA-12170: TNS:Connect timeout occurred -
START OBSERVER必须本地执行:dgmgrl -silent "START OBSERVER"不能通过 SSH 远程调用,也不能后台化(如加&);进程需前台常驻,日志默认写入$ORACLE_HOME/rdbms/log/drc*.log
测试 FSFO 切换时最容易踩的坑
模拟断电测试不是 shutdown abort,那是自毁式操作:
- 禁止
shutdown abort:Observer 会收到ORACLE INSTANCE TERMINATED,判定为主库异常崩溃,触发Failover cancelled: Primary instance terminated abnormally - 正确顺序:先在主库执行
ALTER SYSTEM SET LOG_ARCHIVE_DEST_STATE_2=DEFER;(停归档传输),再shutdown immediate(模拟可控断电) - 验证 Observer 是否真“感知失联”:在 Observer 主机手动运行
sqlplus sys/<pwd>@primary_db as sysdba -c "SELECT 1 FROM DUAL;"</pwd>,必须超时或报ORA-12170;否则FastStartFailoverThreshold计时不会开始 - 切完别急着连:备库角色变更后,
V$DATABASE.DATABASE_ROLE会变为PRIMARY,但应用连接前需确认监听已注册新角色,否则ORA-12514仍会发生
FSFO 的复杂点不在命令本身,而在于它把多个独立子系统(Broker、闪回、SRL、监听静态注册、网络连通性)强行耦合成一个原子判断。任何一个环节掉链子,FSFO_STATUS 就卡在 SYNCHRONIZED 之外,Observer 只能干等——这不是 bug,是设计使然。











