oracle rac脑裂防护的核心是消除单点故障:双私网需连不同交换机、voting disk路径须多路径、ocr与voting disk不可共盘,否则io隔离等机制失效。

Oracle RAC 出现脑裂(Split-Brain)时,服务中断不是“结果”,而是集群主动防护的必然动作——节点被驱逐(eviction)后强制重启,是为了阻止多个节点同时写入共享存储引发数据损坏。真正要解决的,是**防止脑裂发生**,而不是在脑裂已触发后“恢复服务”。
为什么crsctl check cluster -all显示部分节点在线但服务反复中断
常见现象是:两个节点各自认为对方失联,ora.cluster_interconnect.haip资源频繁 OFFLINE/ONLINE,告警日志出现 ORA-29740: evicted by member 或 CRS-1601。这说明网络心跳已断,但磁盘心跳(voting disk)仍可访问,仲裁陷入平局。
- 根本原因不是“心跳丢了”,而是私网链路单点脆弱:单网卡、单交换机、VLAN配置错误或物理松动
-
css_misscount默认 30 秒,但网络抖动、STP 收敛、ARP 延迟常在 10–25 秒内触发误判,没冗余就等于把集群命脉交给一根网线 - 不要只看
ping通不通——必须用ping -I bond0 -c 5 <peer_private_ip></peer_private_ip>指定私网接口测试,丢包率必须为 0
配置双私网网卡并启用 HAIP 的关键实操点
Oracle 11.2.0.2+ 默认启用 HAIP(Highly Available IP),它自动在所有标记为 cluster_interconnect 的网卡上分配 169.254.x.x 地址,但前提是配置正确且链路真实冗余。
- 两块网卡(如
enp0s8和enp0s9)必须物理接入**不同品牌、不同供电、不同上联光模块**的两台交换机,严禁堆叠或虚拟成一台设备 - 执行
oifcfg setif -global enp0s9/10.10.10.0:cluster_interconnect后,务必运行oifcfg getif确认两条都被识别为cluster_interconnect - 重启
has后,ifconfig应看到两个子接口(如enp0s8:1和enp0s9:1);若只看到一个,说明 HAIP 静默降级为单路径,crsctl stat res -t | grep network会显示OFFLINE - 禁用操作系统层
bond(如mode=1主备),HAIP 自行管理切换;已配 bond 的必须先解绑再交由 HAIP 管理
IO 隔离(IO Fencing)才是防脑裂的最终执行层
很多人误以为 voting disk 投票就能“解决”脑裂——其实它只负责表决,真正阻断故障节点写入的是 IO 隔离。这是 Oracle RAC 官方明确指定的脑裂防护机制,依赖 SCSI-3 协议向存储设备发送物理隔离指令。
-
voting disk是检测层和决策层,IO 隔离是执行层;混淆二者会导致防护失效 - 必须确保存储支持 SCSI-3 Persistent Reservations(PR),且
ASM磁盘组中 voting file 所在的 LUN 已启用 PR - 验证方式:人为拔掉节点 A 的私网线,观察节点 B 是否在
disktimeout(默认 200 秒)内完成仲裁并触发IO 隔离,而非等待超时后才驱逐 - 日志线索:
ocssd.log中出现clssnmCheckDskInfo: Aborting local node to avoid splitbrain表示 IO 隔离已介入
最容易被忽略的一点:脑裂防护不是靠“加功能”,而是靠**消除单点**——双网卡不连双交换机、voting disk 路径没多路径、OCR 和 voting disk 共盘,任何一项都会让整套机制形同虚设。防护效果只取决于最薄弱的那个环节。











