oracle 19c rac节点频繁被驱逐的根本原因是集群心跳体系连续失守,核心线索是ocssd.log中crs-1611(75%心跳丢失)、crs-1610(90%丢失)、crs-1607(正式驱逐)三类告警密集递进出现,多节点同步爆发指向底层网络抖动,单节点独发则优先排查本端物理层丢包、mtu不匹配、防火墙拦截或hugepages配置异常。

Oracle 19c RAC节点频繁被驱逐,基本不是数据库层问题,而是集群心跳体系已连续失守——核心线索全在 ocssd.log 里,不是看有没有报错,而是看 CRS-1611、CRS-1610、CRS-1607 是否密集递进出现。
查 ocssd.log 看三连告警是否同步爆发
节点驱逐是 CSSD 进程按固定阈值逐级升级的结果,不是突发故障。必须定位到具体时间点的原始日志段:
-
CRS-1611:75% 心跳包未收到(黄灯),窗口通常是in 6.512 seconds,说明私网已开始抖动 -
CRS-1610:90% 心跳丢失(红灯),驱逐倒计时启动,此时若对端节点无对应记录,大概率是本节点收包异常(如网卡丢包、中断风暴) -
CRS-1607:正式驱逐,日志明确写node 2 evicted
若多个节点在同一分钟内都打出这三连报错,基本可排除单点硬件故障,直接指向底层网络抖动;若仅一侧报 CRS-1612(this node was evicted by node X)而对端无 CRS-1610,则优先查本节点物理层——别急着换交换机,先跑 ethtool -S eth1 | grep -E "(rx_discards|rx_errors)"。
验证私网 MTU 和巨帧端到端是否生效
MTU=1500 是 RAC 私网最常见隐形杀手,GC 消息动辄几 KB~64KB,强制分片数十包,任意一包丢失就整条消息重传,最终触发 ORA-600 [kjctr_pbmsg:badbmsg2] 或节点驱逐。
- 确认所有节点网卡支持巨帧:
ethtool eth1输出中必须含Supports jumbo frames - 确认交换机私网端口已启用巨帧且 MTU ≥9000(注意:不是管理口,也不是直连跳线)
- 临时生效:
ip link set dev eth1 mtu 9000;永久生效:在/etc/sysconfig/network-scripts/ifcfg-eth1中加MTU=9000并重启网络服务 - 验证不能只看
ip link show:用ping -M do -s 8972 <node2_private_ip></node2_private_ip>测试无分片直达(8972 = 9000 − 28 字节头) - 检查
netstat -s | grep "reassembles failed"是否归零或停止增长——持续上涨就是 MTU 不足铁证
确认防火墙和 SELinux 是否静默拦截私网 IPC
firewalld 默认不放行私网网段流量,哪怕你开了 1521 端口,RAC 私网通信仍会失败,典型现象是 clsssInitNative: connect failed, rc 9 或 IPC SEND timeout。
- 别只查
firewall-cmd --list-services,它对私网 IP 段无效;必须运行:firewall-cmd --zone=public --list-rich-rules查是否有拒绝规则 - 正确放行方式是按网段加源:
firewall-cmd --permanent --zone=public --add-source=192.168.10.0/24(网段需根据oifcfg getif或/etc/hosts确认) - 重载后验证:
firewall-cmd --zone=public --list-sources应含该网段 - SELinux 必须放开:
setsebool -P oracle_execmem 1,否则cssd进程无法建立共享内存段 - 检查
/proc/sys/net/core/somaxconn是否 ≥65535,过低会导致 IPC 连接队列溢出
排查 HugePages 配置与 transparent_hugepage 冲突
重装节点后未重配 HugePages 或未永久禁用 transparent_hugepage,会导致实例启动 fallback 到普通页,引发 ORA-27102: out of memory、LMON 异常退出,最终被驱逐。
- 永久禁用 THP:修改
/etc/default/grub,在GRUB_CMDLINE_LINUX行末加transparent_hugepage=never,再执行grub2-mkconfig -o /boot/grub2/grub.cfg并重启 - 验证:
cat /sys/kernel/mm/transparent_hugepage/enabled输出应为[never],且grep AnonHugePages /proc/meminfo返回AnonHugePages: 0 kB - 不要手算
vm.nr_hugepages:在实例已启动状态下运行$ORACLE_HOME/rdbms/install/hugepages_settings.sh,取输出值 +5% 向上取整 - 三个参数必须同时设:
vm.nr_hugepages、vm.hugetlb_shm_group、kernel.shmall,缺一不可
真正难的不是改参数,而是四者协同:交换机巨帧、网卡驱动、内核大页支持、Oracle 协议栈——任何一环掉链子,ocssd.log 里的 CRS-1611 就会准时出现。











