11.2.0.2及以上版本必须用haip,禁用linux bonding——haip已接管链路检测与故障漂移,底层套bonding会干扰心跳判定,导致crs-1601或ora-29702报错;例外仅限硬件强制要求且须用mode=1并设miimon≥100。

Oracle RAC私网该用HAIP还是Linux bonding?
11.2.0.2及以上版本必须用HAIP,禁用bonding——RAC的ora.cluster_interconnect.haip资源已接管链路检测与故障漂移,底层再套bond0会干扰其心跳判定逻辑,导致CRS-1601或ORA-29702报错。实测中,启用bonding后crsctl stat res -t | grep haip常显示INTERMITTENT或OFFLINE。
例外情况仅限硬件强制要求(如某些刀片机),此时只能选mode=1(active-backup),且必须设miimon≥100,否则与HAIP的css_misscount超时机制冲突。
如何添加第二块私网网卡并让HAIP生效?
不是配两个静态IP,而是让Oracle自动分配169.254.x.x虚拟地址。关键步骤如下:
- 确保两块网卡(如
eth2、eth3)已配置同网段IP(如10.10.20.11/24、10.10.20.12/24),但不手动绑定到同一别名 - 执行:
oifcfg setif -global eth2/10.10.20.0:cluster_interconnect;再执行:oifcfg setif -global eth3/10.10.20.0:cluster_interconnect - 重启集群:
crsctl stop crs && crsctl start crs(必须全节点滚动停启) - 验证:
oifcfg getif应输出两行相同网段;ifconfig | grep haip应看到类似eth2:1和eth3:1的接口及不同169.254.x.x地址
为什么加了第二张卡还是单路径?常见失效点
oifcfg setif配置错误是最隐蔽的失效原因:接口名必须与ifconfig输出完全一致(如写成bond0但实际是eth2),CSSD会静默降级为单路径,crsctl stat res -t里ora.cluster_interconnect.haip状态看似正常,但日志中无双链路活动记录。
其他典型陷阱:
-
/etc/hosts里私网解析混用了公网IP,导致cluvfy comp nodecon校验失败 - 未关闭
NetworkManager服务,它会劫持HAIP的ARP通告,造成心跳包发不出 - 物理连接未真正跨设备:两张卡都连同一台交换机(哪怕不同端口),拔一根线就断心跳
- 系统启用了
arp_ignore=1但没配arp_announce=2,HAIP无法正确响应ARP请求
MTU=9000和HAIP能共存吗?怎么验证真生效?
能共存,而且必须共存——HAIP负责冗余,巨帧负责吞吐。但MTU必须在所有节点统一设为9000,且停集群后执行:ip link set dev eth2 mtu 9000 && ip link set dev eth3 mtu 9000,运行中修改无效。
验证不能只看配置:
-
ping -M do -s 8972 -I eth2 <peer_private_ip></peer_private_ip>必须成功(8972 = 9000 − 28) -
tcpdump -i eth2 port 12599抓包,确认UDP心跳包长度接近9000字节 -
netstat -s | grep "reassembles failed"值不再增长,否则说明仍有分片丢包 - 检查
/proc/sys/net/core/rmem_max是否≥26214400,否则内核缓冲区溢出照样丢包
最易被忽略的是交换机侧:私网交换机管理口MTU设对了,但数据口没开巨帧,或者堆叠交换机只在主控板生效、成员板未同步。











