ora-29701错误本质是ohasd进程未启动或崩溃,需彻底deconfig并init重建olr,验证ohasd进程、ipc共享内存及/var/tmp/.oracle/socket文件,再查ocssd.log心跳与表决盘状态。
ora-29701 是 oracle 11g rac 启动失败时最典型的报错之一,它直接指向集群就绪服务(crs)无法连接到 oracle high availability services(ohas),本质是 ohasd 进程根本没起来,或者启动中途崩溃。这不是配置错误,而是底层守护进程缺失或卡死——必须从系统级重置入手,不能靠 srvctl 或 crsctl start crs 硬扛。
为什么 ohasd 启动失败(常见于 rootcrs.pl line 443)
报错位置在 /u01/app/11.2.0/grid/crs/install/rootcrs.pl 第 443 行,通常意味着 OHAS 初始化阶段无法完成 IPC 通信。真实原因不是脚本本身有 bug,而是前置依赖未满足:
-
ohasd需要读取/etc/oracle/olr.loc定位本地注册库(OLR),若该文件丢失、权限错误(非 root:root)或路径指向无效设备,rootcrs.pl会直接 abort - 系统级资源冲突:另一个
ohasd实例残留(比如上次强制 kill 未清理干净),导致新进程无法绑定 IPC keyOCSSD_LL_<hostname>_</hostname> - SELinux 或防火墙拦截了本地 Unix socket 创建(尤其在 RHEL/CentOS 上,
setenforce 0临时关闭可验证) - Grid Infrastructure 安装目录(
$GRID_HOME)下关键二进制文件权限被破坏,例如$GRID_HOME/bin/ohasd不可执行或属主不是 root
强制清除旧状态并重建 OLR
不要尝试先 crsctl stop crs —— 此时 crsctl 本身已失效。必须用底层工具彻底清空 OHAS 上下文:
- 以 root 用户执行:
/u01/app/11.2.0/grid/crs/install/rootcrs.pl -deconfig -force -verbose。注意:不是roothas.pl(那是 11.1 的遗留物,11.2+ 已废弃) - 确认输出含
Successfully deconfigured Oracle clusterware stack on this node,且无PRCR-1070或Cannot communicate with crsd类错误。若仍有 OCR 相关报错,说明节点还连着集群,需先在其他正常节点上运行crsctl delete node -n - 手动删除残留锁文件:
rm -f /var/tmp/.oracle/* /tmp/.oracle/*;清空 OLR 目录:rm -rf /etc/oracle/olr.loc /u01/app/11.2.0/grid/cdata/<hostname></hostname> - 重新初始化 OLR:
/u01/app/11.2.0/grid/crs/install/rootcrs.pl -verbose -force -init。此步会重建/etc/oracle/olr.loc并启动ohasd,成功后应看到ohasd is starting日志
验证 ohasd 是否真正存活
启动后别急着跑 crsctl check crs,先确认进程和 IPC 层是否就位:
- 检查进程:
ps -ef | grep ohasd—— 必须有 root 用户运行的/u01/app/11.2.0/grid/bin/ohasd.bin reboot进程(注意是reboot参数,不是start) - 检查 IPC:
ipcs -m | grep oracle应出现至少一个共享内存段,key 匹配ocssd相关标识;ls -l /var/tmp/.oracle/应存在sOHASD_IPC_SOCKET文件 - 查日志:
tail -20 /u01/app/11.2.0/grid/log/<hostname>/ohasd/ohasd.log</hostname>,末尾不能有CLSU-00100或反复报clsc_connect: no listener - 此时再运行
crsctl check crs,若仍返回CRS-4639,说明ohasd虽在但未拉起cssd,需立刻看/u01/app/11.2.0/grid/log/<hostname>/cssd/ocssd.log</hostname>中是否有 “missed heartbeat” 或磁盘读取超时
最关键的细节往往藏在 ohasd.log 和 ocssd.log 的时间戳对齐上——如果两个日志最后写入时间相差超过 5 秒,说明 OHAS 启动后 CSSD 根本没响应,大概率是表决磁盘(voting disk)路径不可达或权限不对,而不是重启命令没输对。











