根本原因是ohasd未真正启动或启动后子进程(如cssd、crsd)因权限、ocr/voting disk不可访问、ipc通信异常而失败;需先验证ohasd进程与olr.loc有效性,再逐层检查磁盘组挂载、私网连通性、多路径一致性及grid用户二进制权限。

Oracle RAC节点自动重启后服务起不来,不是“没启动”,而是crsctl start crs执行失败、资源卡在INTERMEDIATE或UNKNOWN状态——根本原因几乎都落在ohasd没真正活起来,或者它启动了但关键子进程(如cssd、crsd)因权限、设备、IPC通信问题被拦在门外。
crsctl start crs 没反应或报 CRS-4537:先盯住 ohasd 进程
这个错误不是 CRS 启不动,是整个高可用框架压根没加载。所有 crsctl 命令都依赖本地 ohasd 进程通信,它挂了,命令就全失效。
- 立刻执行
ps -ef | grep ohasd—— 如果无输出,说明ohasd根本没跑,别碰crsctl start crs - 检查
/etc/oracle/olr.loc是否存在且路径有效:cat /etc/oracle/olr.loc,内容应类似olrconfig_loc=/u01/app/19c/grid/cdata/olr.ocr;若路径指向不存在目录,或文件权限是600(必须是644),ohasd会静默失败 - 手动拉起:
sudo /u01/app/19c/grid/bin/crsctl start ohasd,之后必须立刻验证:crsctl check crs,看到CRS-4638: Oracle High Availability Services is online才算过关
ora.cssd 卡住或超时:OCR/voting disk 访问链断了
ora.cssd 是集群心跳核心,不依赖数据库,但强依赖 OCR 和 voting disk 所在磁盘组是否已 MOUNTED、路径可达、权限一致。
- 用
asmcmd lsdg看 OCR 所在磁盘组(如OCRVOTE)状态 —— 若是DISMOUNTED,需先sqlplus / as sysasm执行ALTER DISKGROUP OCRVOTE MOUNT - 运行
crsctl query css votedisk,确认输出路径(如+OCRVOTE或/dev/mapper/mpathb)在所有节点上都能被root用户读取,且ls -l显示属主为grid:oinstall、权限为660(裸设备)或644(NFS 文件) - 查私网连通性:
olsnodes -n应列出全部节点编号;若某节点缺失,翻$GRID_HOME/log/<hostname>/cssd/ocssd.log</hostname>,找IPC Send timeout或Failed to connect to CSS daemon—— 大概率是防火墙拦了 UDP 12345 或私网网卡 down 了
ora.storage ONLINE INTERMEDIATE:ASM 实例起来了但挂不了盘
这表示 ora.asm 进程已启动,但无法访问 OCR 或 voting disk 对应的 ASM 磁盘组。最容易被忽略的是多路径设备映射不一致或 ASMLIB 设备名错位。
- 在每个节点执行
ls -l /dev/mapper/(或对应多路径设备目录),确认 OCR/voting disk 的设备名(如mpathb)在所有节点上完全一致;不一致会导致一个节点能 mount,另一个节点报ORA-15001 - 检查
udev规则或powermt输出,确认多路径聚合后的 WWID 在所有节点识别一致;若不一致,asmcmd lsdsk可能只显示部分磁盘 - 如果用了 ASMLIB,确认
oracleasm listdisks输出与crsctl query css votedisk中路径能一一对应;ASMLIB 名称错位会导致表决盘识别失败,CSSD 直接拒绝启动
crsctl stat res -t 显示大量 UNKNOWN:Grid 用户关键二进制权限损坏
只要看到 CRS-4639、ORA-01078 或 PRCR-1071,且 crsctl check crs 返回 cannot communicate with the crs daemon,大概率是 $GRID_HOME/bin/oracle 权限错误。
- 该文件必须是
rwsr-s--x(即chmod 6751),且属主属组为grid:oinstall—— 它需要 suid/sgid 特权访问 ASM 设备、绑定内核信号量等 - 仅改权限不够,必须同时修正:
chown grid:oinstall $GRID_HOME/bin/oracle,再chmod 6751 $GRID_HOME/bin/oracle - 修复后不能只启单个服务,必须完整重启 CRS:
crsctl stop crs -f→ 确认ps -ef | grep -E "(ohasd|crsd|cssd)"为空 →crsctl start crs
最常被忽略的点是:ohasd 启动成功 ≠ CRS 正常;它只是入口,后续所有子进程都依赖 IPC 共享内存、Unix socket(/var/tmp/.oracle/ 下文件)、设备权限三者同时就位。任何一环权限或路径错位,都会导致资源停在 INTERMEDIATE 或反复 CLEAN,而日志里只报“daemon aborted”这种模糊提示。











