备库归档空间满的根本原因是删得无判断、无守门:rman因control_file_record_keep_time默认仅7天而漏删大量物理残留文件,而直接rm -f又易误删未应用归档导致gap;其清理必须先确认applied='yes'且completion_time≤sysdate-7,再结合find -mtime+15清理失联文件,并通过锁、环境变量、日志和mrp状态校验保障安全。
备库归档空间满不是“删得不够快”,而是删得没判断、没守门——直接 rm -f 极易删掉还没应用的归档,导致gap;而只靠 rman 的 delete archivelog 又可能因控制文件元数据过期(control_file_record_keep_time 默认仅 7 天)而漏删大量物理残留文件。
为什么备库不能用主库那套 RMAN deletion policy
RMAN 的 configure archivelog deletion policy to applied on standby 在备库上根本不起作用:该策略只在主库执行 DELETE INPUT 或显式 DELETE ARCHIVELOG 时触发校验,且依赖隐含参数 "_log_deletion_policy" = ALL 和数据库重启。备库本身不发起归档删除动作,这个配置对它只是摆设。强行在备库配,既无效,还可能干扰后续升级或 RAC 实例状态同步。
清理脚本必须先确认归档已应用,再删物理文件
安全清理的核心逻辑是:只删那些 applied = 'YES' 且早于某个保留窗口(如 7 天)的归档。不能只看时间戳,也不能只看文件名 sequence# —— 因为归档可能被手动复制、重命名或跨 DEST_ID 写入。
- 用 SQL 查出已应用归档的最大
SEQUENCE#:SELECT MAX(SEQUENCE#) FROM v$archived_log WHERE applied = 'YES' AND DEST_ID = 2(DEST_ID需根据v$archive_dest确认) - 再查出这些归档对应的
NAME(即物理路径),生成rm -f命令列表 - 必须加
COMPLETION_TIME 二次过滤,避免刚应用完就删(MRP 进程有延迟风险) - 脚本开头务必检查
v$archive_gap和v$managed_standby中 MRP0 状态,若有 GAP 或 MRP NOT APPLYING,直接退出并报错
物理文件残留必须用 find + mtime 清理,RMAN 管不到
控制文件只保留约 control_file_record_keep_time(默认 7 天)内的归档元数据。超过这个时间的归档,即使物理文件还在磁盘上,RMAN 的 CROSSCHECK 和 DELETE 也完全看不见——它们不是“过期”,而是“失联”。这类文件只能靠操作系统命令清理,但必须满足两个前提:
- 确认数据库已运行超 7 天,且期间无全库恢复(否则旧归档可能参与 PITR)
- 确认当前无任何备份任务正在读取这些旧文件(如第三方备份工具未退出)
- 推荐命令:
find /u02/archivelog -name "*.dbf" -mtime +15 -print0 | xargs -0 rm -f(+15 是留出缓冲,比保留窗口多 8 天) - 严禁用
find ... -delete:部分老版本 find 不支持原子性,中断可能导致部分删、部分留
crontab 定时任务要带环境、带日志、带锁
直接写 0 2 * * * /home/oracle/scripts/clean_st_arch.sh 是高危操作:环境变量缺失会导致 sqlplus 找不到 ORACLE_HOME;并发执行可能重复删;失败无声更可怕。
- 脚本第一行必须是
#!/bin/bash -e(-e 让任意命令失败即退出) - 显式导出所有 Oracle 环境变量:
export ORACLE_SID=xxx ORACLE_HOME=/u01/app/oracle/product/11.2.0/db_1 - 用
mkdir -p /home/oracle/scripts/.lock && mkdir /home/oracle/scripts/.lock/run 2>/dev/null || exit 1做简单锁(避免前次未结束又触发) - crontab 行末必须重定向:
0 2 * * * /home/oracle/scripts/clean_st_arch.sh >> /home/oracle/scripts/clean_st_arch.log 2>&1 - 日志里必须记录每次执行的
max(sequence#)、删了多少个文件、是否跳过(因 GAP 或 MRP 暂停)
最常被忽略的一点:备库清理脚本不能只盯着 v$archived_log,还得定期跑 RMAN> CROSSCHECK ARCHIVELOG ALL 并 DELETE EXPIRED —— 因为网络中断、传输失败等会让控制文件里存着“已传输但未落盘”的假记录,不清理会持续占用空间统计逻辑。











