容量规划是构建感知、响应、自愈的磁盘空间管理闭环,聚焦监控精准性、清理可控性、策略可解释性,通过双阈值联动、干扰项识别、可追溯清理及业务节奏适配实现主动治理。

容量规划不是预测未来,而是建立一套能感知、响应、自愈的磁盘空间管理闭环。核心是把“等报警再救火”变成“在满之前就调平”,重点落在监控精准性、清理可控性、策略可解释性三方面。
盯住真实风险点,不被表象误导
磁盘“满”不等于空间真用完,常见干扰项必须排除:
-
inode 耗尽:小文件多的场景(如日志、备份元数据)容易 inode 先用光,
df -i必须和df -h同步检查 -
已删未释放:进程还在写已被 rm 的文件,
lsof +L1 | grep 挂载点可定位,需重启或 kill 对应进程 -
root 保留空间干扰:默认 5% 空间只给 root,但备份工具常以 root 运行,脚本判断应基于
Use%而非Available绝对值 -
挂载点错位:只监控实际备份路径(如
/backup),不扫/或/home等无关分区
双阈值驱动,监控与清理联动
单一阈值(如 90%)易误触发或响应滞后,推荐“分级响应”设计:
- 80% → 告警+分析:发邮件/企微通知,附当前最大 3 个子目录、24 小时新增最多文件的路径,提示人工干预
- 85% → 自动清理启动:按保留策略删除最旧备份集(如日备删 7 天前,周备删 4 周前),每次清理后重新评估
-
90% → 强制截断+扩容预案:清空临时日志(
truncate -s 0 /var/log/*.log)、触发云盘自动扩容或告警升级至负责人
清理动作必须可追溯、可回滚、可验证
自动删数据不是目的,保障业务连续才是底线:
-
先归档,再删除:清理前将待删备份 tar.gz 压缩并打时间戳移至
/backup/archive/,保留 24 小时供核验 -
按时间戳而非文件名清理:用
find /backup -type f -mtime +7 -delete,避免因命名不规范漏删或误删 -
清理后校验空间释放:执行
df -h /backup并比对清理前后数值,若未达标则记录失败原因并重试 -
禁止“一键清空”操作:所有脚本需内置 dry-run 模式,上线前先用
--dry-run参数模拟执行
让策略随业务节奏自然呼吸
备份窗口、业务低峰、合规周期都是策略锚点,不能脱离上下文硬设数字:
- 避开凌晨 2–4 点(常见全量备份时段),监控脚本加时间判断:
[ $(date +%H) -ge 2 -a $(date +%H) -le 4 ] && exit 0 - 金融类系统保留月备至少 12 个月,但日备只需 7 天;监控录像按重要区域分档(主出入口保留 90 天,走廊保留 15 天)
- EMR 集群 Core 节点 HDFS 使用率超 85% 即触发清理,因超 90% 会导致 NodeManager 标为 unhealthy
- Windows 存储感知设为每天运行,临时文件清理时限设为 1 天,回收站设为 30 天,匹配用户使用习惯










