服务器定期巡检必须规则驱动、阈值量化、闭环可溯:先查硬件与系统基础(内核/发行版一致性、负载趋势、初始化系统),再按空间→内存→cpu→io顺序双控阈值监控,重点盯inode耗尽、available内存预警、频繁换页、cpu热点及io饱和。

服务器定期巡检与维护不是走流程,而是建立可执行、可验证、可回溯的闭环动作。重点在于把“人盯”变成“规则驱动”,用明确阈值和标准化步骤替代经验判断。
硬件与基础状态必须先确认
底层不稳,上层服务全是空中楼阁。三项必须查:
- 执行 uname -r 和 cat /etc/os-release,核对内核版本是否降级、发行版是否被意外切换(比如CentOS误切为Rocky但配置未同步)
- 用 uptime 看平均负载,再结合 cat /proc/loadavg 对比1/5/15分钟值;若15分钟负载持续高于CPU逻辑核心数×1.5,需进一步用 mpstat -P ALL 1 3 查各核分布
- 运行 ps -p 1 -o comm= 验证初始化系统是否为systemd;再执行 systemctl is-system-running 确认返回 running
资源使用率要双控+阈值化
所有指标不设阈值等于没检查。按空间→内存→CPU→IO顺序逐层扫描:
宝塔面板11.3.0是一款针对Linux服务器设计的可视化管理工具,通过重构核心模块实现资源占用显著降低,尤其适合低配置服务器环境。它将复杂的命令行操作转化为直观的图形界面,帮助开发者快速完成网站部署、环境配置及日常运维工作,无需专业技术背景即可高效管理服务器。
- 磁盘空间与Inode双控:用 df -h 查挂载点,超80%标红;同步跑 df -i,尤其关注 /var/log、/tmp,Inode耗尽会导致新建文件失败
- 内存看available而非free:free -h 中 available 低于总内存20%即预警;若 swap used > 0,再用 vmstat 1 5 | tail -1 查 si/so,非零说明频繁换页
- CPU真实负载识别:避免 top 的误导,改用 pidstat -u 1 3;对长期 >90% 的进程,用 perf top -p PID 定位热点函数
- IO瓶颈定位:iostat -xm 1 3 关注 %util(>70%持续告警)、await(SSD应 iotop -oPa 找出IO大户
服务与网络必须验“通、稳、配”
不止看服务是否 running,更要看它是否真正可用:
- 用 ss -tuln 列出所有监听端口,人工核对是否与业务文档一致(如Web服务该监听443,不是8080);对关键端口(22、3306、6379)从跳板机实测:nc -zv IP PORT
- 查依赖关系:systemctl list-dependencies --reverse nginx;确认开机自启:systemctl is-enabled nginx,禁用项必须有书面审批记录
- 用 ss -s 查总连接数,对比历史基线;ss -tn state TIME-WAIT | wc -l 过高可能预示TIME-WAIT堆积或连接泄漏
安全与备份不能只看“有没有”,要看“对不对”
备份成功≠能恢复,登录正常≠没被入侵:
- 检查昨日备份日志,确认 rsync 或 mysqldump 进程退出码为0;抽查一个备份文件,用 tar -tzf 或 gzip -t 验证完整性
- 清理过期备份前,先确认保留策略(如7天全量+30天增量)已写入脚本并生效;避免误删导致RPO超标
- 查异常登录:lastb(暴力破解)、grep "Failed password" /var/log/auth.log;查异常进程:ps aux --sort=-%cpu | head -10 + lsof -i :PORT
- 查可疑服务:systemctl list-unit-files --state=enabled,剔除非业务必需项;查启动用户:ps -eo pid,user,comm,args --sort=user | grep -E "(nginx|apache|php-fpm)",避免以 root 或 LocalSystem 运行










