windows服务器运维巡检手册明确:每日08:00自动扫描、09:00–09:45人工复核,覆盖全部生产环境win2016/2019/2022主机;当值工程师负责,10:00前提交报告,高危问题须30分钟内启动应急预案;一级必查项5分钟完成(服务状态、磁盘≥90%、近2小时系统/应用日志错误、windows update状态),二级常规项15分钟完成(cpu/内存峰值、杀毒状态、管理员组变更、计划任务),三级抽检每周一次(证书到期、ntfs权限、防火墙规则、bitlocker);每项均配具体命令及预期输出,如get-psdrive输出usedpct≥90即告警、get-service要求status=running且starttype≠disabled;所有⚠️/❌项强制关联工单并24小时内闭环根因分析。

编写一份规范的 Windows 服务器运维巡检手册,核心是把“做什么、怎么做、做到什么程度、异常怎么处理”四件事说清楚,而不是堆砌命令或罗列条目。它要能被一线运维人员快速执行、被新人看懂、被审计认可。
明确巡检目标与责任归属
手册开头必须写清:本次巡检为每日例行检查,覆盖生产环境全部 Windows Server 2016/2019/2022 主机(不含测试、开发环境);责任人是当值系统运维工程师,需在当日10:00前完成并提交报告;发现高危问题(如服务宕停、磁盘满、异常登录)须立即电话通报,并在30分钟内启动应急预案。
避免模糊表述,例如不写“定期检查”,而写“每日08:00自动触发脚本扫描,人工复核时间窗为09:00–09:45”。
分层设计检查项,按风险等级排序
把检查项分成三级,每级对应不同操作深度和响应时效:
- 一级(必查项,5分钟内完成):服务状态(IIS、SQL Server、DHCP、DNS)、磁盘使用率(C:\ 和数据盘,阈值≥90%标红)、事件查看器中“系统”和“应用程序”日志的最近2小时错误(Event ID ≥ 1000)、Windows Update 状态(是否启用自动更新、有无待重启补丁)
- 二级(常规项,15分钟内完成):CPU/内存持续利用率(过去24小时峰值,CPU>95%或内存>90%持续超10分钟需分析)、防病毒引擎版本与实时防护状态、本地管理员组成员变更记录(对比上周快照)、计划任务执行日志(重点看备份、清理类任务是否成功)
- 三级(抽检项,每周一次):证书到期日(检查本地计算机证书存储中所有服务证书)、NTFS权限继承一致性(抽查关键共享文件夹)、防火墙规则有效性(用 Test-NetConnection 验证业务端口连通性)、BitLocker 加密状态(仅对启用了的卷)
给出可执行的验证方法,而非仅描述现象
每项检查都配套具体命令或路径,且注明预期输出。例如:
- 查磁盘空间:
Get-PSDrive C, D | Select-Object Name, Used, Free, @{n='UsedPct';e={ [math]::Round($_.Used / ($_.Used + $_.Free) * 100, 1) }}—— 输出中 UsedPct ≥ 90 即触发告警 - 查关键服务状态:
Get-Service w3svc, MSSQLSERVER, dhcpserver | Select-Object Name, Status, StartType—— 要求 Status = Running 且 StartType ≠ Disabled - 查异常登录:
Get-WinEvent -FilterHashtable @{LogName='Security'; ID=4625; StartTime=(Get-Date).AddHours(-2)} -MaxEvents 5—— 返回非空即需人工核查来源IP和账户
不写“检查日志是否有错误”,而写“执行上述命令,若返回 Event ID 7031(服务意外终止)或 10016(DCOM 权限错误),记录服务名与时间戳,并检查对应服务依赖项”。
固化结果记录与问题闭环机制
手册附带标准巡检表模板(Excel 或 Markdown 表格),字段强制包含:服务器名称、检查时间、检查项、实际值、阈值、状态(✅/⚠️/❌)、截图/命令输出片段(可选)、处理动作、处理人、关闭时间。所有 ⚠️ 和 ❌ 项必须关联到内部工单系统,且要求24小时内填写根因分析与预防措施。
例如某台服务器 D 盘使用率达92%,记录时不仅要填“❌”,还要注明“已执行 LogParser 清理 IIS 日志,释放12GB;后续将配置日志轮转策略(工单号 INC-2026-XXXX)”。











