scom不直接采集终端细粒度指标,但可通过代理部署、管理包配置及脚本扩展实现间接追踪与关键运维覆盖;支持在线状态、服务健康、资源使用、事件日志、安全策略等监控,并可结合log analytics与自定义脚本增强业务级指标采集。
scom 本身不直接采集终端(如普通 windows 工作站、笔记本)的细粒度运维指标(例如用户登录时长、软件使用频次、本地打印机状态等),它更聚焦于服务器、服务、网络设备和关键应用的健康与性能。但通过合理配置和扩展,可以实现对终端环境的**间接追踪与关键运维指标覆盖**。
明确 SCOM 对终端的监控边界
SCOM 默认将 Windows 客户端操作系统(如 Win10/Win11)视为“受管计算机”,可部署代理(SCOM Agent)并收集基础系统级指标。但其原生管理包(Management Pack)对终端的关注点是:
– 是否在线、代理通信是否正常
– 关键服务(如 Windows Update、Print Spooler)是否运行
– 磁盘空间、内存、CPU 使用率(阈值告警)
– 系统事件日志中的错误/警告(如蓝屏、登录失败、组策略应用失败)
– 安全中心状态(如防病毒启用、防火墙开启)
它不替代 Endpoint Manager(Intune/ConfigMgr)或专用终端分析工具,而是补强其运维可观测性。
配置终端代理并启用关键监控项
确保终端已安装 SCOM Agent 并导入相应管理包(如 Windows Client OS MP)。重点启用以下监控能力:
- 启用“Windows Client Health Model”——提供终端健康状态汇总视图
- 订阅“Operating System”类别的性能计数器:LogicalDisk % Free Space、Processor % Processor Time、Memory Available MBytes
- 配置事件日志规则:筛选 Application/System 日志中 Event ID 为 7000(服务启动失败)、6005/6006(事件日志服务启停)、4625(登录失败)等高价值条目
- 启用“Security Configuration Assessment”检查项(需导入 Security Baseline MP),定期评估终端是否符合组织安全策略(如密码复杂度、UAC 设置)
扩展终端运维指标的实用方式
若需追踪更贴近业务的终端指标(如某款内部应用崩溃次数、浏览器主页被篡改、USB 设备异常接入),可通过以下方式扩展:
- 编写自定义 PowerShell 脚本探测器:例如读取 Windows 事件日志中特定应用的错误事件数,或查询注册表判断配置合规性,再通过 SCOM 的 “Script-Based Performance Rule” 上报为性能计数器
- 利用 SCOM 的“Web 应用程序可用性监控”反向验证终端服务能力:在终端部署轻量 HTTP 服务(如用 Python 启一个健康检查端点),由 SCOM 观察程序节点轮询该端点,间接反映终端网络连通性与基础服务状态
- 结合 Operations Manager 与 Log Analytics(现 Microsoft Sentinel):将终端事件日志转发至 Log Analytics 工作区,用 KQL 编写运维指标查询(如“过去24小时未重启的终端TOP10”),再通过 SCOM 的“External Data Source”集成视图
构建终端运维可视化与告警闭环
避免让终端数据淹没在海量告警中。建议:
- 在 SCOM 控制台创建“终端健康仪表板”,聚合显示:在线率、平均磁盘使用率、最近24小时登录失败总数、未打补丁终端数(需关联 WSUS 或 SCCM 数据)
- 设置分层告警:对单台终端只触发低优先级通知;当同一部门连续5台终端出现相同错误事件(如 Print Spooler 崩溃),自动升级为中优先级并邮件通知桌面支持组
- 利用 SCOM 的“Task”功能,为常见终端问题预置一键修复操作(如远程执行 net stop spooler && net start spooler)











