生产环境端口变更监控系统通过exporter采集、prometheus建模、ansible闭环响应及grafana可视化实现端口状态的可采集、可比对、可告警、可追溯;核心是将端口变化转化为带时间戳的时序事件,持续记录“谁在什么时候打开了什么端口”,并自动识别异常新增或关闭。

构建生产环境网络端口变更监控系统,核心是把“端口状态变化”变成可采集、可比对、可告警、可追溯的时序事件——不是只看当前开了哪些端口,而是持续记录“谁在什么时候打开了什么端口”,并自动识别异常新增或关闭。
一、用Exporter持续采集端口状态
单纯靠netstat或ss命令快照不可靠,需固化为稳定指标。推荐组合使用:
-
node_exporter + 自定义文本文件收集器(textfile collector):在每台主机上定期执行
ss -tuln | awk '{print $1,$5}' | sort | sha256sum,将结果写入/var/lib/node_exporter/textfile/port_state.prom,内容形如host_port_state_hash{instance="web01"} 1.23456789e+09。Prometheus按分钟级抓取,哈希值变化即代表端口列表变动。 -
blackbox_exporter 主动探测关键端口:配置
modules对已知业务端口(如80、443、8080、22)做TCP探活,同时对“不应开放”的高危端口(如23、135、445、3389)做反向探测——若某台机器突然响应了445端口,即触发异常信号。 -
process_exporter 监控监听进程:启用
--procnames='.*',抓取process_open_fds和process_net_tcp_listen等指标,结合process_name标签,能定位到是哪个进程(如nginx、java、python3)在监听哪个端口。
二、用Prometheus建模“端口变更”事件
不能只依赖瞬时值,要构造“变化检测”逻辑:
手动 Telegram 斜杠命令,用于查看 Codex 状态及使用情况。用户发送 /codex_usage、/codex_usage default、/codex_usage all 等时触发。
- 用
changes()函数识别哈希值突变:changes(host_port_state_hash[1h]) > 0表示过去1小时内端口列表至少变过一次;搭配count_over_time()可统计变更频次,避免高频毛刺误报。 - 用
absent()和present_over_time()捕捉“消失”与“首次出现”:absent(process_net_tcp_listen{port="6379"}[30m])表示Redis端口连续30分钟未被监听,可能服务宕机;count(count_over_time(process_net_tcp_listen{port="8081"}[10m])) == 1表示该端口在10分钟窗口内首次出现,属于新开放行为。 - 所有规则加
for: 90s,确保变更持续存在而非瞬时抖动;labels中必须带instance、job、port,便于后续精准定位。
三、用Ansible实现变更闭环响应
告警不是终点,而是自动化响应的起点。Alertmanager不直连Ansible,而是通过轻量Webhook服务中转:
- 编写标准化Playbook,如
port-audit.yml:接收host和port参数,自动执行ss -tulnp | grep :{{ port }}、ps aux --forest | grep {{ pid }}、systemctl list-units --type=service --state=running | grep -i related,并将输出存入安全日志中心。 - 高风险变更(如非白名单端口+root权限进程)触发
isolate-port.yml:调用iptables -I INPUT -p tcp --dport {{ port }} -j DROP临时封禁,并邮件通知责任人;同时修改Ansible inventory中该主机的port_whitelist变量,下次部署自动校验。 - 所有剧本强制启用
--check模式预检,并在vars_prompt中要求输入变更原因,留痕可审计。
四、可视化与基线管理
光有告警不够,要让运维一眼看出“哪里变了、变了多少、是否合理”:
- Grafana仪表盘中建两个核心视图:左侧是“端口变更热力图”,X轴为时间、Y轴为
instance,格子颜色深浅代表changes(host_port_state_hash[1d])数值;右侧是“端口生命周期图”,用堆叠条形图展示每个端口在各主机上的存活天数,新出现的端口标为亮黄色。 - 用Ansible定期生成端口基线:
ansible webservers -m shell -a "ss -tuln | awk '{print \$5}' | sort | uniq" > /opt/ansible/baselines/port-baseline-{{ ansible_date }}.txt,Git提交存档。Prometheus告警可引用最近一次基线哈希,方便回溯对比。 - 在Grafana中嵌入
port-audit执行结果链接,点击告警直接跳转到对应主机的最新审计报告页面。










