构建nginx标准运维体系核心在于监控可观测、日志可管理、故障可追溯闭环:启用stub_status暴露真实负载指标,用logrotate实现零中断日志切割,按请求生命周期分层定位502/504等错误,并通过goaccess和健康端点增强可视化与预警。

要在 Nginx 中构建一套真正可用的标准运维体系,核心不是堆工具,而是让监控可观测、日志可管理、故障可追溯三者形成闭环。重点在于:监控指标要能反映真实负载,日志切割不能中断服务,错误定位要从请求链路出发,而不是靠重启碰运气。
一、启用基础监控:用 stub_status 搭建轻量级实时仪表盘
NGINX 自带的 ngx_http_stub_status_module 是最直接的“心跳探针”,无需额外依赖,就能暴露连接数、请求数、处理状态等关键指标:
- 确认模块已启用:
nginx -V 2>&1 | grep -o with-http_stub_status_module,有输出即支持 - 在任意 server 块(建议放在 HTTPS 或内网专用 server)中添加:
location /status {
stub_status on;
access_log off;
allow 127.0.0.1;
allow 10.10.0.0/16; # 办公网段可选
deny all;
} - 访问
https://your-domain/status可得三行数据:
Active connections: 当前活跃连接数(含 waiting)
server accepts handled requests: 接收/成功处理/总请求数(三者应趋近,若 handled 远小于 accepts,说明 worker 阻塞或丢请求)
Reading/Writing/Waiting: 各阶段连接数,Waiting 高通常意味着 keepalive 复用充分;Writing 长时间居高,可能后端响应慢或网络卡顿
二、日志自动切割:用 logrotate 实现零停机归档
不推荐在 nginx.conf 里写 shell 脚本切割,既难维护又易出错。标准做法是交由系统级日志轮转工具 logrotate 管理:
- 创建配置文件:
/etc/logrotate.d/nginx,内容如下: /var/log/nginx/*.log {
daily
missingok
rotate 30
compress
delaycompress
sharedscripts
postrotate
if [ -f /var/run/nginx.pid ]; then
kill -USR1 `cat /var/run/nginx.pid`
fi
endscript
} - 关键点说明:
✔kill -USR1是 Nginx 的优雅重开日志信号,worker 进程会立即关闭旧文件句柄、打开新文件,全程服务不中断
✔sharedscripts确保所有日志只执行一次 postrotate,避免重复发信号
✔delaycompress延迟压缩上一轮日志,方便排查时快速读取明文 - 手动触发测试:
logrotate -f /etc/logrotate.d/nginx,检查/var/log/nginx/access.log是否变为空,同时生成access.log.1
三、故障快速定位:按请求生命周期分层查错
遇到 502/504/499 等错误,不要先看 error.log,而应顺着请求路径逐层验证:
-
客户端层:用
curl -v http://host/path看响应头与耗时,确认是否超时或被拦截 -
Nginx 层:
- 查 access.log 中对应时间戳的请求行,关注
$status、$upstream_status、$request_time、$upstream_response_time - 若
$upstream_status为空或为 “-”,说明根本没转发出去(可能是 upstream 定义错误、DNS 解析失败、或 proxy_pass 写错) - 若
$upstream_response_time为 “-” 但$request_time很大,问题在 Nginx 本身(如 rewrite 循环、limit_req 触发延迟、SSL 握手慢)
- 查 access.log 中对应时间戳的请求行,关注
-
上游层:根据 access.log 中的
$upstream_addr,直接 telnet 或 curl 对应后端地址,验证其连通性与响应速度 -
系统层:当怀疑资源瓶颈时,同步运行:
ss -s(看 socket 统计)cat /proc/sys/fs/file-nr(看已分配文件句柄数)journalctl -u nginx --since "2 minutes ago"(查 systemd 启动异常)
四、进阶加固:加一层可视化与预警
基础能力到位后,建议补充两项低成本增强:
-
GoAccess 实时分析:安装后执行
goaccess /var/log/nginx/access.log -o /usr/share/nginx/html/report.html --real-time-html,浏览器打开即可看到访客地域、TOP URL、响应状态分布,适合快速感知异常流量 -
简易健康检查端点:在 server 块中加一个 location,返回固定内容并检查后端存活:
location /healthz {
return 200 'OK\n';
add_header Content-Type text/plain;
}
配合 Prometheus + node_exporter,可将 stub_status 输出解析为指标,实现 CPU、内存、连接数联动告警











