应使用Shell脚本实时监控Nginx error.log中的upstream timed out、Connection refused等超时错误,通过tail -F与awk按60秒窗口统计次数,超阈值触发告警;或用cron每分钟快照统计,兼顾稳定性与调试性。

监控 Nginx 代理超时错误(如 upstream timed out、Connection refused、Operation timed out)的发生频率,关键在于从 error.log 中实时捕获相关错误行,并按时间窗口统计其出现次数。Shell 脚本可轻量实现,无需额外组件,适合快速部署和告警集成。
明确要捕获的典型超时错误模式
Nginx error.log 中常见的代理超时类错误包括:
-
upstream timed out(最常见,对应 proxy_read_timeout 或 proxy_connect_timeout 触发) upstream connect timeout-
Connection refused(后端进程宕机或端口未监听) -
Operation timed out(系统级连接超时) -
no live upstreams(所有上游节点已被摘除)
建议先用 grep -i "timeout\|refused\|upstream.*no live" /var/log/nginx/error.log | tail -50 快速确认当前日志中实际出现的错误文本格式,避免正则不匹配漏报。
用 tail -F + awk 实现实时滚动计数
以下脚本每 60 秒输出一次过去 60 秒内超时错误总次数(支持日志轮转):
#!/bin/bash
LOG="/var/log/nginx/error.log"
WINDOW=60 # 统计窗口(秒)
THRESHOLD=3 # 触发告警的最小次数
<h1>获取当前时间戳(秒)</h1><p>now=$(date +%s)</p><h1>实时读取新增日志行,过滤超时关键词,提取时间戳并判断是否在窗口内</h1><p>tail -F "$LOG" 2>/dev/null | \
awk -v now="$now" -v window="$WINDOW" '
function parse_time(str, a, t) {</p><h1>匹配 error.log 默认时间格式:2024/09/25 14:22:38</h1><pre class="brush:php;toolbar:false;">if (match(str, /^[0-9]{4}\/[0-9]{2}\/[0-9]{2} [0-9]{2}:[0-9]{2}:[0-9]{2}/)) {
t = substr(str, RSTART, 19)
gsub(/[:\/ ]/, " ", t)
cmd = "date -d \"" t "\" +%s 2>/dev/null"
cmd | getline ts
close(cmd)
return (ts > 0 && ts >= now - window)
}
return 0} /timeout|refused|no live upstreams|Operation timed out/ && parse_time($0) { count++ } END { print "timeout_errors:", count }' 2>/dev/null | \ while read key val; do if [[ "$key" == "timeout_errors:" ]] && [[ "$val" -ge "$THRESHOLD" ]]; then echo "$(date): ALERT — $val proxy timeout errors in last $WINDOW seconds!"
此处可加入:mail -s "Nginx Timeout Spike" admin@example.com # 或 curl -X POST -d "text=Nginx timeout spike: $val" https://hooks.slack.com/...
fi
done
注意:该脚本依赖系统 date -d 支持解析标准时间格式;若日志使用自定义时间格式(如 ISO8601),需同步调整 awk 中的正则与解析逻辑。
Linux 性能分析与调优专家,覆盖 CPU、内存、磁盘 I/O、网络、内核参数、编译优化、容器/K8s。适用场景:系统卡顿/高负载、内存不足/OOM/Swap 高、CPU 异常/iowait 高。
配合定时任务做分钟级快照统计
若不需实时流式处理,也可用 cron 每分钟执行一次快照统计,更稳定且易调试:
- 新建脚本
/usr/local/bin/check_nginx_timeout.sh,内容为:
#!/bin/bash LOG="/var/log/nginx/error.log" CUTOFF=$(date -d '1 minute ago' '+%Y/%m/%d %H:%M:[0-5][0-9]') COUNT=$(grep -E "timeout|refused|no live upstreams" "$LOG" 2>/dev/null | grep -E "$CUTOFF" | wc -l) <p>if [[ "$COUNT" -ge 5 ]]; then echo "$(date): $COUNT timeout-related errors in last minute" | logger -t nginx-monitor</p><h1>发送邮件或调用告警接口</h1><p>fi </p>
- 添加 crontab:
* * * * * /usr/local/bin/check_nginx_timeout.sh
此方式兼容 logrotate,因每次只读当前主日志文件,不依赖 tail 的文件句柄保持。
排查根源时需联动检查的配置项
高频超时错误往往暴露后端或 Nginx 配置问题,发现异常后应立即核对:
-
proxy_connect_timeout和proxy_read_timeout是否过短(建议至少设为后端平均响应时间的 2–3 倍) -
upstream块中max_fails和fail_timeout是否导致节点被误摘除 - 后端服务是否真实响应缓慢或 OOM;可用
curl -w "@format.txt" -o /dev/null -s http://backend-ip:port/health验证 - 系统资源:
ss -s查看连接数是否打满,dmesg | tail看有无 TCP 丢包或内存不足提示
脚本只是信号探测器,真正解决问题要回到超时发生的完整链路。










