用awk计算pv/uv更快,python适合扩展分析;需先确认nginx日志格式,代理场景下应从x-forwarded-for取真实ip;正则解析比split可靠;ipv6和时区处理需特别注意。

直接用 awk 更快,但 Python 适合后续扩展分析逻辑
如果你只是想快速算出 PV(总请求数)和 UV(去重 IP 数),awk '{print $1}' access.log | sort -u | wc -l 一行就能出 UV,wc -l 就是 PV。Python 不是最快的选择,但当你需要按时间窗口聚合、过滤特定路径、识别真实客户端 IP(比如有 X-Forwarded-For)、或对接数据库/告警时,它才真正有用。
关键前提是:别把日志当纯文本硬切,先确认你的 log_format 是标准的还是自定义的。Nginx 默认格式里 $remote_addr 是代理 IP,不是真实用户 IP;如果用了 CDN 或反向代理,得从 $http_x_forwarded_for 提取,且该字段可能含多个 IP,要取最左边那个(除非你明确配置了可信代理链)。
re.match() 解析日志行比 str.split() 更可靠
Nginx 日志字段间是空格分隔,但 URI、Referer、User-Agent 里本身可能含空格,用 split() 会错位。正则才是稳妥做法。以下是一个匹配默认日志格式的 pattern:
import re pattern = r'(?P<ip>[\d\.]+) - (?P<user>[^\s]+) \[(?P<time>[^\]]+)\] "(?P<method>[A-Z]+) (?P<uri>[^"]+) HTTP/[\d\.]+" (?P<status>\d+) (?P<size>\d+) "(?P<referer>[^"]*)" "(?P<ua>[^"]*)"'</ua></referer></size></status></uri></method></time></user></ip>
注意:re.match() 只匹配行首,确保日志每行开头就是 IP;如果日志里有合并写入或带前缀(如 systemd-journal 的时间戳),得先用 line.strip().split(' ', 2)[-1] 剥掉前缀再 match。
常见错误现象:
- 匹配失败 → 检查日志是否启用了
escape=json或自定义 format(比如加了$request_id) - IP 字段为空 → 实际是
-,说明 Nginx 没收到有效 remote_addr,可能是健康检查请求或异常连接 - UA 字段截断 → 日志中 UA 被双引号包裹,但内容里有未转义的双引号,这时正则会提前终止;建议改用
re.search()并放宽 UA 捕获组为"([^"]*)"(不推荐)或直接放弃解析 UA
统计 UV 时,set 存 IP 不够,要考虑 IPv6 和代理头
单纯用 set.add(line_dict['ip']) 会漏掉真实用户。必须判断是否走代理:
- 如果请求头含
X-Forwarded-For且非空,取其第一个 IP(ips = line_dict.get('x_forwarded_for', '').split(',')[0].strip()) - 若没有该头,才 fallback 到
remote_addr - IPv6 地址(如
2001:db8::1)会被正常加入 set,无需特殊处理,但要注意日志中 IPv6 可能被方括号包裹([2001:db8::1]),需先去掉
性能影响:对千万级日志,set 查重内存占用约 1–2 GB(取决于 IP 字符串长度和数量),比 collections.Counter 省内存;如果只关心 Top 100 UV,可用 heapq.nlargest(100, counter.items(), key=lambda x: x[1]) 避免全量排序。
用 datetime.strptime() 解析时间字段容易报错,优先用 dateutil.parser
Nginx 默认时间格式是 DD/MMM/YYYY:HH:MM:SS +0800(如 10/Dec/2023:14:32:11 +0800),strptime() 要写 %d/%b/%Y:%H:%M:%S %z,但 %b 依赖系统 locale,中文环境可能崩。更稳的方式是:
from dateutil import parser dt = parser.parse(time_str) # 自动识别 "10/Dec/2023:14:32:11 +0800"
但 dateutil 是第三方包,线上没装就失败。折中方案:用正则提取年月日时分秒,拼成 ISO 格式再用 datetime.fromisoformat()(Python 3.7+):
import re
m = re.match(r'(\d+)/(\w+)/(\d+):(\d+):(\d+):(\d+)', time_str)
if m:
day, mon, year, h, m, s = m.groups()
# 手动映射 mon → month number,或直接用 datetime.strptime(..., '%d/%b/%Y:%H:%M:%S') + try/except
真正容易被忽略的是时区。Nginx 日志里的 +0800 是 UTC 偏移,但 parser.parse() 返回带 tzinfo 的 datetime;如果你要做小时级聚合,务必统一转成 UTC 或本地时区,否则跨时区服务器日志会错乱。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











