linux下统计网站访问日志常用awk、sort、uniq等shell命令:1. 提取最常访问ip用awk '{print $1}' | sort | uniq -c | sort -nr | head -20;2. 统计url次数需用-f'"'提取请求行再取路径;3. 筛选404错误用awk '$9=="404"{print $1,$7}';4. 按小时汇总需处理$4时间戳并提取小时字段。

Linux 下统计网站访问日志(如 Nginx 或 Apache 的 access.log)常用 Shell 脚本配合标准文本处理工具(awk、sort、uniq、grep 等)实现,无需额外安装语言环境,轻量高效。
提取最常访问的 IP 地址
日志中第一列通常是客户端 IP(Nginx 默认格式),可用 awk 提取并统计频次:
awk '{print $1}' /var/log/nginx/access.log | sort | uniq -c | sort -nr | head -20
说明:
- $1 对应空格分隔后的第一个字段(IP);
- sort | uniq -c 实现去重计数;
- sort -nr 按数字逆序排列(高频在前);
- head -20 限制输出前 20 条。
统计每个请求 URL 的访问次数
Nginx 日志中请求路径在第 7 列(默认 combined 格式),但需注意引号和空格干扰。更稳妥方式是用正则匹配 "GET /xxx HTTP/1.1" 中的路径:
awk -F'"' '{print }' /var/log/nginx/access.log | awk '{print }' | sort | uniq -c | sort -nr | head -15
Linux系统管理专家,覆盖12大模块:用户权限、SSH、存储、网络、systemd、防火墙、日志监控、备份恢复、TLS证书、Ansible、容器、IaC。提供配置、验证、加固、监控、备份、自动化、故障排查、回滚闭环。关键词:useradd、sudo、sshd_config、chmod、SEL...
说明:
- -F'"' 以双引号为分隔符,$2 即引号内的请求行;
- 第二个 awk '{print $2}' 提取该行中的路径部分(如 /api/user);
- 后续同上,排序+计数+取 Top。
筛选指定状态码(如 404 错误)并分析来源
结合 awk 字段过滤可快速定位异常请求:
awk '$9 == "404" {print $1, $7}' /var/log/nginx/access.log | sort | uniq -c | sort -nr | head -10
说明:
- Nginx 日志中状态码默认是第 9 列($9);
- $7 是请求路径,$1 是 IP,一起打印便于关联分析;
- 可替换 "404" 为 "500"、"200" 等做不同统计。
按小时汇总访问量(生成简易趋势)
日志时间戳在第 4 列(如 [10/Jan/2024:14:22:03),提取小时字段后聚合:
awk '{gsub(/\[|:/," ",$4); print $4":"$5}' /var/log/nginx/access.log | sort | uniq -c | sort -nr
说明:
- gsub(/\[|:/," ",$4) 把 [ 和 : 替换为空格,方便后续切分;
- $4 是日期(如 10/Jan/2024),$5 是小时(14),拼成 14:22 可进一步按小时归并(若只要小时,用 print $5 即可);
- 若需精确到每小时总量,建议用 cut -d: -f2 或二次 awk 提取小时再统计。










