答案是使用bufferedreader逐行读取nginx日志并用预编译正则匹配,提取ip、时间、请求行、状态码等字段;需处理“-”占位符、编码、截断等边界情况,并二次解析request字段获取方法、路径和协议。

用 BufferedReader 读取 Nginx 访问日志时,核心是「逐行读取 + 正则匹配」,关键在于日志格式固定、正则需覆盖常见字段(如 IP、时间、请求行、状态码、大小等),且要处理转义和分组捕获。
明确 Nginx 日志默认格式并写对应正则
Nginx 默认 log_format 是:log_format main '$remote_addr - $remote_user [$time_local] "$request" $status $body_bytes_sent "$http_referer" "$http_user_agent" "$http_x_forwarded_for"';
对应典型日志行示例:192.168.1.100 - - [10/Jan/2024:14:23:15 +0800] "GET /api/user?id=123 HTTP/1.1" 200 1245 "https://example.com/" "Mozilla/5.0 (Macintosh)" "-"
推荐使用带命名组的正则(Java 7+ 支持),更易维护:
String pattern = "^([^\s]+) - ([^\s]+) \[([^[\]]+)\] "([^"]+)" (\d+) (\d+|-) "([^"]*)" "([^"]*)" "([^"]*)"$";
各组含义:
• $1 → remote_addr(客户端 IP)
• $2 → remote_user(通常为 "-")
• $3 → time_local(原始时间字符串)
• $4 → request(如 GET /api/user?id=123 HTTP/1.1)
• $5 → status(状态码)
• $6 → body_bytes_sent(响应体字节数,可能为 "-")
• $7 → http_referer
• $8 → http_user_agent
• $9 → http_x_forwarded_for
用 BufferedReader 逐行读取并匹配
不要一次性加载全部日志(大文件易 OOM),用 readLine() 流式处理:
- 用
try-with-resources自动关闭流 - 每行调用
Pattern.matcher(line).find()判断是否匹配 - 匹配成功后用
matcher.group("name")或matcher.group(1)提取字段 - 对可能为空或 "-" 的字段(如
body_bytes_sent)做空值/占位符判断
示例代码片段:
Pattern p = Pattern.compile(pattern);
try (BufferedReader reader = Files.newBufferedReader(Paths.get("access.log"))) {
String line;
while ((line = reader.readLine()) != null) {
Matcher m = p.matcher(line);
if (m.find()) {
String ip = m.group(1);
String time = m.group(3);
String request = m.group(4);
int status = Integer.parseInt(m.group(5));
String sizeStr = m.group(6);
long size = "-".equals(sizeStr) ? 0 : Long.parseLong(sizeStr);
// 后续处理...
}
}
}
提取 request 字段中的 HTTP 方法、路径、协议
group(4) 是完整请求行(如 "GET /api/user?id=123 HTTP/1.1"),需二次解析:
- 用简单空格分割(注意:路径含空格时会出错,但标准 HTTP 请求路径不含空格)
- 更稳妥方式是再套一个正则:
"^(\w+)\s+([^\s]+)\s+HTTP/(\d\.\d)$" - 若需解析 query 参数(如
id=123),可用java.net.URLDecoder.decode()+ 手动拆分,或引入URLEncodedUtils(Apache HttpClient)
例如:
String req = m.group(4);
Matcher reqM = Pattern.compile("^(\w+)\s+([^\s]+)\s+HTTP/(\d\.\d)$").matcher(req);
if (reqM.find()) {
String method = reqM.group(1); // GET
String path = reqM.group(2); // /api/user?id=123
String proto = reqM.group(3); // 1.1
}
注意边界情况与性能优化
真实日志中常有干扰项,需防御性处理:
- 日志行可能被截断、含非 UTF-8 字符(建议指定 charset:
Files.newBufferedReader(path, StandardCharsets.UTF_8)) - 某些字段含引号或空格(如 User-Agent 中的括号、版本号),当前正则已用
[^"]*容错 - 高吞吐场景下,预编译
Pattern(避免重复编译),复用Matcher实例(调用matcher.reset(line)) - 若需时间解析,用
DateTimeFormatter处理group(3)(格式如dd/MMM/yyyy:HH:mm:ss Z)
不复杂但容易忽略。
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南











