如何在Linux中配置Nginx的防爬虫策略 Linux拦截异常访问的方法

千磊君_6631

千磊君_6631

2026-05-30

469人浏览

原创

nginx防爬虫必须组合ua拦截+限流+robots.txt+白名单兜底,否则易漏拦或误杀;if匹配ua须置于server块顶层,不可嵌套location内,空ua需用= ""单独匹配,robots.txt须用location = /robots.txt精确配置。

如何在linux中配置nginx的防爬虫策略 linux拦截异常访问的方法

直接结论:Nginx 防爬虫不能只靠 UA 黑名单,必须组合 use-agent 拦截 + 限流 + robots.txt 控制 + 白名单兜底,否则要么漏拦、要么误杀。

if ($http_user_agent ~* "Scrapy") 必须放在 server 块顶层

Nginx 的 if 在 location 内部是“伪生效”——它可能被后续配置覆盖,或因执行顺序异常而跳过。官方明确不推荐嵌套使用。

  • 正确位置:紧贴 server { 下方,listen 和 server_name 之后,所有 location 之前
  • 错误写法:location /api { if ($http_user_agent ~* "curl") { return 403; } } —— 这条规则大概率被忽略
  • 大小写处理用 ~*(不区分),避免漏掉 python-urllib 和 Python-urllib
  • 空 UA 要单独匹配:if ($http_user_agent = "") { return 403; },不能用正则

robots.txt 返回内容必须用 location = /robots.txt 精确匹配

写成 location /robots.txt 会意外匹配 /robots.txt.bak 或 /robots.txt/xxx,导致返回错误内容甚至泄露路径。

Browser Setup (No-Root Linux)
Browser Setup (No-Root Linux)

在无 root/sudo 权限的环境(云容器、VPS、隔离主机)中安装并配置 OpenClaw 浏览器工具的 headless Chrome。适用场景:...

下载
  • 必须加等号:location = /robots.txt
  • 设 MIME 类型:default_type text/plain;,再补一句 add_header Content-Type "text/plain; charset=UTF-8"; 更保险
  • 换行只能用 LF(\n),Windows 的 \r\n 会让部分爬虫解析失败
  • 顺序很重要:若要只屏蔽百度、搜狗,其他放行,必须把具体 UA 放前面,最后才是 User-Agent: *,否则 * 会提前终止匹配

limit_req 是防高频爬虫的核心,burst 和 nodelay 要按场景选

单纯封 UA 只能拦住“懒爬虫”,真正消耗资源的是每秒几十次请求的自动化脚本。这时候 limit_req 才是主力。

  • 定义区要放 http 块:limit_req_zone $binary_remote_addr zone=ip_limit:10m rate=5r/s;($binary_remote_addr 比 $remote_addr 节省内存)
  • 在 location 中启用:limit_req zone=ip_limit burst=10 nodelay;
  • burst=10 表示允许瞬时最多 15 次请求(基础 5 + 缓冲 10),nodelay 让这 10 次立刻处理,不排队;不加它就会延迟响应,影响真实用户
  • 登录接口建议 burst=0,彻底禁止连试;静态资源可设 rate=100r/s 防止页面加载卡顿

白名单比黑名单更可靠,尤其对监控和搜索引擎

盲目封禁含 bot、spider 的 UA,会直接阻断 Googlebot、Applebot、Zabbix、Prometheus 等合法流量,后果比爬虫还严重。

  • 先建白名单变量:map $http_user_agent $is_allowed_ua { default 0; "~*Googlebot|Bingbot|YandexBot|Applebot|Twitterbot|Github-Hookshot|GitLab-CI|Zabbix|Prometheus" 1; }
  • 再结合拦截:if ($is_allowed_ua = 0) { if ($http_user_agent ~* "(Scrapy|Python-urllib|HeadlessChrome)") { return 444; } }
  • 注意:两个 if 嵌套在 Nginx 里是允许的,但仅限于这种“先查白名单、再查黑名单”的线性判断
  • return 444 比 403 更干净(不发任何字节),但调试期建议先用 403,避免 curl 报 “Connection reset” 无法定位问题

最易被忽略的一点:所有 UA 拦截规则都必须配合日志字段,否则你根本不知道谁被拦了、为什么拦。至少加 $http_user_agent 到 log_format,不然出了问题只能盲猜。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

linux nginx 爬虫

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
nginx 重启
nginx 重启

nginx重启对于网站的运维来说是非常重要的,根据不同的需求,可以选择简单重启、平滑重启或定时重启等方式。本专题为大家提供nginx重启的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.27

383

5

nginx 配置详解
nginx 配置详解

Nginx的配置是指设置和调整Nginx服务器的行为和功能的过程。通过配置文件,可以定义虚拟主机、HTTP请求处理、反向代理、缓存和负载均衡等功能。Nginx的配置语法简洁而强大,允许管理员根据自己的需要进行灵活的调整。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3327

6

nginx配置详解
nginx配置详解

NGINX与其他服务类似,因为它具有以特定格式编写的基于文本的配置文件。本专题为大家提供nginx配置相关的文章,大家可以免费学习。

2023.08.04

6005

6

tomcat和nginx有哪些区别
tomcat和nginx有哪些区别

tomcat和nginx的区别:1、应用领域;2、性能;3、功能;4、配置;5、安全性;6、扩展性;7、部署复杂性;8、社区支持;9、成本;10、日志管理。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.02.23

561

5

nginx报404怎么解决
nginx报404怎么解决

当访问 nginx 网页服务器时遇到 404 错误,表明服务器无法找到请求资源,可以通过以下步骤解决:1. 检查文件是否存在且路径正确;2. 检查文件权限并更改为 644 或 755;3. 检查 nginx 配置,确保根目录设置正确、没有冲突配置等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.07.09

1476

5

Nginx报404错误解决方法
Nginx报404错误解决方法

解决方法:只需要加上这段配置:try_files $uri $uri/ /index.html;即可。想了解更多Nginx的相关内容,可以阅读本专题下面的文章。

2024.08.07

3938

3

nginx部署php项目教程汇总
nginx部署php项目教程汇总

本专题整合了nginx部署php项目教程汇总,阅读专题下面的文章了解更多详细内容。

2026.01.13

122

12

nginx配置文件详细教程
nginx配置文件详细教程

本专题整合了nginx配置文件相关教程详细汇总,阅读专题下面的文章了解更多详细内容。

2026.01.13

457

23

Nginx跨平台安装实操指南:Windows、macOS与Linux环境快速搭建
Nginx跨平台安装实操指南:Windows、macOS与Linux环境快速搭建

本指南详解Nginx在Windows、macOS及Linux系统的安装全流程。涵盖官方包解压、Homebrew一键部署、APT/YUM源配置及Docker容器化方案。无论新手或开发者,均可快速搭建运行环境,掌握跨平台核心指令,为后续配置与调优奠定坚实基础。

2026.03.16

159

12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Buffalo框架快速入门指南
Buffalo框架快速入门指南

共0课时 | 0人学习

Valgrind支持平台说明
Valgrind支持平台说明

共0课时 | 0人学习