Linux怎么配置Nginx禁止搜索引擎爬虫 Nginx机器人规则设置详解

老萱君_6106

老萱君_6106

2026-04-30

780人浏览

原创

最轻量可靠的方式是在nginx中用location = /robots.txt精确匹配并return返回内容;需设default_type text/plain、add_header确保mime正确;换行用lf;屏蔽特定爬虫要按“具体到泛化”顺序逐条声明user-agent;恶意爬虫需用if+正则ua硬拦截或limit_req行为限流。

linux怎么配置nginx禁止搜索引擎爬虫 nginx机器人规则设置详解

直接在 Nginx 配置里返回 robots.txt 内容是最轻量、最可靠的方式,不用碰磁盘文件,也不依赖后端或 Docker 容器内改动。

location =/robots.txt 必须用精确匹配

写成 location /robots.txt 会匹配所有以 /robots.txt 开头的路径(比如 /robots.txt.bak 或 /robots.txt/xxx),导致意外覆盖或返回错误内容。必须加等号,强制精确匹配:

location = /robots.txt {
    default_type text/plain;
    add_header Content-Type "text/plain; charset=UTF-8";
    return 200 "User-Agent: *\nDisallow: /";
}
  • default_type text/plain 比 text/html 更准确,避免浏览器误解析
  • add_header 是冗余但保险的做法——有些客户端(如旧版 curl)不信任 default_type 推断的 MIME 类型
  • \n 必须是 Unix 换行符(LF),Windows 的 \r\n 会导致部分爬虫解析失败

禁止特定搜索引擎要单独声明 User-Agent

只写 User-Agent: * 无法区分对待百度、Google 等友好爬虫。如果只想屏蔽某些 bot,而允许其他爬虫(比如用于监控的健康检查 bot),就得逐条声明:

Linux installer
Linux installer

先解析安全源,运行本地CLI安装、启动、卸载Linux桌面应用。用户请求时使用。

下载
location = /robots.txt {
    default_type text/plain;
    return 200 "User-Agent: Baiduspider\nDisallow: /\nUser-Agent: YisouSpider\nDisallow: /\nUser-Agent: Sogou web spider\nDisallow: /\nUser-Agent: *\nDisallow: /";
}
  • 顺序重要:User-Agent 块必须按“从具体到泛化”排列,否则 * 会提前截断匹配
  • 每行末尾不能有多余空格,Disallow: 后面必须跟一个空格再跟路径
  • 不支持注释,任何 # 或 // 都会被当成内容返回,破坏协议格式

if ($http_user_agent) 匹配 UA 是补充手段,不是替代方案

robots.txt 是君子协议,只对守规矩的爬虫有效;真正恶意的爬虫会直接绕过它,继续请求页面。这时需要用 if + 正则匹配 UA 字符串来硬拦截:

if ($http_user_agent ~* "Scrapy|Python-urllib|Apache-HttpClient|HeadlessChrome") {
    return 403;
}
  • 必须加 ~*(大小写不敏感),否则 Googlebot 和 googlebot 就不匹配
  • 放在 server 块顶层,不要嵌套在 location 里——Nginx 的 if 在 location 内行为不可靠
  • 注意性能:每条请求都会执行正则,UA 列表太长(>20 项)会影响吞吐,建议先用 map 提前归类

limit_req 对爬虫频率限制比 UA 匹配更有效

很多现代爬虫(比如用 Puppeteer 或 Playwright 的)UA 和真人一模一样,光靠字符串匹配毫无意义。这时候真正的防线是行为控制:

limit_req_zone $binary_remote_addr zone=spider:10m rate=2r/s;
server {
    location / {
        limit_req zone=spider burst=5 nodelay;
    }
}
  • rate=2r/s 不是“每秒最多 2 次”,而是“平均每秒 2 次”,burst=5 允许突发 5 次,之后才限流
  • 别用 $http_user_agent 当 key——UA 可伪造,$binary_remote_addr 更难绕过
  • 这个配置对真实用户几乎无感,但会让高并发爬虫大量触发 503 或 429,显著抬高其成本

最常被忽略的一点:Nginx 的 return 指令在 location = /robots.txt 中生效,但如果你用了 try_files 或 proxy_pass,且没把这段配置放在它们之前,请求就会被代理走,根本不会走到 return 这一步。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

linux nginx 爬虫 搜索引擎

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
nginx 重启
nginx 重启

nginx重启对于网站的运维来说是非常重要的,根据不同的需求,可以选择简单重启、平滑重启或定时重启等方式。本专题为大家提供nginx重启的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.27

383

5

nginx 配置详解
nginx 配置详解

Nginx的配置是指设置和调整Nginx服务器的行为和功能的过程。通过配置文件,可以定义虚拟主机、HTTP请求处理、反向代理、缓存和负载均衡等功能。Nginx的配置语法简洁而强大,允许管理员根据自己的需要进行灵活的调整。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3307

6

nginx配置详解
nginx配置详解

NGINX与其他服务类似,因为它具有以特定格式编写的基于文本的配置文件。本专题为大家提供nginx配置相关的文章,大家可以免费学习。

2023.08.04

5985

6

tomcat和nginx有哪些区别
tomcat和nginx有哪些区别

tomcat和nginx的区别:1、应用领域;2、性能;3、功能;4、配置;5、安全性;6、扩展性;7、部署复杂性;8、社区支持;9、成本;10、日志管理。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.02.23

561

5

nginx报404怎么解决
nginx报404怎么解决

当访问 nginx 网页服务器时遇到 404 错误,表明服务器无法找到请求资源,可以通过以下步骤解决:1. 检查文件是否存在且路径正确;2. 检查文件权限并更改为 644 或 755;3. 检查 nginx 配置,确保根目录设置正确、没有冲突配置等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.07.09

1476

5

Nginx报404错误解决方法
Nginx报404错误解决方法

解决方法:只需要加上这段配置:try_files $uri $uri/ /index.html;即可。想了解更多Nginx的相关内容,可以阅读本专题下面的文章。

2024.08.07

3938

3

nginx部署php项目教程汇总
nginx部署php项目教程汇总

本专题整合了nginx部署php项目教程汇总,阅读专题下面的文章了解更多详细内容。

2026.01.13

122

12

nginx配置文件详细教程
nginx配置文件详细教程

本专题整合了nginx配置文件相关教程详细汇总,阅读专题下面的文章了解更多详细内容。

2026.01.13

457

23

Nginx跨平台安装实操指南:Windows、macOS与Linux环境快速搭建
Nginx跨平台安装实操指南:Windows、macOS与Linux环境快速搭建

本指南详解Nginx在Windows、macOS及Linux系统的安装全流程。涵盖官方包解压、Homebrew一键部署、APT/YUM源配置及Docker容器化方案。无论新手或开发者,均可快速搭建运行环境,掌握跨平台核心指令,为后续配置与调优奠定坚实基础。

2026.03.16

159

12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Buffalo框架快速入门指南
Buffalo框架快速入门指南

共0课时 | 0人学习

Valgrind支持平台说明
Valgrind支持平台说明

共0课时 | 0人学习