apache中用rewrite拦截恶意爬虫需启用mod_rewrite模块,通过rewritecond匹配user-agent、referer或ip等特征,再用rewriterule返回403;配置须置于.htaccess或虚拟主机directory块内,注意规则顺序与生效范围,并测试验证。

在 Linux 的 Apache 中用 Rewrite 拦截恶意爬虫,核心是靠 mod_rewrite 模块结合 RewriteCond 判断请求特征(如 User-Agent、Referer、IP 或访问路径),再用 RewriteRule 返回 403 禁止响应。操作简单但需注意语法位置和生效范围。
确保 mod_rewrite 已启用
先确认模块已加载:
- 运行
a2enmod rewrite(Debian/Ubuntu)或检查httpd.conf中是否启用了LoadModule rewrite_module modules/mod_rewrite.so(CentOS/RHEL) - 重启 Apache:
systemctl restart apache2或systemctl restart httpd - 确保站点配置或
.htaccess文件所在目录允许重写(AllowOverride All或至少AllowOverride FileInfo)
按 User-Agent 拦截已知爬虫
很多恶意爬虫的 UA 包含明显关键词(如 sqlmap、nikto、wget、curl、scrapy),可直接匹配屏蔽:
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} "sqlmap|nikto|wget|curl|scrapy|masscan|nuclei|dirbuster" [NC]
RewriteRule ^ - [F]
-
[NC]表示不区分大小写 -
^匹配任意请求路径,-表示不重写,[F]直接返回 403 - 建议放在
.htaccess根目录,或虚拟主机配置的<directory></directory>块内
按 Referer 拦截盗链或非授权来源
若发现图片、JS、CSS 被大量外部站直接引用,可限制 Referer:
RewriteEngine On
RewriteCond %{HTTP_REFERER} !^$
RewriteCond %{HTTP_REFERER} !^https?://(www\.)?yourdomain\.com [NC]
RewriteRule \.(jpg|jpeg|png|gif|js|css|webp)$ - [F]
- 第一行排除空 Referer(部分浏览器或直接访问可能为空)
- 第二行只允许你自己的域名(支持 http/https 和 www 变体)
- 第三行针对常见静态资源后缀拦截,避免被刷带宽
按 IP 或 IP 段临时封禁高频异常请求
配合日志分析,把扫描频繁或返回 404 过多的 IP 加入黑名单:
RewriteEngine On
RewriteCond %{REMOTE_ADDR} ^(192\.168\.10\.123|203\.0\.113\.45|113\.73\.43\.155)$ [OR]
RewriteCond %{REMOTE_ADDR} ^183\.31\.185\.
RewriteRule ^ - [F]
-
[OR]用于连接多个条件;末尾无[OR]的条件默认为 AND - 支持精确 IP 和前缀匹配(如
^183\.31\.185\.封整个 C 段) - 长期大量封 IP 建议改用
mod_evasive或防火墙(iptables/nftables),避免 Rewrite 规则膨胀
不复杂但容易忽略:规则顺序很重要,靠前的条件会优先匹配;测试时建议先用 RewriteLog(Apache 2.2)或 LogLevel alert rewrite:trace3(Apache 2.4+)查日志验证逻辑是否命中。上线前务必备份原配置,并用 curl 模拟恶意 UA 测试是否真返回 403。










