nginx连接数限制与user-agent过滤是互补的防爬第一道防线:前者用limit_conn/limit_req控并发和请求速率,后者用map+if拦截恶意ua;需配合日志增强、白名单放行及定期更新规则,避免误伤。

Nginx 连接数限制和 User-Agent 过滤是两套互补的防爬策略:前者控“量”,后者辨“质”。单用其一效果有限,组合使用才能构成实用的第一道防线。
连接数限制:防暴力扫描与高频抓取
爬虫常通过短时间建立大量连接或发起密集请求来压测或采集数据。Nginx 的 limit_conn 和 limit_req 模块可直接在配置中生效,无需额外服务。
- 用
limit_conn_zone基于客户端 IP($binary_remote_addr)定义连接数限制区域,例如每 IP 最多保持 10 个并发连接 - 用
limit_req_zone控制请求速率,如每秒最多 5 个请求,允许突发 3 个(burst=3 nodelay) - 把规则放在
server或location块中启用,注意避免对静态资源(如 /static/)误限,可单独配置不启用限流 - 返回状态码建议设为
429 Too Many Requests,比 403 更符合语义,也利于前端或监控系统识别
User-Agent 过滤:拦截低级自动化工具
多数脚本类爬虫不会伪造完整浏览器 UA,或直接暴露工具名(如 python-requests、curl),这类特征极易识别且过滤成本极低。
- 推荐用
map指令在http块预定义黑名单变量(如$blocked_ua),支持忽略大小写的正则匹配(~*) - 覆盖典型恶意模式:空 UA(
^$)、扫描工具名(sqlmap、nuclei、gobuster)、常见爬虫库标识(python-requests、urllib、okhttp) - 在
server块中用if ($blocked_ua) { return 403; }拦截,安全可靠;避免在location内嵌套复杂 if 逻辑 - 慎用泛化关键词(如 bot/spider),否则可能误封百度、谷歌等合规搜索引擎,除非你明确拒绝所有爬虫
日志与响应增强:让防护更可控、更隐蔽
单纯拦截容易暴露策略,加一层可观测性和响应控制能提升实际效果。
- 添加独立日志记录被拦截的 UA:
access_log /var/log/nginx/blocked-ua.log main if=$blocked_ua; - 对确认高危的 UA(如 acunetix、nikto),可用
return 444静默断连,不返回任何响应头,降低攻击者探测反馈 - 在
log_format中加入$http_user_agent和$blocked_ua字段,便于快速筛选和分析异常流量 - 定期更新 UA 规则,参考社区维护的列表(如 nginx-ultimate-bad-bot-blocker),避免黑名单过时失效
注意事项:避免误伤与过度依赖
User-Agent 可轻易伪造,连接数也可绕过(如分布式 IP),所以这两项都不是银弹,而是基础守门员。
- 部分合法工具(Zabbix、Prometheus Alertmanager、CI/CD webhook)也会带明显 UA,需白名单放行
- 手机 App、小程序、某些桌面客户端可能 UA 简洁或缺失,测试时留意是否影响真实用户
- 不要仅靠 UA 过滤做权限控制,敏感操作必须配合登录态、Token 或人机验证
- 上线前务必用
nginx -t检查语法,并用 curl 模拟各类 UA 验证拦截与放行逻辑











