单实例splash因默认仅20并发slot且共享webkit进程,超并发即排队导致503或超时;需通过docker compose扩容+ngxin负载均衡、禁用图片、adblock过滤、lua脚本提取字段、scrapy槽位隔离与重试控制优化。

为什么单实例Splash扛不住高并发
当你用 docker run -p 8050:8050 scrapinghub/splash 启动一个 Splash 实例,默认只有 20 个并发 slot(见日志里的 slots=20),且所有请求共享同一 WebKit 进程。一旦并发请求超过这个数,后续请求会排队等待,超时概率飙升,503 Service Unavailable 或 timeout 错误频繁出现。
横向扩容:Docker Compose 部署 Splash 集群
别硬扛,直接扩实例。用 Docker Compose 启动多个 Splash 容器,再加一层负载均衡——不用写代码,用 Nginx 就够了。
- 每个容器指定不同端口(如 8051、8052…)并设置
--max-concurrent-requests=30参数提升单实例吞吐 - Nginx 配置
upstream做轮询或 least_conn 负载分发,后端指向所有 Splash 实例 - Python 请求时统一发往 Nginx 地址(如
http://localhost:8080/render.html),不再直连单个端口
示例 Nginx 配置片段:
upstream splash_cluster {
least_conn;
server localhost:8051;
server localhost:8052;
server localhost:8053;
}
server {
listen 8080;
location / {
proxy_pass http://splash_cluster;
proxy_set_header Host $host;
proxy_set_header X-Real-IP $remote_addr;
}
}
请求层优化:避免无效渲染开销
大量请求其实根本不需要完整渲染——比如只取标题或某个字段,却让 Splash 加载全部 JS 和图片,白白耗资源。
使用 JSON Schema 验证 JSON 数据,从示例 JSON 生成 schema,并将其转换为 TypeScript 接口、Python 数据类或 Markdown 文档。
- 用
images=0参数禁用图片加载,可降低 40%+ 渲染时间 - 对静态资源加过滤规则,通过
filters参数传入 Adblock Plus 格式规则(如||cdn.example.com/ads/) - 关键字段提取优先走
/execute+ Lua 脚本,而不是等完整 HTML 返回后再解析——脚本里用splash:select或splash:evaljs直接取值,返回 JSON 更轻量
例如只取页面 title:
lua_source = """
function main(splash)
splash:go(splash.args.url)
splash:wait(2)
return {title = splash:evaljs("document.title")}
end
"""
Scrapy 中的连接池与重试控制
光靠 Splash 扩容不够,客户端也得配合。Scrapy 默认的 scrapy-splash 下载器中间件若不调优,容易把请求全打到同一个后端节点上,或在失败时盲目重试加重压力。
- 在
settings.py中设SPLASH_URL = 'http://localhost:8080'(指向 Nginx) - 启用
SPLASH_COOKIES_DEBUG = True仅调试期开,生产环境关掉 - 配置
RETRY_HTTP_CODES = [500, 502, 503, 504, 408],但把 Splash 相关错误码(如 503)的重试次数压到 1–2 次,避免雪崩 - 关键:用
slot机制隔离不同域名请求,防止一个慢站点拖垮整个队列
真正卡点不在 Splash 本身,而在于你没切断“无效等待”——比如 wait=5 却实际 1 秒就加载完,剩下 4 秒纯占 slot;或者没关图片、没过滤广告 JS,让每个请求都多跑 300ms。这些细节叠加起来,就是大规模下渲染吞吐翻倍或归零的分界线。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










