scrapy可通过scrapy.cfg定义多环境settings段并配合scrapy_project环境变量自动加载对应配置模块;各环境settings应继承基础配置并仅覆盖差异项,敏感信息须通过os.environ注入。

Scrapy 本身不内置多环境配置机制,但可以通过 scrapy.cfg + 环境变量组合实现干净、可部署的区分方式。关键不是写一堆 if-else,而是让 Scrapy 启动时自动加载对应 settings 模块。
scrapy.cfg 中定义不同 settings 配置段
Scrapy 会读取项目根目录下的 scrapy.cfg,其中 [settings] 区块决定了默认加载哪个 settings 模块。你可以在这里添加多个命名配置:
[settings] default = myproject.settings dev = myproject.dev_settings prd = myproject.prd_settings stg = myproject.staging_settings
注意:dev、prd 这些是自定义 key,不是固定语法;它们必须和后续要设置的 SCRAPY_PROJECT 值完全一致。
- 每个 key 对应一个 Python 模块路径(如
myproject.prd_settings),需确保该文件存在且可 import - 模块名必须是合法的 Python 路径(不含 .py 后缀,不能有空格或特殊字符)
- 不要在
scrapy.cfg里写绝对路径,只写包内相对路径
用 SCRAPY_PROJECT 环境变量切换配置
运行爬虫时,通过设置 SCRAPY_PROJECT 来指定使用哪一段配置:
export SCRAPY_PROJECT=prd scrapy crawl myspider
此时 Scrapy 会从 scrapy.cfg 的 [settings] 下查找 prd 对应的值(即 myproject.prd_settings),并将其设为 SCRAPY_SETTINGS_MODULE。
-
SCRAPY_PROJECT是唯一需要手动设置的环境变量,其他如SCRAPY_SETTINGS_MODULE由 Scrapy 内部自动推导 - 如果未设置
SCRAPY_PROJECT,则 fallback 到default配置项 - 该变量对 scrapyd 部署也生效 —— 在 scrapyd 的
deploy过程中,scrapy.cfg会被上传,SCRAPY_PROJECT可在部署脚本或 scrapyd-client 配置中控制
settings 模块之间避免重复与污染
不同环境的 settings 文件(如 prd_settings.py)不应从头写起,而应复用基础配置:
# myproject/prd_settings.py
from .settings import *
<h1>覆盖生产环境特有配置</h1><p>BOT_NAME = 'myprodspider'
LOG_LEVEL = 'WARNING'
LOG_FILE = '/var/log/scrapy/prod.log'
CONCURRENT_REQUESTS = 16
RETRY_TIMES = 2</p><h1>敏感配置不硬编码,改用 os.environ.get()</h1><p>DATABASE_URL = os.environ.get('DATABASE_URL', 'postgresql://prod:xxx@db.example.com:5432/main')</p>
- 所有环境共享的通用配置(如
SPIDER_MODULES、DOWNLOAD_DELAY)统一放在settings.py里 - 各环境文件只做“覆盖”,不做完整重写,降低维护成本
- 数据库密码、API keys 等绝不写死,一律通过
os.environ注入 —— 这样既安全,又方便 CI/CD 或容器环境注入
本地开发时如何避免误用生产配置
最容易出问题的是:开发者本地跑 scrapy crawl 时忘了切回 dev,结果连上了生产 DB 或触发了告警逻辑。
- 在项目根目录加一个
.env文件(配合 python-dotenv 或 shell profile),默认设SCRAPY_PROJECT=dev - CI/CD 流水线或服务器部署脚本中,显式 export
SCRAPY_PROJECT=prd,不依赖默认值 - 可在
settings.py开头加一句检查:assert os.environ.get('SCRAPY_PROJECT') != 'prd', 'Refusing to run PRD config locally'(仅用于开发机)
真正麻烦的不是怎么配,而是确保每次启动都走对配置路径 —— scrapy.cfg 和 SCRAPY_PROJECT 必须协同生效,漏掉任意一环都会 fallback 到 default,而这个 fallback 往往是开发配置,可能悄无声息地把测试请求发到线上接口。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











