多环境配置和敏感凭证必须物理分离:连接参数走配置文件,凭据由外部服务按需注入;scrapy 多环境唯一正解是 scrapy.cfg + scrapy_project,各环境 settings 继承 base 并覆盖差异项;敏感凭据须通过 taotoken/kms 动态获取并校验,非敏感参数如 download_delay、user_agent 也需按环境分治。

直接说结论:多环境配置和敏感凭证必须物理分离——连接参数(host、port、超时)走配置文件,账号密码、API Key 这类凭据必须由外部服务按需注入,不能出现在任何代码或配置文件中。
scrapy.cfg + SCRAPY_PROJECT 是 Scrapy 多环境切换的唯一正解
Scrapy 本身不支持 settings.py 内部 if-else 切环境,硬编码 if os.getenv("ENV") == "prod" 是反模式。正确做法是靠 scrapy.cfg 定义命名配置段,再用环境变量驱动加载:
-
scrapy.cfg里只写合法 Python 模块路径,比如prd = myproject.settings.prd,不能带.py后缀 - 运行时设
SCRAPY_PROJECT=prd,Scrapy 就会自动把myproject.settings.prd当作SCRAPY_SETTINGS_MODULE - 各环境 settings 文件(如
prd.py)应继承基础配置:from .base import *,只覆盖CONCURRENT_REQUESTS、LOG_FILE等差异项 - 切环境只需改一个变量,CI/CD 脚本、
scrapyd部署、本地调试全部一致
os.getenv() 是敏感信息注入的底线,但不是终点
把 DB_PASSWORD、PROXY_USER 直接塞进 os.environ 看似干净,实则埋雷:本地开发可能误存到 .env 提交 Git;CI 系统里密钥明文挂在 UI 页面上;轮换密码要手动改所有环境变量。真正安全的做法是:
- 配置文件里只留引用名,比如
credential_ref = "prod-mysql-main"或api_key_source = "taotoken:service-a-key" - 启动时调用 TaoToken API 或企业 KMS 获取真实值:
requests.get("https://taotoken.net/api/v1/secrets", headers={"Authorization": f"Bearer {os.getenv('TAOTOKEN_API_KEY')}"}) - 务必验证返回值完整性,空值或 HTTP 404 必须抛
ValueError中断启动,不能静默 fallback 到默认值 -
TAOTOKEN_API_KEY本身也要通过系统级环境变量注入,绝不能写死在代码或配置里
proxy、user-agent、download delay 这些非敏感参数也得按环境分治
很多人以为只有密码才算“敏感”,其实 DOWNLOAD_DELAY、ROTATING_PROXY_LIST、USER_AGENT 在不同环境行为差异极大:
- 本地开发可设
DOWNLOAD_DELAY = 0加速调试,生产必须设1.5避免触发风控 - 测试环境用固定代理池(
["http://test-proxy:8080"]),生产走动态轮换服务(rotating_proxies中间件 + Redis 计数) -
USER_AGENT在 staging 环境统一设为"Mozilla/5.0 (Scrapy-staging)",方便目标网站日志识别,不混入真实用户 UA - 这些参数虽不涉密,但一旦写死在
settings.py里,就失去环境隔离能力,必须随SCRAPY_PROJECT加载对应模块
最常被忽略的点:TaoToken 或 KMS 返回的凭据是 raw string,但有些库(比如 pymysql)要求密码做 URL 编码,urllib.parse.quote_plus() 这一步漏掉会导致连接失败;还有人把 credential_ref 当成字面量直接拼进连接串,忘了它只是个 key——这两处不加日志或断言,问题会卡在数据库连不上,排查起来极慢。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











