正确做法是全局复用一个mongoclient实例,配置maxpoolsize=50、minpoolsize=5、serverselectiontimeoutms=3000、connecttimeoutms=2000、sockettimeoutms=5000;批量插入用insert_many()且batch size设为1000左右、ordered=false;去重更新用update_one()+upsert=true;关键数据需设置write_concern如w="majority"或j=true,并校验操作结果。

用 pymongo 连接 MongoDB 时,连接池和超时设置不配好会直接崩
爬虫高频写入时,Connection refused 或 ServerSelectionTimeoutError 很大概率不是 MongoDB 挂了,而是客户端没管好连接。默认的 pymongo 连接池大小是 100,但若每条请求都新建 MongoClient 实例(比如在爬虫每个 item 处理函数里 new 一个),连接数会迅速打满,MongoDB 拒绝新连接。
正确做法是全局复用一个 MongoClient 实例,并显式控制连接行为:
- 把
MongoClient实例放在模块顶层或单例中,**不要在循环/回调里反复初始化** - 加上
maxPoolSize=50和minPoolSize=5防止连接抖动 - 设
serverSelectionTimeoutMS=3000,避免卡死在选主节点上 - 加
connectTimeoutMS=2000和socketTimeoutMS=5000,防止网络延迟拖垮整个爬虫
示例:
client = MongoClient(
"mongodb://localhost:27017/",
maxPoolSize=50,
minPoolSize=5,
serverSelectionTimeoutMS=3000,
connectTimeoutMS=2000,
socketTimeoutMS=5000,
)
插入海量数据别用 insert_one(),批量写要选对方法
单条插入在万级数据量下会慢出天际,还容易触发 MongoDB 的写锁竞争。真正扛量的是 insert_many(),但它不是“越大批越好”——过大的 batch 会导致内存暴涨、网络包被截断、单次失败整批回滚。
经验阈值和注意事项:
- batch size 控制在
1000左右比较稳;超过10000就得拆分,尤其文档字段多或含二进制内容时 - 务必开启
ordered=False,否则一条失败整个 batch 被跳过 - 插入前先用
collection.estimated_document_count()确认集合存在且可写,避免因权限或磁盘满导致静默失败 - 如果字段结构高度一致,提前建好索引(比如
url字段唯一索引),但**别在插入过程中建索引**,会严重拖慢吞吐
去重和更新不能只靠应用层判断,要用 update_one() + upsert=True
爬虫常遇到重复抓取同一 URL 或商品 ID。如果先 find() 再决定插或不插,不仅多一次查询,还会在并发写入时产生竞态(两个进程同时查到“不存在”,然后都插入)。
Python Linux版 为 Python.org 官方提供的 Python 3.14.6 Linux/Unix 源码包,适合在Linux/Unix环境中安装、运行 Python 代码并学习函数、模块和脚本开发。
更可靠的做法是让 MongoDB 自己做原子判断:
- 用
filter定位唯一键(如{"url": "https://example.com"}) - 配合
update_one(filter, update, upsert=True),MongoDB 保证“查+插/改”原子执行 - 注意:
upsert成功时返回的result.upserted_id只在真正插入时有值;更新时不为空,需靠result.matched_count判断是否命中 - 如果业务允许覆盖旧数据,
update部分直接传完整文档;如果只想更新部分字段,用$set操作符,避免意外清空字段
示例:
collection.update_one(
{"url": item["url"]},
{"$set": item},
upsert=True
)
写入后不校验就认为成功?write_concern 必须设
默认情况下,pymongo 的 write_concern 是 w=1(只写主节点就返回),但网络闪断、主从切换或磁盘故障时,数据可能根本没落盘,而你的爬虫日志却显示“插入成功”。这对关键数据(比如订单、价格)是灾难性的。
根据数据重要程度分级设置:
- 普通页面快照:保持默认
w=1,平衡速度与可靠性 - 带业务含义的 ID 或状态字段:设
w="majority",确保多数副本写入才返回 - 金融级数据:加
j=True(journal commit),强制写日志后再返回,但性能下降明显 - 永远不要设
w=0(fire-and-forget),除非你明确接受丢数据
可在 client 初始化时统一设,也可在单次操作中覆盖:
collection.with_options(
write_concern=WriteConcern(w="majority", j=True)
).insert_many(docs)
真实环境中,很多人只调 insert_many() 就以为完事,但没检查 result.acknowledged 和 result.upserted_count,结果部分数据静默丢失,排查起来极其费劲。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










