pymongo可直接插入json数据,无需预定义schema;自动建库建集,支持嵌套和动态字段;需处理nan/infinity、控制批量大小、设置合理索引以提升查询效率。

用 pymongo 连接 MongoDB 并插入原始 JSON 文档
直接把爬虫拿到的 dict 或 json.loads() 结果传给 collection.insert_one() 或 insert_many() 就行,MongoDB 原生支持嵌套、缺失字段、动态键名——不需要预定义 schema。
关键点是确保连接字符串正确、数据库和集合名合法(不能含 $ 或空字符),且目标集合无需手动创建:
-
MongoClient("mongodb://localhost:27017/")是本地默认连接,远程需替换为完整 URI(含用户名/密码时注意 URL 编码) - 插入前不用调用
create_collection(),第一次写入会自动建库建集 - 如果 JSON 中有
datetime对象,pymongo能自动转成 BSONDate;但NaN、Infinity会报InvalidDocument错误,得提前过滤或转成None
处理爬虫常见的非标准 JSON 字段(如 NaN、重复键、HTML 片段)
MongoDB 的 BSON 格式不接受 NaN、Infinity,而 Python json.loads() 在遇到它们时默认转成浮点特殊值,直接插入会触发 InvalidDocument: Cannot encode object。
推荐在插入前做轻量清洗,而不是依赖中间层转换:
- 用
json.loads(text, parse_constant=lambda x: None)捕获并替换NaN/Infinity - 对 HTML 字符串不做额外处理——MongoDB 存字符串完全没问题,后续查的时候用正则或
BeautifulSoup解析即可 - 重复键(如多个
"title")在 Pythondict中已被覆盖,不是 MongoDB 问题;真要保留多值,得改结构,比如存成{"title": ["xxx", "yyy"]}
批量插入时控制内存与错误容忍(insert_many 的实际用法)
insert_many() 比循环 insert_one() 快得多,但默认失败即中断(ordered=True),而爬虫数据质量参差,更推荐设为 ordered=False 让成功文档继续写入。
同时要注意批次大小和内存压力:
- 单次传入不要超过 1000 条文档,避免网络超时或 OOM;可按
chunks = [data[i:i+500] for i in range(0, len(data), 500)]切分 - 启用
bypass_document_validation=True可跳过服务端 schema 验证(即使开了 validation 规则),减少开销 - 捕获
BulkWriteError并检查error_details["writeErrors"],定位具体哪条出错,方便日志或重试
查询时怎么高效读取特定爬虫任务的数据?加索引还是靠 _id?
_id 索引默认存在,但对爬虫场景几乎没用——你不会按 ObjectId 查某一条,而是按任务名、采集时间、URL 前缀等字段查。
必须手动建索引,否则 find({"source": "zhihu", "timestamp": {"$gt": ...}}) 会全表扫描:
- 高频查询字段组合建复合索引,例如:
collection.create_index([("source", 1), ("timestamp", -1)]) - URL 字段很长,建索引前考虑是否截取协议+域名部分(如
parse.urlparse(url).netloc)再存为新字段,避免索引膨胀 - 别对全文本字段(如
content)建普通索引,要用就上text索引,但注意它不支持正则和精确匹配
字段命名尽量统一,比如所有任务都带 task_id 和 fetch_time,否则后期聚合统计会很麻烦。MongoDB 不强制约束,但人容易忘。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











