scrapy分页抓取需准确提取下一页链接并递归请求,优先用response.follow()处理相对路径;无明确按钮时可拼接页码url或解析页码导航栏,须限制页数、去重及启用去重机制防环路。

Scrapy分页抓取需要准确识别下一页链接并递归请求,避免因URL结构变化或动态加载导致漏页或死循环。
提取下一页链接并发起新请求
在解析函数中用XPath或CSS选择器定位“下一页”元素,调用response.follow()生成新Request对象。
这一步操作起来很简单,直接把提取到的相对URL传给follow即可自动拼接基础域名;如果手动构造Request,必须确保url参数是完整绝对路径,否则会因协议缺失变成404。
response.follow(next_selector, callback=self.parse) → 自动处理相对路径、复用headers与cookies。
处理无明确“下一页”按钮的分页场景
方法一:拼接页码URL
观察列表页URL规律(如?page=2),在parse函数中用for循环或while生成后续页码URL,用scrapy.Request()提交。
注意:必须限制最大页数或添加终止条件,否则可能无限请求。例如检测响应内容是否为空列表或返回404状态码后停止。
方法二:解析页码导航栏
提取所有页码链接(如3),遍历后对每个链接调用response.follow(),callback指向同一解析函数。
【务必去重】 否则相同页码链接被多次提取会导致重复抓取甚至调度队列爆炸。
防止重复抓取与环路请求
第一步:启用DUPEFILTER_CLASS默认去重机制,Scrapy会自动对Request.url+method+body做指纹校验。
第二步:若页面通过POST带参数翻页,需确认body内容是否参与去重——默认不参与,此时要改写custom_settings或重载request_fingerprint方法。
第三步:检查是否因JavaScript跳转造成实际URL未变但内容刷新,这种场景Scrapy无法识别,必须换用Splash或Playwright。











