scrapy中应使用response.follow而非scrapy.request实现页面跳转,因其自动补全相对url、保持会话且复用中间件;支持单链接follow、多链接follow_all、selector传参及meta传值,但不可传selectorlist或none。

在Scrapy中实现页面跳转并保持会话、自动处理相对URL、复用中间件配置,必须用response.follow而不是手动拼接URL再yield scrapy.Request。
基础用法:提取单个下一页链接
第一步:在parse方法中用CSS或XPath定位到“下一页”链接的href属性值。
第二步:调用response.follow()传入该href值,并指定回调函数,例如self.parse继续递归解析。
第三步:yield返回的对象——注意这不是Response,而是Scrapy引擎可识别的Request对象,引擎收到后才会真正发起HTTP请求。
这一步操作起来很简单,直接把提取到的href塞进去就行,不用管它是相对路径还是绝对路径,【response.follow会自动调用response.urljoin()补全】,而scrapy.Request不会。
进阶用法:批量跟进多个链接
方法一:传入SelectorList(推荐)
用response.css('a.product-link::attr(href)')一次性提取所有商品详情页链接,直接yield response.follow_all()即可。注意不是follow(),是follow_all()——它专为列表设计,内部自动遍历并生成多个Request。
方法二:传入Selector(更灵活)
如果你还想顺便提取每个标签里的文本标题,就别先.extract(),直接传a标签Selector本身:yield response.follow(product_a, callback=self.parse_item)。这时response.follow会自动从里读取href属性,【传入Selector比传字符串更安全,避免空值报错】。
高阶用法:携带上下文数据跳转
当你从列表页提取了商品分类名,又需要在详情页里把分类名写进item,就得靠meta参数传递:
yield response.follow(detail_url, callback=self.parse_item, meta={'category': '手机'})
在parse_item方法中,通过response.meta['category']就能拿到这个值。注意meta字典只在本次请求→响应链路中有效,不会跨多次跳转自动继承。
如果漏传callback参数,Scrapy默认使用当前parse方法,容易造成无限循环抓取首页——务必显式指定回调函数。
避坑要点:什么不能传给response.follow
不能传SelectorList对象给response.follow(只能传单个Selector或字符串)。
不能传None——即使加了if判断,也要确保href变量确实有值,否则会抛TypeError。
不要在follow里手动改headers或cookies:这些应统一在settings.py或Downloader Middleware中配置,follow会自动继承原response的request.headers等上下文。











