如何用 Selenium 稳健实现 Zoopla 房产数据的分页爬取

冬芳君_4020

冬芳君_4020

2026-09-23

818人浏览

原创

如何用 Selenium 稳健实现 Zoopla 房产数据的分页爬取

zoopla 网站受 cloudflare 严格反爬保护,原生 selenium 分页常因触发人机验证而中断;本文提供绕过 cookie 弹窗、识别 shadow dom、基于 url 变化判断翻页终止的鲁棒方案,并附可直接运行的优化代码。

zoopla 网站受 cloudflare 严格反爬保护,原生 selenium 分页常因触发人机验证而中断;本文提供绕过 cookie 弹窗、识别 shadow dom、基于 url 变化判断翻页终止的鲁棒方案,并附可直接运行的优化代码。

在自动化抓取 Zoopla(如 https://www.zoopla.co.uk/house-prices/england/)这类高防护网站时,分页失效的根本原因并非代码逻辑错误,而是反爬机制提前拦截。该站点使用 Cloudflare Bot Management,当检测到连续、高频、无真实用户行为特征的页面跳转(如快速点击“Next”),会在第 20–30 页左右返回验证页(如 “Checking you are human…”),导致后续 find_element 失败、current_url 不变、staleness_of 等待超时——这正是原始脚本“只爬第一页就停止”的真实原因。

要构建稳定分页流程,需同时解决三大关键问题:

  1. Cookie 同意弹窗拦截:Zoopla 使用 Shadow DOM 封装 Cookie 拒绝按钮(#usercentrics-root),普通 CSS 选择器无法穿透;
  2. Cloudflare 的静默拦截:翻页后若 driver.current_url 未更新,即表明已进入验证流程,应立即终止;
  3. 元素定位鲁棒性:避免依赖易变 class 名(如 _1hzil3o9),优先使用语义化属性(如 data-testid, aria-live)。

以下为生产级优化方案(已通过实测):

from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
from undetected_chromedriver import Chrome
from selenium.webdriver.remote.webelement import WebElement
from selenium.webdriver.remote.webdriver import WebDriver
from selenium.common.exceptions import TimeoutException, NoSuchElementException
from selenium.webdriver.common.action_chains import ActionChains
from typing import cast, Iterator

URL = "https://www.zoopla.co.uk/house-prices/england/?new_homes=include&q=england+&orig_q=united+kingdom&view_type=list&pn=1"
TIMEOUT = 5

def etext(e: WebElement) -> str:
    if e:
        if t := e.text.strip():
            return t
        if (p := e.get_property("textContent")) and isinstance(p, str):
            return p.strip()
    return ""

def click(driver: WebDriver, e: WebElement) -> None:
    ActionChains(driver).move_to_element(e).click().perform()

def get_all(driver: WebDriver, css: str) -> Iterator[WebElement]:
    wait = WebDriverWait(driver, TIMEOUT)
    ec = EC.presence_of_all_elements_located
    sel = By.CSS_SELECTOR, css
    try:
        yield from wait.until(ec(sel))
    except TimeoutException:
        pass

def click_next(driver: WebDriver) -> bool:
    """返回是否成功点击 Next;失败则返回 False"""
    for a in get_all(driver, "a[aria-live='polite'] > div > div:nth-child(2)"):
        if etext(a) == "Next":
            try:
                click(driver, a)
                return True
            except Exception:
                return False
    return False

def get_shadow_root(driver: WebDriver) -> WebDriver | None:
    wait = WebDriverWait(driver, TIMEOUT)
    sel = By.ID, "usercentrics-root"
    try:
        sre = wait.until(EC.presence_of_element_located(sel))
        return cast(WebDriver, sre.shadow_root)
    except TimeoutException:
        return None

def accept_or_reject_cookies(driver: WebDriver) -> None:
    shadow = get_shadow_root(driver)
    if not shadow:
        return
    try:
        wait = WebDriverWait(shadow, TIMEOUT)
        button = wait.until(EC.element_to_be_clickable((By.CSS_SELECTOR, "button[data-testid='uc-deny-all-button']")))
        click(driver, button)  # 注意:此处传入的是外层 driver,非 shadow
    except Exception:
        pass  # Cookie 弹窗可能未出现,忽略

if __name__ == "__main__":
    result = []
    with Chrome(headless=False, use_subprocess=True) as driver:  # headless=True 可提升速度,但调试建议设为 False
        driver.get(URL)
        accept_or_reject_cookies(driver)

        prev_url = ""
        npages = 0
        print("Starting pagination...")

        while prev_url != driver.current_url and npages <p><strong>关键注意事项</strong>:</p>
  • 必须使用 undetected_chromedriver v3+uc.Chrome() 可有效规避基础指纹检测,Chrome() 原生驱动极易被 Cloudflare 拦截;
  • 禁用 headless=True 初期调试:可视化模式便于观察 Cookie 弹窗、验证页是否出现;
  • ⚠️ 勿依赖 staleness_of 判断翻页完成:Cloudflare 页面可能 DOM 结构不变但内容为空,应以 current_url 变化为核心判据;
  • ⚠️ 添加 npages 安全上限:防止因网络波动导致 URL 未及时更新而死循环;
  • ? 数据提取优先使用 data-testid 属性:Zoopla 明确维护该属性,远比动态 class(如 _1hzil3o9)稳定;
  • ? 真实用户行为模拟:代码中 move_to_element().click() 比直接 .click() 更贴近人工操作,降低风控概率。

综上,Zoopla 分页不是“写法错误”,而是反爬对抗场景下的工程实践问题。稳定性的核心在于:主动识别防护信号(URL 冻结)、穿透前端封装(Shadow DOM)、放弃脆弱假设(DOM 完全重载)、拥抱语义化选择器。按此思路重构,即可在合规前提下高效获取多页结构化数据。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

4053

9

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.13

653

12

软件测试常用工具
软件测试常用工具

软件测试常用工具有Selenium、JUnit、Appium、JMeter、LoadRunner、Postman、TestNG、LoadUI、SoapUI、Cucumber和Robot Framework等等。测试人员可以根据具体的测试需求和技术栈选择适合的工具,提高测试效率和准确性 。

2023.10.13

3990

8

java测试工具有哪些
java测试工具有哪些

java测试工具有JUnit、TestNG、Mockito、Selenium、Apache JMeter和Cucumber。php还给大家带来了java有关的教程,欢迎大家前来学习阅读,希望对大家能有所帮助。

2023.10.23

2441

10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

0

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

0

13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.1万人学习