优先拦截xhr/fetch请求而非等待dom渲染,因90%的spa数据藏于网络请求中;page.wait_for_load_state("networkidle")无法捕获交互或定时触发的请求,易导致空数据;应结合page.on("request")监听、page.route()拦截及page.evaluate()读取全局变量。

直接上结论:别一上来就用 page.content() 或 page.inner_html() 硬抓渲染后 DOM,90% 的 SPA 数据其实藏在 XHR/Fetch 请求里——拦截网络请求比等页面渲染更稳、更快、更干净。
为什么不能只靠 page.wait_for_load_state("networkidle")?
这个方法常被当作“页面加载完成”的万能开关,但它只保证主文档和初始资源空闲,并不等待后续由用户交互(比如点击筛选按钮、滚动触发懒加载)或定时器(比如轮询接口)发起的请求。很多 SPA 的核心数据根本不会在首次 networkidle 时出现。
常见错误现象:page.query_selector(".item-list") 返回 None,但你在浏览器里明明能看到列表;或者抓到的是旧缓存数据,不是最新接口返回值。
- 它不感知 JS 动态注册的 fetch/XHR,只看网络连接空闲状态
- 对 WebSocket 或长轮询(如
/api/updates?stream=1)完全无效 - 在低网速或高延迟环境下容易误判,导致提前读取空 DOM
怎么可靠地捕获真实 API 请求?
Playwright 的 page.route() 和 page.on("request") 是关键入口。重点不是“等页面画完”,而是“盯住它发了什么请求”。
使用场景:目标网站用 React 渲染商品列表,但所有数据都来自 /api/products?category=shoes&page=1 这类接口,DOM 只是容器。
Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。
- 优先用
page.on("request", lambda req: ...)监听所有请求,过滤出含"api"、"v1"、"json"的 URL - 对关键请求用
page.route()拦截并保存响应体,避免重复解析 JSON 字符串 - 注意区分请求类型:
req.resource_type为"fetch"或"xhr"才是你要的数据源,"script"或"font"可直接跳过 - 如果接口带鉴权头(如
Authorization: Bearer xxx),记得在拦截回调里用req.headers提取,别漏掉
page.evaluate() 什么时候该用?
不是所有数据都能从网络层拿到。有些 SPA 把初始数据直接塞进 window.__INITIAL_STATE__ 或 __NEXT_DATA__ 这类全局变量里,没走任何 HTTP 请求。
这时候 page.evaluate() 就是唯一出路,但要注意执行时机和上下文。
- 必须等 JS 执行完毕后再调用,推荐配合
page.wait_for_function("window.__INITIAL_STATE__ !== undefined") - 避免直接返回大型对象,会序列化失败;改用
JSON.stringify()后再传回 Python - 不要在
evaluate里操作 DOM(比如document.querySelector),那是query_selector的事;evaluate只负责读取 JS 上下文里的原始数据 - 如果变量名动态生成(如
window["__DATA_"+Math.random()]),得先用page.evaluate("Object.keys(window).filter(k => k.startsWith('__DATA_'))")扫一遍
并发与反反爬的现实约束
Playwright 虽然支持多浏览器实例,但每个 browser.new_context() 都是独立进程,内存和启动开销远高于 requests。盲目加并发反而容易被封。
真正有效的策略是“单实例深度复用”,而不是“多实例暴力并发”。
- 一个
context复用多次page,比反复new_context()更轻量 - 设置
user_agent和viewport时,别用默认值;从真实 Chrome UA 池里随机选,否则navigator.webdriver === true会被秒识别 - 滚动、悬停、点击等交互动作要带自然间隔(
page.wait_for_timeout(200)),纯毫秒级等待不如用page.wait_for_event("domcontentloaded")精准 - 别依赖截图或 PDF 导出做数据提取——OCR 准确率低、速度慢,且无法处理表格结构化数据
实际中最容易被忽略的点:SPA 页面的“加载完成”没有统一标准,必须根据目标网站的数据加载逻辑定制等待条件。 有人等 networkidle0,有人等某个元素出现,有人等特定请求发出,还有人等 JS 全局变量就位——没有银弹,只有针对性判断。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










