Scrapy + Playwright 爬取动态 AJAX 页面的正确实践指南

秋瑶君_1106

秋瑶君_1106

2026-09-08

543人浏览

原创

Scrapy + Playwright 爬取动态 AJAX 页面的正确实践指南

本文详解如何使用 scrapy 集成 playwright 成功抓取依赖 javascript 渲染的动态页面(如 ajax 加载内容),重点解决因选择器误用导致的空白输出问题,并提供可直接运行的完整示例。

本文详解如何使用 scrapy 集成 playwright 成功抓取依赖 javascript 渲染的动态页面(如 ajax 加载内容),重点解决因选择器误用导致的空白输出问题,并提供可直接运行的完整示例。

在使用 Scrapy 与 Playwright 协同爬取动态网页(例如 scrapethissite.com 的 AJAX 页面)时,一个常见却极易被忽视的错误是:直接沿用 Scrapy 原生 CSS 选择器语法(如 ::text)处理 Playwright 渲染后的 DOM 节点。由于 Playwright 的 response 对象(由 scrapy-playwright 提供)本质是基于浏览器上下文的交互式响应,其 .css() 方法仅返回 SelectorList,但此时节点内容可能尚未通过 JS 完全注入文本节点——尤其当目标元素文本由 JavaScript 动态写入(而非静态 HTML)时,::text 伪类将无法匹配,最终返回空字符串。

✅ 正确做法是:改用 Playwright 原生的 locator() API 获取元素,再调用 .inner_text()(推荐)或 .text_content() 方法提取可见文本。该方法会等待元素可交互、文本渲染完成,并自动处理换行/空白归一化,鲁棒性远高于 CSS ::text

以下是修正后的完整 Spider 示例(兼容 Scrapy 2.11+ 与 scrapy-playwright 2.0+):

Playwright Browser Automation
Playwright Browser Automation

使用Playwright API直接进行浏览器自动化。导航网站、与元素交互、提取数据、截图、生成PDF、录制视频,自动化复杂工作流程。比MCP方法更可靠。

下载
import scrapy
from scrapy_playwright.page import PageMethod


class OscarSpider(scrapy.Spider):
    name = "OscarSpider"

    def start_requests(self):
        yield scrapy.Request(
            url="https://www.php.cn/link/a99db42aa06a19e4c0e1bc61545b2c58",
            callback=self.parse,
            meta={
                "playwright": True,
                "playwright_include_page": True,
                "playwright_page_methods": [
                    # 等待年份按钮加载并点击 2010 年数据
                    PageMethod("wait_for_selector", "a#2010"),
                    PageMethod("click", "a#2010"),
                    # 等待电影列表(tr.film)完全渲染
                    PageMethod("wait_for_selector", "tr.film", state="attached"),
                    # 可选:滚动到底部触发懒加载(本例非必需,但通用性强)
                    PageMethod("evaluate", "window.scrollTo(0, document.body.scrollHeight)"),
                    # 确保所有异步内容就绪(建议用 wait_for_timeout + 显式 selector 更可靠)
                    PageMethod("wait_for_timeout", 3000),
                ],
            },
        )

    async def parse(self, response):
        # 使用 Playwright locator 替代 response.css()
        film_rows = response.selector.css("tr.film")
        for row in film_rows:
            # ✅ 关键修正:通过 locator 获取元素并调用 inner_text()
            title = response.xpath(f"//tr[@class='film'][{film_rows.index(row)+1}]//td[@class='film-title']").get()
            # 更健壮的方式:直接在 response 上用 locator(需确保 playwright_include_page=True)
            # 但注意:scrapy-playwright 的 response 对象不直接暴露 page.locator(),
            # 因此推荐在 parse 中使用 response.selector + .get() 提取 HTML 后,或改用更清晰的方案:

        # ✅ 推荐终极写法(简洁、可靠、符合 Playwright 惯例):
        page = response.meta.get("playwright_page")
        if page:
            # 在 page 上执行定位(需确保 page 未关闭)
            rows = await page.query_selector_all("tr.film")
            for row in rows:
                title_el = await row.query_selector("td.film-title")
                nominations_el = await row.query_selector("td.film-nominations")
                awards_el = await row.query_selector("td.film-awards")

                yield {
                    "title": (await title_el.inner_text()).strip() if title_el else "",
                    "nominations": (await nominations_el.inner_text()).strip() if nominations_el else "",
                    "awards": (await awards_el.inner_text()).strip() if awards_el else "",
                }

⚠️ 重要注意事项

  • playwright_include_page=True 是启用 response.meta["playwright_page"] 的前提,务必开启;
  • PageMethod("wait_for_selector", ...)state 参数建议显式设为 "attached""visible",避免因元素存在但不可见导致超时;
  • 避免过度依赖 wait_for_timeout;优先使用 wait_for_selector 等条件等待,提升稳定性和性能;
  • 若项目需高并发,请在 settings.py 中配置 TWISTED_REACTOR = "twisted.internet.asyncioreactor.AsyncioSelectorReactor" 并启用 PLAYWRIGHT_BROWSER_TYPE = "chromium"(默认);
  • 运行命令保持不变:scrapy crawl OscarSpider -O oscar.json,输出将包含结构化 JSON 数据,如 {"title": "The King's Speech", "nominations": "12", "awards": "4"}

通过以上调整,您将彻底解决“空白输出”问题,实现对动态 AJAX 内容的稳定、精准抓取。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

ajax playwright

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3953

9

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

20

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

180

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

100

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

60

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

380

28

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
jQuery官方API文档
jQuery官方API文档

共0课时 | 0人学习

Symfony教程(入门篇+基础篇)
Symfony教程(入门篇+基础篇)

共18课时 | 1.8万人学习