Playwright Scraper Skill

Polar Sponsor
爱发电 赞助
.NET 9.0

基于 Playwright 的网页爬虫 OpenClaw 技能,带有反爬保护,已在 Discuss.com.hk 等复杂网站成功测试。

Playwright Scraper Skill.

功能概述

Playwright Scraper Skill.是一项面向实际任务的技能,主要用于A Playwright 基于网络的刮伤 OpenClaw Skill 带有反机器人保护.;Choop 最佳方法基于目标网站的反机器人级别.;

核心要点

  • QQ 使用 Case Matrix.。
  • 它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
  • 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。

使用与执行

从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。

结果检查与注意事项

执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。

Playwright 网页抓取 Skill

一款基于 Playwright 的网页抓取 OpenClaw Skill,具备反爬虫保护能力。请根据目标网站的反爬等级选择最合适的方法。

🎯 使用场景矩阵

目标网站 反爬等级 推荐方法 脚本
普通网站 web_fetch 工具 N/A(内置)
动态网站 Playwright Simple scripts/playwright-simple.js
Cloudflare 防护网站 Playwright Stealth scripts/playwright-stealth.js
YouTube 特殊 deep-scraper 需单独安装
Reddit 特殊 reddit-scraper 需单独安装

📦 安装

cd playwright-scraper-skill
npm install
npx playwright install chromium

🚀 快速开始

1️⃣ 普通网站(无反爬)

使用 OpenClaw 内置的 web_fetch 工具:

# 在 OpenClaw 中直接调用
Hey, fetch me the content from https://example.com

2️⃣ 动态网站(需执行 JavaScript)

使用 Playwright Simple

node scripts/playwright-simple.js "https://example.com"

示例输出:

{
  "url": "https://example.com",
  "title": "Example Domain",
  "content": "...",
  "elapsedSeconds": "3.45"
}

3️⃣ 反爬防护网站(如 Cloudflare 等)

使用 Playwright Stealth

node scripts/playwright-stealth.js "https://m.discuss.com.hk/#hot"

特性:

  • 隐藏自动化标记(navigator.webdriver = false
  • 使用真实设备 User-Agent(iPhone / Android)
  • 引入随机延迟以模拟人类行为
  • 支持截图与 HTML 文件保存

4️⃣ YouTube 视频字幕提取

使用 deep-scraper(需单独安装):

# 安装 deep-scraper Skill
npx clawhub install deep-scraper

# 使用
cd skills/deep-scraper
node assets/youtube_handler.js "https://www.youtube.com/watch?v=VIDEO_ID"

📖 脚本说明

scripts/playwright-simple.js

  • 适用场景:常规动态网站
  • 速度:快(3–5 秒)
  • 反爬能力:
  • 输出格式:JSON(含 title、content、URL)

scripts/playwright-stealth.js

  • 适用场景:受 Cloudflare 或其他反爬机制保护的网站
  • 速度:中等(5–20 秒)
  • 反爬能力:中–高(隐藏自动化特征、使用真实 UA)
  • 输出格式:JSON + 截图 + HTML 文件
  • 实测效果:在 Discuss.com.hk 上成功率 100%

🎓 最佳实践

1. 优先尝试 web_fetch

若网站无动态加载内容,请优先使用 OpenClaw 自带的 web_fetch 工具——它最快。

2. 需要执行 JavaScript?使用 Playwright Simple

若需等待 JavaScript 渲染完成,请使用 playwright-simple.js

3. 遭遇封禁?切换至 Stealth 模式

若返回 403 错误或出现 Cloudflare 验证页,请改用 playwright-stealth.js

4. 特殊平台需专用 Skill

  • YouTube → deep-scraper
  • Reddit → reddit-scraper
  • Twitter → bird skill

🔧 自定义配置

所有脚本均支持环境变量配置:

# 设置截图路径
SCREENSHOT_PATH=/path/to/screenshot.png node scripts/playwright-stealth.js URL

# 设置等待时间(毫秒)
WAIT_TIME=10000 node scripts/playwright-simple.js URL

# 启用 headful 模式(显示浏览器界面)
HEADLESS=false node scripts/playwright-stealth.js URL

# 保存 HTML 文件
SAVE_HTML=true node scripts/playwright-stealth.js URL

# 自定义 User-Agent
USER_AGENT="Mozilla/5.0 ..." node scripts/playwright-stealth.js URL

📊 性能对比

方法 速度 反爬能力 Discuss.com.hk 成功率
web_fetch ⚡ 最快 ❌ 无 0%
Playwright Simple 🚀 快 ⚠️ 弱 20%
Playwright Stealth ⏱️ 中等 ✅ 中等 100%
Puppeteer Stealth ⏱️ 中等 ✅ 中–高 ~80%
Crawlee(deep-scraper) 🐢 慢 ❌ 易被识别 0%
Chaser(Rust) ⏱️ 中等 ❌ 易被识别 0%

🛡️ 反爬技术总结

基于实测得出的经验:

✅ 有效的反爬绕过措施

  1. 隐藏 navigator.webdriver —— 必须项
  2. 使用真实 User-Agent —— 推荐 iPhone / Android 真实设备 UA
  3. 模拟人类行为 —— 加入随机延迟、滚动操作等
  4. 避免框架指纹特征 —— Crawlee、Selenium 等易被识别
  5. 使用 addInitScript(Playwright) —— 在页面加载前注入脚本

❌ 无效或效果有限的反爬绕过措施

  1. 仅修改 User-Agent —— 单一手段不足以绕过检测
  2. 使用高级封装框架(如 Crawlee) —— 更易暴露自动化特征
  3. Docker 隔离 —— 对 Cloudflare 无实质性帮助

🔍 故障排查

问题:403 Forbidden

解决方案:改用 playwright-stealth.js

问题:出现 Cloudflare 验证页

解决方案:

  1. 延长等待时间(建议 10–15 秒)
  2. 尝试启用 headless: false(headful 模式有时成功率更高)
  3. 考虑使用代理 IP

问题:页面为空白

解决方案:

  1. 增大 waitForTimeout
  2. 使用 waitUntil: 'networkidle''domcontentloaded'
  3. 确认是否需要登录后才能访问

📝 经验与记忆

2026-02-07 Discuss.com.hk 测试结论

  • 纯 Playwright + Stealth 方案 成功(耗时 5s,返回 200 OK)
  • ❌ Crawlee(deep-scraper)失败(返回 403)
  • ❌ Chaser(Rust)失败(触发 Cloudflare)
  • ❌ Puppeteer 标准版失败(返回 403)

最优方案:纯 Playwright + 反爬技巧(不依赖特定框架)

🚧 后续改进计划

  • 增加代理 IP 轮换支持
  • 实现 Cookie 管理(维持登录态)
  • 集成 CAPTCHA 处理(2captcha / Anti-Captcha)
  • 批量抓取(并行处理多个 URL)
  • 与 OpenClaw 的 browser 工具集成

📚 参考资料

  • Playwright 官方文档
  • puppeteer-extra-plugin-stealth
  • deep-scraper Skill

相关专题

更多
Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

0

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

0

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

0

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

0

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

0

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

0

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

0

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133万人学习