隐形网络爬虫。提供任意URL,自动穿透Cloudflare、反爬虫检测和WAF防火墙,采用三级级联机制(纯HTTP → TLS伪装...)
FlowCrawl是一项面向实际任务的技能,主要用于搜索任何网站. .;Bypass any bot protection.;
Add Alias( Re)。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
爬取任意网站。绕过所有机器人防护。免费。
pip install scrapling
Scrapling 在首次运行时会自动安装 Playwright,这是其唯一依赖项。
# 单个 URL — 输出干净的 Markdown 到标准输出
python3 ~/clawd/skills/flowcrawl/scripts/flowcrawl.py https://example.com
# 爬取整个站点(蜘蛛模式)
python3 ~/clawd/skills/flowcrawl/scripts/flowcrawl.py https://example.com --deep
# 深度爬取并限制数量、保存结果后合并
python3 ~/clawd/skills/flowcrawl/scripts/flowcrawl.py https://example.com --deep --limit 30 --combine
# JSON 格式输出 — 可通过管道传递给任意工具处理
python3 ~/clawd/skills/flowcrawl/scripts/flowcrawl.py https://example.com --json
echo 'alias flowcrawl="python3 ~/clawd/skills/flowcrawl/scripts/flowcrawl.py"' >> ~/.zshrc
source ~/.zshrc
之后只需执行:flowcrawl https://example.com
FlowCrawl 采用三层抓取器级联机制:从最快的方式开始,仅在被拦截时自动升级:
| 层级 | 方法 | 适用场景 |
|---|---|---|
| 1 | 普通 HTTP 请求 | 绝大多数网站,响应即时 |
| 2 | 隐身模式 + TLS 指纹伪造 | Cloudflare、Imperva 及基础 WAF 防护 |
| 3 | 完整 JavaScript 执行(浏览器渲染) | 单页应用(SPA)、重度 JavaScript 网站、激进的机器人检测机制 |
自动识别拦截信号(如 HTTP 状态码 403、503,或页面中出现 “Just a moment...” 等提示),并静默升级至更高层级。
| 参数 | 说明 | 默认值 |
|---|---|---|
--deep |
启用全站爬取,跟随内部链接 | 关闭 |
--depth N |
从起始 URL 出发的最大跳转深度 | 3 |
--limit N |
最多爬取的页面数 | 50 |
--combine |
将所有页面内容合并为单个文件 | 关闭 |
--format md|txt |
输出格式 | md |
--output DIR |
输出目录路径 | ./flowcrawl-output |
--json |
输出结构化 JSON 格式数据 | 关闭 |
--quiet |
抑制进度日志输出 | 关闭 |