面向大语言模型(LLM)优化输出的网页爬虫与数据采集工具 | 网页爬虫、网页采集器、网络蜘蛛。支持 DuckDuckGo 搜索、整站爬取、动态页面采集……
Crawl4AI Skill - Web Crawler & Scraper.是一项面向实际任务的技能,主要用于Web Cralling QQ 网页翻版 QQ LLM , 自由网络翻版和刷版 使用 LLM - 优化的Markdown 输出;QQ Core。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;
涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
Web Crawling 网页爬虫 | Web Scraping 网页爬取 | LLM 优化输出
智能网页爬虫和爬取工具,支持搜索、全站爬取、动态页面抓取。Free web crawler and scraper with LLM-optimized Markdown output.
pip install crawl4ai-skill
# Search the web with DuckDuckGo
crawl4ai-skill search "python web scraping"
# Scrape a single web page
crawl4ai-skill crawl https://example.com
# Crawl entire website / spider
crawl4ai-skill crawl-site https://docs.python.org --max-pages 50
# Crawl documentation site with spider
crawl4ai-skill crawl-site https://docs.fastapi.com --max-pages 100
爬虫效果 | Crawler Output:
# Search and scrape top results
crawl4ai-skill search-and-crawl "Vue 3 best practices" --crawl-top 3
JavaScript 渲染的页面爬取(雪球、知乎等):
# Scrape JavaScript-heavy pages
crawl4ai-skill crawl https://xueqiu.com/S/BIDU --wait-until networkidle --delay 2
| 命令 Command | 说明 Description |
|---|---|
search <query> |
Web search 网页搜索 |
crawl <url> |
Web scraping 单页爬取 |
crawl-site <url> |
Web crawling 全站爬虫 |
search-and-crawl <query> |
Search + scrape 搜索并爬取 |
# Web Search 搜索
--num-results 10 # Number of results
# Web Scraping 爬取
--format fit_markdown # Output format
--output result.md # Output file
--wait-until networkidle # Wait strategy for dynamic pages
--delay 2 # Additional wait time (seconds)
--wait-for ".selector" # Wait for specific element
# Web Crawling 爬虫
--max-pages 100 # Max pages to crawl
--max-depth 3 # Max crawl depth
智能提取,节省 80% Token。Smart extraction, save 80% tokens.
crawl4ai-skill crawl https://example.com --format fit_markdown
保留完整结构。Preserve full structure.
crawl4ai-skill crawl https://example.com --format raw_markdown
✅ 免费爬虫 Free Crawler - 无需 API key,开箱即用
✅ 智能爬取 Smart Scraper - 自动去噪,提取核心内容
✅ 全站爬虫 Site Crawler - 支持 sitemap,递归爬取
✅ 动态爬取 Dynamic Scraping - JavaScript 渲染页面支持
✅ 搜索集成 Search Integration - DuckDuckGo 搜索内置
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.1万人学习
共49课时 | 82万人学习