智能网页数据采集器,自动识别页面结构,批量抓取列表/表格/详情页数据,支持导出JSON/CSV/Excel,内置反爬策略适配。
Smart Web Scraper - 智能网页数据采集器是一项面向实际任务的技能,主要用于🔍 智能识别;自动识别列表页、详情页、表格数据;
随机User-Agent轮换;请求延迟随机化;IP代理池支持(可选);自动重试机制;📊 数据导出;JSON批量导出;CSV/Excel表格;数据库直存(MySQL/MongoDB);命令行采集;
配置采集(config。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
cd smart-web-scraper
npm install
# 采集单页
node scraper.js --url "https://example.com/products" --selector ".product-item"
# 批量分页采集
node scraper.js --url "https://example.com/list" --pages 10 --output data.json
# 导出CSV
node scraper.js --url "https://example.com/products" --format csv --output products.csv
{
"target": {
"url": "https://example.com/items",
"pages": 5,
"waitFor": ".loading"
},
"fields": [
{"name": "title", "selector": ".title", "type": "text"},
{"name": "price", "selector": ".price", "type": "text"},
{"name": "image", "selector": "img", "type": "attr", "attr": "src"}
],
"export": {
"format": "json",
"file": "output.json"
}
}
| 场景 | 命令 |
|---|---|
| 电商商品采集 | node scraper.js --url "https://shop.example.com" --selector ".product" |
| 房价数据 | node scraper.js --config housing-config.json |
| 职位列表 | node scraper.js --url "https://jobs.example.com" --pages 20 --delay 2000 |
相关专题
热门下载
相关下载
精品课程
共12课时 | 1万人学习
共39课时 | 3.3万人学习
共10课时 | 1.3万人学习