workbuddy支持即时网页抓取与定时自动化采集:直接发url可提取指定字段并生成表格;需登录或反爬强的页面需用browseract或opencli增强;数据可清洗后导出excel。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让WorkBuddy自动从网页上提取标题、价格、日期等结构化信息,而不是手动一页页点开复制粘贴——这种重复劳动每天浪费你两小时以上,还容易漏数据、粘错行、格式混乱。现在只需告诉它“抓什么、从哪来、存哪去”,它就能像真人一样打开页面、识别内容、整理成表格。
直接发网址,让WorkBuddy即时读取
适用于临时查一次、不需定时重跑的场景,比如比价、核对公告、验证竞品最新文案。
第一步:复制目标网页完整URL(必须含http://或https://前缀)。
第二步:在WorkBuddy对话框中粘贴该链接,回车发送。
第三步:立刻提问,例如:“提取页面中所有商品名称和当前售价,列成两列表格”或“把这篇新闻的发布时间、作者、正文前三段摘要出来”。【不要只说‘提取内容’,必须明确字段名和输出格式】
这一步操作起来很简单,直接把链接拖进去就行。但注意:如果网页需要登录(如小红书个人主页、知乎盐选专栏),WorkBuddy默认无法跳过登录态,会返回空白或报错;此时必须换用浏览器自动化方案。
配置自动化采集任务,每天固定时间抓取
适合监控价格变动、行业新闻、政策更新等需长期跟踪的信息源。
方法一:本地界面配置定时任务
① 点击WorkBuddy右上角Claw设置图标 → 进入【自动化】面板 → 【添加自动化任务】。
② 在【触发条件】中选择“定时执行”,设为每天08:55。
③ 在【工作空间】指定一个本地文件夹路径,用于存放每日生成的数据文件。
④ 在【提示词】栏写清指令,例如:“从https://www.caict.ac.cn/kxyj/qw抓取近24小时内发布的人工智能政策文件,提取标题、发文单位、发布日期、原文链接,保存为Excel,表头用中文,日期格式统一为YYYY-MM-DD”。
⑤ 点击【启用】并保存,任务即刻生效。
方法二:微信直连远程触发
打开微信 → 进入已绑定的WorkBuddy客服号 → 发送指令:“今天帮我抓取抖音电商最新规则变更通知,提取条款编号、修改内容、生效时间,生成Markdown日报”。【电脑必须保持开机且WorkBuddy进程未被关闭,否则指令无法执行】
处理反爬强、需登录或动态加载的网页
当遇到小红书搜索页、京东商品详情、微信公众号历史文章等页面时,普通抓取会失败——因为它们依赖JavaScript渲染、登录态校验或行为风控。
方法1:安装BrowserAct技能增强浏览器能力
在WorkBuddy技能中心搜索“BrowserAct”,点击安装。该技能会调用本地Chrome浏览器,真实模拟人工滚动、点击、输入关键词,绕过大部分前端反爬机制。
方法2:用OpenCLI扩展触发真实搜索
先安装opencli CLI工具(需Node.js ≥ v20)→ 加载opencli-main/extension浏览器扩展 → 在WorkBuddy中运行命令如opencli baidu search "AI Agent 最新评测"。它会在后台真实打开Edge浏览器,执行搜索并提取结果。
注意:该方式依赖浏览器进程存活,若电脑休眠或Edge被强制关闭,任务会中断且无自动重试。
清洗与导出结构化数据
网页抓下来的数据常带HTML标签、多余空格、“¥”符号、乱码日期,不能直接用。
进入【流程编排】模块 → 拖入“文本清洗”节点 → 启用“HTML标签剥离”和“连续空白符压缩” → 对价格字段添加正则替换:¥(\d{1,3}(,\d{3})*\.\d{2}) → 替换为$1(去掉逗号和¥)。
清洗完成后,连接“Excel导出”节点 → 设置保存路径为D:\监控数据\价格变化.xlsx → 勾选“追加模式”,每次运行新增一行并自动插入时间戳。











