网页内容获取工具 | 当常规爬虫被过滤时,使用替代服务获取网页内容。支持:1) r.jina.ai - 最稳定 2) markdown.new - Cloudflare 专用 3) defuddle.md - 备用方案。触发词:获取网页内容、网页转markdown、内容抓取、fetch webpage、bypas...
网页内容获取工具是一项面向实际任务的技能,主要用于当常规 web_fetch/web_search 无法获取内容时,使用替代服务获取网页 Markdown 格式内容;支持的服务;
Cloudflare 保护网站;defuddle.md;当需要获取网页内容时,按顺序尝试:;首先用 web_fetch 尝试获取;如果失败或被过滤,调。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
当常规 web_fetch/web_search 无法获取内容时,使用替代服务获取网页 Markdown 格式内容。
| 优先级 | 服务 | 用法 | 适用场景 |
|---|---|---|---|
| 1 | r.jina.ai | https://r.jina.ai/{url} |
最稳定,通用性强 |
| 2 | markdown.new | https://markdown.new/{url} |
Cloudflare 保护网站 |
| 3 | defuddle.md | https://defuddle.md/{url} |
备用方案 |
当需要获取网页内容时,按顺序尝试:
web_fetch 尝试获取# 使用 jina.ai (首选)
curl -s "https://r.jina.ai/https://example.com"
# 使用 markdown.new (Cloudflare)
curl -s "https://markdown.new/https://example.com"
# 使用 defuddle.md (备用)
curl -s "https://defuddle.md/https://example.com"
# 简单获取
fetch_webpage <url>
# 指定方法
fetch_webpage <url> --method jina|markdown|defuddle
用户: 帮我获取 https://news.example.com/article/123 的内容
助手: (使用 r.jina.ai 获取)
本目录包含 fetch.sh 脚本,可直接调用:
./fetch.sh https://example.com
./fetch.sh https://example.com jina
让网页内容获取不再受限 🌐