查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。
Common Crawl URL Index Miner是一项面向实际任务的技能,主要用于查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照;适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫;
它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。
使用与您的环境匹配的上游安装或设置路径:
来自上游的要求和注意事项:
基本用法或入门说明:
该项目提供了一组全面的示例查询(SQL)以及 Java 代码,用于获取并处理由 SQL 查询匹配的 WARC 记录。
运行 mvn spotless:check 和 mvn spotless:apply,参见 Spotless Maven 指南。Java 格式化规则定义在 [eclipse-formatter.xml](eclips...
运行表格转换工具,此处显示命令行帮助 (--help):
Source: https://github.com/1991513ccie-png/skills
Extracted from upstream docs: https://raw.githubusercontent.com/commoncrawl/cc-index-table/HEAD/README.md