预选程序符合性检查列表
功能概述
预选程序符合性检查列表是一项面向实际任务的技能,主要用于在写入任何刮切代码之前 :. robots.txt – finave {domain}/robots.txt , 请检查目标路径是否被拒绝;1. 如果是, 请停止;
核心要点
- 服务条款 — 检查/ 术语, / to。
- 它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
- 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。
使用与执行
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
结果检查与注意事项
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
爬取前合规检查清单
在编写任何爬取代码之前,请完成以下步骤:
- robots.txt — 获取
{domain}/robots.txt,检查目标路径是否被 Disallow。若是,立即中止。
- 服务条款(Terms of Service) — 查阅
/terms、/tos 或 /legal 页面。若其中明确禁止爬取,则必须事先获得授权。
- 数据类型 — 公开的事实性数据(如价格、商品列表)相对安全;涉及个人数据则可能触发 GDPR/CCPA 合规要求。
- 身份认证 — 需登录才能访问的数据未经许可不得爬取。严禁爬取受保护内容。
- 是否存在 API? — 若网站提供官方 API,请务必使用 API。当 API 可用时仍进行爬取,通常违反服务条款。
法律边界
- 公开数据,无需登录 — 通常合法(参考 hiQ v. LinkedIn,2022)
- 绕过技术防护措施 — 存在违反《计算机欺诈与滥用法》(CFAA)的风险(参考 Van Buren v. US,2021)
- 无视 robots.txt — 属灰色地带,但常构成对服务条款的违约(参考 Meta v. Bright Data,2024)
- 未经同意收集个人数据 — 违反 GDPR/CCPA
- 重新发布受版权保护的内容 — 构成版权侵权
请求行为规范
- 限速控制:请求间隔至少 2–3 秒。过快请求将加重服务器负担,并带来法律风险。
- User-Agent:使用真实浏览器标识字符串,并附带联系邮箱,例如:
Mozilla/5.0 ... (contact: you@email.com)
- 尊重 429 状态码:收到 429 响应后须采用指数退避策略重试。持续忽略 429 表明存在恶意意图。
- 复用会话连接:保持 HTTP 连接复用(Keep-Alive),以降低服务器资源消耗。
数据处理规范
- 立即剥离 PII — 除非具备充分法律依据,否则不得采集姓名、邮箱、电话等个人信息。
- 禁止设备指纹追踪 — 不得通过组合多源数据间接识别特定自然人。
- 最小化数据存储 — 仅缓存必要数据,及时清理无用数据。
- 保留审计日志 — 记录所采集数据、时间、来源网址等信息;一旦遭遇质疑,可作为善意合规的证据。
关于代码实现模式及 robots.txt 解析器,请参见 code.md