cloudflare 近期宣布对其服务默认规则进行重大调整,为整个 ai 行业设定了明确的合规时间表——所有 ai 企业须于 9 月 15 日前 完成整改。新规要求 ai 厂商必须将搜索爬虫与模型训练、ai 代理专用爬虫严格区分;若继续使用未作区分的混合型爬虫访问带有广告的网页,系统将自动实施拦截。
此次更新适用范围极广:不仅涵盖新入驻平台的客户,还包括老用户新建站点,以及全部免费层级的网站,均统一执行该策略。对于希望继续允许混合爬虫访问的网站管理员,唯一可行方式是手动进入后台修改相关配置。这一变化直接重塑了 AI 企业获取网页内容作为训练数据的传统路径。
现实中,大量站长乐于向传统搜索引擎开放内容以支持索引与检索,却普遍反对自身知识产权被 AI 公司无偿、大规模用于模型训练。Cloudflare 明确指出,当前谷歌的主爬虫(Googlebot)兼具搜索收录与 AI 数据采集双重职能,导致网站运营者难以实现“仅开放搜索、屏蔽 AI 训练”的精准控制。对此,谷歌已推出专门的机器人管理工具,允许站点针对性屏蔽 AI 训练用途的数据抓取,同时保留常规搜索收录功能。
然而,其核心爬虫仍会在执行搜索任务过程中同步采集数据,服务于内置 AI 功能,因此搜索与 AI 数据需求在技术层面仍难以完全解耦。平台 CEO 强调,当前机器人流量规模早已远超人类真实访问量,整个行业亟需建立更清晰、更具约束力的抓取行为规范。
为强化对内容创作者权益的保障,Cloudflare 持续升级其反 AI 爬虫工具体系:自 2024 年初推出的防 AI 抓取方案,现已进化至全新的 按价值计费模式(Pay Per Use)。过去平台按爬虫请求次数收费,而新版机制则依据内容在 AI 应用中所产生的实际商业价值进行结算。数据显示,超过一半的 AI 爬虫存在重复抓取静态、无更新页面的现象,新付费机制有望显著降低无效请求,切实提升创作者收益。
目前,该付费方案已与两家头部 AI 企业启动联合试点——当网站内容被 AI 产品调用并产生商业化应用时,站长可直接获得对应收益分成。在版权监管日益趋严的大背景下,这项新规正倒逼 AI 企业提升数据抓取的透明度与合规性,同时也赋予网页内容创作者更强的内容主权与议价能力。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜










