Cloudflare默认拦截AI训练与Agent爬虫,搜索保持放行

来源:互联网 时间:2026-09-20

A5站长网消息,Cloudflare调整了AI爬虫的默认策略。按官方公告,新接入的站点以及仍在使用默认设置的免费版账户,广告承载页面上的训练类与智能体类爬虫将被默认拦截,搜索类爬虫保持放行。官方同时上线了Disallow AI Training这一设置,允许站点在拒绝AI训练的同时继续留在搜索结果中。

这次调整把此前的一个开关拆成了三个独立控制项:搜索、AI训练、AI智能体。站点可以分别设置为允许、仅在展示广告的页面拦截、或全站拦截。官方同时用Bot Preference Sync取代了原先的托管robots.txt功能,让站点只需设置一次抓取偏好,即可自动同步到所有受支持的爬虫,避免后台设置与robots.txt长期不一致。

真正需要留意的是混合用途爬虫的处理规则。一个爬虫如果同时承担索引与训练两种用途,会按其中更严格的规则执行。这意味着站点若选择拦截训练,本身兼具搜索与训练身份的爬虫可能连正常的搜索抓取一并失去。官方公布的数据是,混合用途爬虫已占其网络内已验证爬虫流量的36.6%,是单一类别中占比最高的一类。

官方给出的四项目标是:提供明确的方式让站点通过robots.txt或类似标准选择退出训练;允许站点拒绝AI生成的搜索摘要;提供URL级别的可见性,让站点看到内容如何被用于搜索与训练;公开确认退出训练不会影响站点在传统搜索中的排名。官方表示,苹果、谷歌与微软已被标注为符合这些条件,或给出了明确的达标时间表。

对站长来说,这次调整既是配置问题也是决策问题。多数站点并不想从搜索里消失,因此更合适的做法是使用明确针对训练的退出选项,而不是沿用旧的整体拦截开关;如果站点有广告收入且担心内容被无偿用于训练,可以只在广告页面上应用拦截规则。调整完成后建议回后台复核实际生效的控制项,而不是只看旧开关的名称。

相关文章

标签:

A5创业网 版权所有