AI爬虫被挡住,是GEO里最常见的隐形故障。说它隐形,是因为它不报错、不提示,页面照常打开,收录照常进行,只有一个后果你没发现:AI那边永远读不到你的内容。
你站上会出现哪几种AI爬虫
常见的有几个:OpenAI的GPTBot,Anthropic的ClaudeBot,Perplexity的PerplexityBot,Google用于AI功能的Google-Extended,字节的Bytespider,还有Common Crawl的CCBot。
名字混个脸熟就行,别硬背,这份清单一直在变。真要写规则的时候,去各家官方文档对一遍,比看任何整理文章都可靠。
robots.txt里常见的写法错误
第一个错,抄了禁止所有爬虫的模板。有些安全加固文章会建议你直接禁止全部UA,图省事,结果把好爬虫一起挡了。
第二个错,写规则时只考虑搜索引擎爬虫。AI爬虫是另一批UA,搜索引擎能进不等于AI能进。
检查方法很简单,浏览器直接打开你域名下的robots.txt,看有没有针对这些UA的Disallow。
比robots.txt更隐蔽的一层:CDN拦截
如果你的站前面挂了CDN或者安全防护服务,它通常有一个独立的拦截AI爬虫开关。
这层拦截的特点是,请求根本到不了你的服务器,所以访问日志里什么都看不到。排查的时候,如果robots.txt没问题、日志里又完全没有爬虫记录,那大概率就是这一层在拦。
怎么确认爬虫真的来过
最直接的办法是翻访问日志,搜那几个UA标识。有记录就是进来了。
没有服务器权限的话,还有两个替代方案。一是用带指定UA的命令行请求去测,看返回的是不是正常页面。二是用在线抓取工具抓你的URL,看它拿到的正文完不完整。
注意要测的是内页,不是首页。很多站首页一切正常,内页被规则误伤。
各家AI爬虫的规矩不一样
这是最容易搞混的地方,也最值得说清楚。
不同UA管的事情不一样。有的控制内容能不能用于模型训练,有的控制能不能用于AI搜索回答,有的只管抓取入库做索引。你以为挡住了一个,实际挡住的是另一个。
拿Google-Extended举例。很多人以为禁止它就等于不让Google的AI用我的内容,但它实际的覆盖范围可能和你想的不一样,跟传统搜索收录更是两套机制。具体边界各家官方文档写得比任何二手文章都清楚,而且规则会变,别照抄网上的清单。
改完之后要等多久
改robots.txt不用等收录周期,爬虫下次访问就会读到新规则,一般几天内就能看到日志里有动静。
但爬虫来了不等于AI会引用你。从被抓取到出现在回答里,中间还隔着内容质量、索引、模型筛选好几道关。所以别指望改完第二天就见效,观察周期按周算。
真正要防的不是AI爬虫,是别让错误的配置把正常访问一起挡掉。很多站的GEO问题,追到最后就是一个从来没人检查过的拦截规则造成的。
相关阅读
A5创业网 版权所有