robots.txt是个神奇的文件:一共几十行,写对了没人夸,写错了全站禁止收录。真实案例年年有——想屏蔽一个测试目录,写成Disallow: /,第二天全站从搜索结果消失。这个文件交给AI写可以,但生成之后的校验一步都不能省。
给AI的提示词要把网站结构交代清楚,尤其是哪些目录必须放行、哪些必须屏蔽:
请帮我生成robots.txt,网站信息如下:
1. 域名:example.com,纯内容站,ASP+静态页面
2. 必须屏蔽:/Admin/(后台)、/super/(数据库目录)、
/tmp/(临时文件)、*.asa、*.mdb 文件
3. 必须放行:/article/、/news/、/images/、sitemap.xml
4. 希望限制抓取频率但不要禁止:无
5. 搜索引擎:全部允许(Baiduspider、Googlebot必收)
6. 请逐条注释每条规则的作用,并解释User-agent匹配顺序
拿到AI的输出,三道校验挨个过。第一道,语法层:字段名有没有拼错(User-agent不是User_agent)、冒号后面有没有空格、路径通配符写法对不对。这一道可以用在线校验器辅助,但别全信,工具也有滞后。
第二道,逻辑层,人肉读。重点盯三处:Disallow: / 这种“全站禁止”是不是手滑写出来的;User-agent分组有没有写对——某组写*,另一组写Googlebot,Googlebot只匹配它自己的组,不继承*组的规则;Sitemap地址是不是绝对URL(要带域名和协议)。
# 验证robots.txt是否生效(两个搜索引擎各查一次)
https://www.google.com/robots.txt # 参考官方写法
curl -s https://example.com/robots.txt
# 用Google Search Console的robots.txt测试工具:
# 设置 -> robots.txt报告,可逐URL测试是否被允许抓取
# 百度:搜索资源平台的robots检测工具
第三道,实测层:部署之后,用Search Console的robots测试工具把核心页面的URL挨个测一遍,确认全部返回“允许抓取”;再等几天看抓取统计,出现断崖式下跌立刻回滚。上线前先备份旧文件,出问题秒级恢复。
还有一个AI容易踩的坑值得单独说:AI有时候会主动“好心”加上Crawl-delay,或者把一些它认为“不该收录”的目录顺手屏蔽,比如你的标签页、分页。这些都不是你要的结果。生成的每一行都要过目,AI给的是草稿,不是答案。
A5创业网 版权所有