蜘蛛抓取数据做成报表

想知道百度蜘蛛每天来多少次、都在抓哪些目录,多数人的第一反应是去搜索资源平台看抓取频次曲线。那条曲线只有全站总量,拆不出目录维度,也看不出哪个页面被抓爆、哪个页面从没被碰过。这些细颗粒度的答案,其实全躺在access.log里,一把awk就能挖出来。Nginx默认的combined格式里,第7个字段是请求URL,第9个字段是返回码,第4个字段是带时区的时间。先用grep把蜘蛛UA过滤出来,再用aw

A5创业网 版权所有