网站内容被AI抓取怎么办?robots与协议层面的应对

来源:互联网 时间:2026-09-25

网站内容被AI抓取怎么办,是这两年站长新多出来的烦心事。过去怕的是搜索引擎不抓,现在还要操心各类AI训练与问答系统把整站内容批量拿走,用来喂自己的模型,原创站反而成了别人的素材库。应对不能靠堵,得在 robots 与协议层面把权限说清楚、把边界划明白。

一个做行业报告内容的站,发现自己的文章频繁出现在某AI问答的回答里,原文却零引用。后来它在 robots 和协议层做了规范,抓取行为明显收敛。下面从协议到配置一步步讲。

一、先搞清:谁在抓、抓什么

应对前先知道对手是谁。打开服务器访问日志,看哪些 UA 在高频请求你的页面,哪些是陌生的爬虫、哪些是已知的AI采集方。不看清就乱禁,可能误伤正常搜索引擎,反而害了自己。

下面这段脚本帮你审计日志:把 LOG 改成你自己的访问日志路径,它按 UA 统计请求量和占比,跑完你一眼能找出异常高的抓取源。

# 审计访问日志,按 UA 统计请求量,找出异常抓取源
import re
from collections import Counter

LOG = "/var/log/nginx/access.log" # 改成你的日志路径

ua_counter = Counter()
with open(LOG, encoding="utf-8", errors="ignore") as f:
for line in f:
m = re.search(r'"([^"]*)"\s*$', line) # 取行末最后一个引号串,即 UA
if m:
ua_counter[m.group(1)] += 1

for ua, n in ua_counter.most_common(10):
print("%6d %s" % (n, ua))

跑完重点看那些『量大且陌生』的 UA,列成清单,下一步针对性处理,别一刀切。

二、用 robots.txt 声明抓取边界

robots.txt 是站点和爬虫之间的第一份协议。对不希望被AI抓取的路径,用 Disallow 明确拒绝;对已知AI方,可在 User-agent 里单独写明。注意 robots 是『君子协定』,主流方会遵守,但恶意方不会,所以不能只靠它。

下面这段脚本按你的规则生成 robots.txt:把 UA_BLOCKS 和 DISALLOW_ALL_PATHS 改成你自己的配置,它输出可直接部署到站点根目录的文件,跑完在终端打印出内容供你核对。

# 按规则生成 robots.txt,声明哪些路径禁止抓取
UA_BLOCKS = { # 针对性禁止的抓取方及其路径
"ai-bot": ["/premium/", "/draft/"],
}
DISALLOW_ALL_PATHS = ["/admin/", "/draft/"] # 全量禁止的路径

lines = ["User-agent: *"]
for p in DISALLOW_ALL_PATHS:
lines.append("Disallow: " + p)
for agent, paths in UA_BLOCKS.items():
lines.append("")
lines.append("User-agent: " + agent)
for p in paths:
lines.append("Disallow: " + p)

with open("robots.txt", "w", encoding="utf-8") as f:
f.write("\n".join(lines) + "\n")
print("robots.txt 已生成:")
print("\n".join(lines))

生成后放到站点根目录,浏览器访问 /robots.txt 确认不是 404,再等爬虫下次抓取生效。

三、协议层再做一层:抓取频率与授权声明

除了 robots,还可在站点协议或页面元信息里声明内容使用边界,比如对批量抓取接口做频率限制、对敏感栏目加授权校验。对公开内容,至少让正常访客和合规爬虫顺畅,对异常高频的陌生 UA 在服务器层限流。

做法是 nginx 或应用层对单 IP 或 UA 设请求阈值,超了返回限速。这一步挡的是『暴力采集』,保护服务器也保护内容。

四、持续监控与回溯

配完不是结束。每周回看日志,确认异常 UA 是否收敛;定期用搜索或AI问答验证自己的内容是否仍被无授权引用。若发现新的抓取源,补进 robots 和限流规则。

验证看两件事:异常 UA 的请求量是否下降、服务器负载是否平稳。协议层应对的核心是『划清边界、留好证据、持续盯防』,而不是指望一次配置永逸。

相关阅读:

《网站内容被AI抓取还不知道?先把抓取权限设清楚》

《文章都是自己写的为什么不算原创?问题在这几处》

《标题改了流量没涨?先看关键词有没有放对位置》

相关文章

标签:

A5创业网 版权所有