网站内容被别人采集还抢排名,是站长最憋屈的一种情况:自己的原文排在后面,搬走的反而在前面。原因往往不是对方有多强,而是你这边少做了几件事,让搜索引擎分不清谁是源头。下面这几招,都是在后台能直接动手的。
一、先把原创的身份标识补齐
内容刚发出去的那几个小时最关键,得让搜索引擎知道你才是首发。做法是在页面里写清发布时间、更新时间,把作者信息、站点信息补全,正文里保留你特有的表述。这几样东西单独看都不起眼,合在一起就是一份完整的原创身份说明。
二、主动提交,缩短被发现的时间
新文章发布后立刻提交收录,让搜索引擎第一时间抓到你的版本。常用的入口有站点地图推送和手动提交。提交的同时把文章的内部链接做好,让它在站内能顺着链接被爬到。你抓取在前,时间记录在你这边,后面判断原始来源时就有利得多。
三、结构上做点对方抄不走的东西
纯文字最容易被整段搬走,加上对方抄不了或者抄了也没用的元素就难办了。比如把关键步骤做成站内可交互的表格,把核心结论和站内其他文章交叉引用,把重要数据用图片呈现并保留原始文件。对方即使搬正文,内链和结构也搬不走,用户点进去发现用不了,行为数据会给出答案。
四、被发现搬运之后的动作
发现自己的内容出现在别的域名下,先别急着公开对骂。按顺序做三件事:固定证据,把对方页面和你的原文同时保存;通过搜索引擎官方入口提交原创保护申请,写清原始地址与首次发布时间;再通过对方站点的联系方式要求删除。三步走完,多数情况能解决。
下面这段脚本用来排查站内哪些文章最容易被整段搬走:它扫描目录下的页面,统计每篇正文字数和站内出链数量,正文长、内链少、结构简单的页面最容易成为目标。要改的是 ROOT 目录。跑完把排在最前面的几篇挑出来,优先给它们补内链和结构。
# 找出站内正文偏长、内链偏少的页面,优先加固
import os, re
ROOT = r"./www" # 改成你的页面目录
def visible(html):
html = re.sub(r"(?is)<(script|style).*?", " ", html)
return re.sub(r"\s+", " ", re.sub(r"(?s)<[^>]+>", " ", html))
rows = []
for dirpath, _, files in os.walk(ROOT):
for name in files:
if not name.endswith(".html"):
continue
path = os.path.join(dirpath, name)
html = open(path, encoding="utf-8", errors="ignore").read()
body = visible(html)
links = len(re.findall(r'(?i)<a\s[^>]*href="(?!https?://)', html))
rows.append((len(body), links, path))
for n, links, path in sorted(rows, reverse=True)[:10]:
print("正文", n, "字 站内链", links, path)
与其等被抄了再生气,不如发文章时就把原创标识、提交抓取、站内结构三件事一起做完。做到位了,被采集还抢排名的情况会明显变少。这三件事都不需要额外花钱,只是发文章时多花几分钟,长期做下来是最省事的办法。
相关阅读:
A5创业网 版权所有