有人问我:把别人的文章换几个词、调一下语序,算不算原创,会不会被收录。这个问题得拆成两半回答——搜索引擎能不能识别出来,以及识别出来之后收录会怎样。前一半有技术逻辑可讲,后一半有大量实际观察。这篇重点放在前一半,并且给出真的能用的替代做法。
一、结论先摆出来
简单替换同义词、调整段落顺序、把几篇别人的文章拼接起来,本质上是同一篇文章的变体,不属于原创内容。搜索引擎对这类内容的处理不是一刀切删除,而是降低质量评估,表现是收录变慢、收录之后不展现、站点整体信任度下降。影响不只落在那一篇上。还有一点要说清:被识别不等于一定会被处罚,很多时候是页面在排序里拿不到机会,这种隐性的影响比明面上的处罚更常见。
二、算法识别大概是怎么做的
不需要知道具体的模型名字,理解机制就够了。机制大概有五层:句子级相似度比对,看有没有大段连续相同的表达;段落级指纹,把段落切块之后做哈希,比对是否命中同一批来源;语义层面的相似,就算把词全换成同义词,意思一样照样会被判近似;标题与正文的错位检测,标题新写、正文照搬,这种组合本身就是典型特征;发布时序,同一批内容在短时间内批量出现,来源方向也容易看出来。
五层里最先被命中的通常是句子级比对。因为大多数改写工具动的是词,句子骨架没变,几句话连在一起照样能对上。
三、自己动手测一遍相似度
与其猜,不如自己算。Python 标准库里就有现成的工具,拿两段文本跑一次,重合的片段一目了然:
# 文本相似度自检:找出两篇文章里高度重合的片段
import difflib
mine = '''内链是把站内权重引导到目标页面的通道,做法是让相关文章互相链接,
锚文本使用目标关键词,同时保证新页面能从首页或栏目页两步点到。'''
other = '''内链的作用是将站内权重传递到目标页面,具体做法是让相关文章互相链接,
锚文本使用目标关键词,并且保证新页面能从首页或栏目页点击到达。'''
ratio = difflib.SequenceMatcher(None, mine, other).ratio()
print("整体相似度: %.2f" % ratio)
matcher = difflib.SequenceMatcher(None, mine, other)
for block in matcher.get_matching_blocks():
if block.size >= 8:
print("重合片段:", mine[block.a:block.a + block.size])
跑出来相似度高的部分,就是搜索引擎最容易识别出来的地方。把目标文本换成自己的站和其它站的同类文章,多测几组,你大概就能摸到判定的松紧。
四、替代方案一:做增量,而不是改写
与其把别人的文章改一遍,不如在别人讲清楚的基础上加东西。加什么?加你自己的实测结果、加本地化的信息、加一份可执行的操作清单、加一份对比表格。这种做法的逻辑是:页面的主体表达是你的,引用部分只作为背景并且标注来源,而页面的信息增量是对手没有的。
五、替代方案二:换体裁
同一个题目的信息,可以用完全不同的体裁重新组织。别人的教程是步骤式,你可以写成自己踩坑的复盘;别人的科普是长文,你可以做成问答清单;别人的行业报道是综述,你可以做成时间线加解读。体裁变了,表达和组织方式天然不同,内容还是你自己的理解。
六、替代方案三:把资料整理做成有观点的整理
整理公开资料本身没问题,问题在于是不是只做了搬运。同样是整理一个行业的政策变化,只把原文抄下来那是搬运;按时序排好、标出变化点、说明对哪类站点有影响、给出行动建议,那就是有加工的内容。差别在于你有没有自己的判断。还有一个更实际的做法:把你整理过的内容做成站内可以持续更新的页面,比如每个季度更新一次,页面本身就有了长期价值。
七、几条执行底线
引用别人的内容,标出来源并控制篇幅,别整段照搬;不用批量替换同义词的工具,那种方式在语义比对面前基本无效;不要一天之内发十几篇来源相近的内容,节奏本身就是信号;发现自己站里已经有一批这样的内容,先停下来,别继续往上加。
八、结论
伪原创对收录的负面影响是真实存在的,而且不是运气不好被抓住的问题,是机制上的必然。真正划算的路是少做几篇、每篇多花点时间加上自己的东西。产量看着低了,收录和展现反而会更稳。判断标准放到用户身上也一样:一篇内容如果用户一眼能看出来是从别处搬来的,它在搜索里的机会就已经很小了。
相关阅读:
A5创业网 版权所有