当前位置:首页百度如何判断网页文章的重复度 举报文章

百度如何判断网页文章的重复度

作者:admin    来源:用户投稿    时间:2016.5.28   

  在这个科技高度发达的时代,百度已经成为人们能获取消息的主要途径。但如今的百度,到处充斥着一些重复的内容,对用户的访问造成很大的困扰。因此,百度需要对网页重复进行判断,对重复的网页,只选取一些高质量的我那工业,共用户浏览。然而,现有技术中一般是通过比较两个页面的内容和借点,来确认两个页面的相似度。

u=1429713172,1272127219&fm=21&gp=0

  这种方法能够计算的比较准确,可时间复杂度太高,计算很费时间。通过对一个页面中的某些重要信息进行签名,然后比较两个页面的签名,来计算相似度,这种方式比较简单高效,计算速度比较快,比较适合百度这种海量信息的应用场景。

  1,网站重复内容的判断

  A,获取多个网页;

  B,分别提取网页的网页正文;

  C,从网页正文中提取一个或多个句子,并根据一个或多个句子计算网页正文句子签名;

  D,根据网页正文句子签名对多个网页进行聚类;

  E,针对每一类下的网页,计算网页的附加签名;

  F,根据附加签名判断每一类下的网页是否重复。

  通过上述方式,网页重复的判断系统及其判断方法通过包括网页正文句子签名在内的多维度签名有效且快速地判断网页是否重复。

广告图

  网站页面基本架构

  提取正文

  A,对网页进行分块;

  B,对分块后的网页进行块过滤,以获取包含网页正文的内容快;

  C,从内容块中提取网页正文。

  正文分句

  A,对网页正文进行分句;

  在本步骤中,可利用分号,句号,感叹号等表示句子完结的标志符号来对网页正文进行分句。此外,还可以通过网页正文的视觉信息来对网页正文进行分句。

  B,对分句后的网页正文进行过滤及转换;

  在步骤中,首先过滤掉句子中的数字信息;版权信息以及其他对网页重复判断不起决定性作用的信息。随后,对句子进行转换,例如,进行全角/半角转换或者繁体/简体转换,以使得转换后的句子的格式统一。

  C,从过滤及转换后的网页正文中提取最长的一个或多个句子;

  在本步骤中,过滤及转换后的网页正文提取出最长的一个句子或者做场的预定数量连续句子的组合。例如,某个网页实例中,经过过滤及转换后的某段最长,远超其他句子,因此可选择该段为网页正文句子,或者选择最长的连续句子组合作为网页正文句子。

  D,对一个或多个句子进行hash签名运算,以获取网页正文句子签名。

  simhash算法就是比较各网页的附加签名是否相同或相似来判断网页是否重复。具体来说,在比较利用simhash签名运算获得的网页正文签名时,比较网页正文签名的不同位数,不同位越少,表示网页重复的可能性越高,在比较其他的附加签名时,若附加签名相等,表示网页在该纬度上重复。

  总结:

  1、两个网页的真实标题签名相同。

  2、两个我那工业的网页内容签名相同。

  3、两个网页的网页正文签名的不同位数小于6.。

  4、两个网页的网页位置签名相同,并且url文件名签名相同。

  5、评论块签名、资源签名、标签标题签名、摘要签名、url文件名签名中有三个签名相同。

  附加信息整站判断重复标准:

  通过两两页面比较,可以得到真重复url的集合。一般来说,如果这个真重复url集合中的网页的数量/整个网页集中网页的数量大于30%,则认为整个网页集都是真重复,否则就是假重复。

好文打赏,给Ta鼓励
扫一扫用手机阅读本文
Tags:百度  如何  如何判断  判断  断网  网页  文章  重复  
  • 相关搜索
图片推荐
    细说百度快照不更新和退档原因(一)

    细说百度快照不更新和退档原因(一)

    百度现在算法更新的很快,越来越多的站点已经无法满足百度的标准,而对于新站点和老站点来说,如何优化才能达到百度的基本要求呢,接下来还是听我汇道小潘先给你讲解今天的重点,《百度快照不更新和退档原因》(一)
    如何利用江湖商圈O2O系统快速引流吸粉

    如何利用江湖商圈O2O系统快速引流吸粉

    不管运营任何一个平台,粉丝(用户)才是最重要的,我们最终的目的是要吸引消费者关注到我们,信任我们,才会依赖我们的平台。如今,互联网大潮下,做外卖O2O的、做商圈的O2O、做本地门户网站的那么多,而我们
    反正不缺网红,微博顺手做了个可打赏的知乎 Live

    反正不缺网红,微博顺手做了个可打赏的知乎 Live

    语音直播不是件新鲜事。十年前 QQ 聊天室 和 YY 语音就让其初现雏形,再后来直播热潮掀起后,不管是红点直播这样的独立 App 还是知乎 Live,都在抢滩用户听的直播场景。    现在,靠着一直播
    阿里前CEO卫哲:B2B的三差、四率、两大坑!

    阿里前CEO卫哲:B2B的三差、四率、两大坑!

    卫哲提出中国B2B行业历史远超B2C电商,但始终没有迎来大爆发,很大因素是该行业的发展轨迹与实体经济发展规律相反,当经济萧条时反而B2B行业出现增长。  他还指出,B2B是分蛋糕的行业而不是做蛋糕,平
    O2O模式下怎么获取精准用户

    O2O模式下怎么获取精准用户

    你是不是熟读各种推广宝典,想一展身手,然后网是撒出去了,但是捕的是星光捞上了月亮!  你是不是对自己的产品充满信心,相信自己能在刀光剑影中登上华山之巅,一俯群雄,但是修炼了数十载却功力平平!    很
    金沙江创投罗斌:我如何命中映客、ofo两只独角兽?

    金沙江创投罗斌:我如何命中映客、ofo两只独角兽?

    2016年,寒潮席卷创投圈,很多创企因为拿不到钱而渴死在了半路。不过,再冷的寒冬也不乏资本的宠儿,部分公司的融资金额和频度依然高得让人咂舌。OFO和映客便身列其中。  这两个项目背后的早期投资人里,都
你是怎么知道非凡网赚网的?
  •   
  • 联系QQ 邮箱:976382653@qq.com 微信:976382653
    在线留言
    发布软文
    广告自助购
    文章调用
    常见问题
    保存到桌面