公告:网址大全导航目录www.btv85.com为各位站长提供免费收录网站的服务,VIP会员每天提交网站30、文章30免审核,快审服务(10元/站),可自助充值发布。

点击这里在线咨询客服 点击这里在线咨询客服
新站提交
  • 网站:223084
  • 待审:0
  • 小程序:16453
  • 文章:25974
  • 会员:230

今天BTV导航网的小编为你讲一下浅谈搜索引擎蜘蛛抓取网页规则相关的内容。

一,爬虫框架

上图是一个简单的网络爬虫框架图。种子URL入手,如图所示,经过一步步的工作,最后将网页入库保存。当然,勤劳的蜘蛛可能需要做更多的工作,比如:网页去重以及网页反作弊等。

也许,我们可以将网页当作是蜘蛛的晚餐,晚餐包括:

已下载的网页。已经被蜘蛛抓取到的网页内容,放在肚子里了。

已过期网页。蜘蛛每次抓取的网页很多,有一些已经坏在肚子里了。

待下载网页。看到了食物,蜘蛛就要去抓取它。

可知网页。还没被下载和发现,但蜘蛛能够感觉到他们,早晚会去抓取它。

不可知网页。互联网太大,很多页面蜘蛛无法发现,可能永远也找不到,这部份占比很高。

通过以上划分,我们可以很清楚的理解搜索引擎蜘蛛的工作及面临的挑战。大多数蜘蛛是按照这样的框架去爬行。但也不完全一定,凡事总有特殊,根据职能的不同,蜘蛛系统存在一些差异。

二,爬虫类型

1,批量型蜘蛛。

这类蜘蛛有明确的抓取范围和目标,当蜘蛛完成目标和任务后就停止抓取。具体目标是什么?可能是抓取网页数量,网页大小,抓取时间等。

2,增量型蜘蛛

这类蜘蛛和批量型蜘蛛不同,他们会持续不断的抓取,对于抓取到的网页会定期抓取更新。因为互联网中的网页是随时处于更新状态中,增量型蜘蛛需要能够反映出这种更新。

3,垂直性蜘蛛

这种蜘蛛只关注特定主题或者特定的行业网页。以健康网站为例子,这类专门的蜘蛛会只抓取健康相关主题,其它主题内容的网页则不抓取。考验这只蜘蛛的难点是如何去更精准的识别内容所属于行业。目前来看,很多垂直类行业网站是需要这种蜘蛛去抓取的。

三,抓取策略

蜘蛛通过种子URL进行爬行拓展,列出大量待抓取URL。但是待抓取URL数量庞大,蜘蛛如何确定抓取顺序先后呢?蜘蛛抓取的策略有很多种,但最终目的是一 个:优先抓取重要的网页。评价页面是否重要,蜘蛛会根据页面内容原创程度,链接权重分析等众多方式来进行计算。比较有代表性的抓取策略如下:

1,宽度优先策略

宽度优先是指:蜘蛛在抓取一个网页后,继续将该网页所包含的其它页面按顺序进行进一步抓取。这种思想看似简单,其实却很实用。因为大多数网页都是按优先级进行排序,重要的页面会优先在页面上进行推荐。

2,PageRank策略

PageRank是一种非常著名的链接分析方法,主要是用来衡量网页权重。如谷歌的PR,就是典型的PageRank算法。通过PageRank算法我们可以找出哪些页面是更重要的,然后蜘蛛优先去抓取这些重要性的页面。

3,大站优先策略

这个很容易理解,大网站通常拥有更多的内容页面,并且质量也会更高。蜘蛛会先分析网站归类与属性。如果这个网站已经收录很多,或者在搜索引擎系统中权重很高,则优先考虑收录。

四,网页更新

互联网中的页面大多会保持更新,这样就要求蜘蛛所存储的页面也能及时更新,保持一致性。打个比喻:一个网页之前排名很好,如果页面已经被删,却还有排名,那 体验就很不好。因此搜索引擎需要随时了解这些并更新页面,将最新的页面提供给用户。常用的网页更新策略在三种:历史参考策略,用户体验策略。聚类抽样策 略。

1,历史参考策略

这是建立在一种假设基础上的更新策略。比如,若你的网页之前按规律一直更新,那搜索引擎也认为你的页面将来也会经常更新,蜘蛛也会按这个规律定期来网站进行抓取网页。这也是为什么点水一直强调网站内容需要有规律更新的原因。

2,用户体验策略

一般来说,用户只会查看搜索结果前三页的内容,后面的页面很少有人去看。用户体验策略就是搜索引擎根据用户的这个特点来进行更新。例如,一个网页可能发布时 间较早,一段时间没更新,但是用户依然觉得有用,点击浏览它,那么搜索引擎先不去更新这些过时的网页也是可以的。这就是为什么搜索结果中,并不一定最新的 页面排名一定靠前的原因。排名更多的是取决于这个页面的质量,而完全不是更新时间先后。

3,聚类抽样策略

上两种更新策略主要是参考了网页的历史信息。但存储大量历史信息对搜索引擎来说是一种负担,另外如果收录的是新网页则是没有历史信息可以参考的,那怎么办? 聚类抽样策略是指:根据网页所展现出来的一些属性,来将很多相似网页进行归类,被归类的页面按照相同的规律去进行更新。

从了解搜索引擎蜘 蛛工作原理的过程中,我们会知道:网站内容之间的相关性,网站与网页内容更新规律,网页上链接分布以及网站权重高低等因素都会影响到蜘蛛的抓取效率。知已 知彼,让蜘蛛来得更猛烈些吧!

通过对浅谈搜索引擎蜘蛛抓取网页规则的详细介绍,希望对你有所帮助,我们提供了更多和浅谈搜索引擎蜘蛛抓取网页规则类似的相关内容推荐,可以你更全面的帮助你解决问题。我们BTV85网址导航还提供网址收录服务,你可以注册提交你的网站信息,帮你引导搜索引擎蜘蛛,同时还有网站SEO优化交流微信群,里面很多SEO高手和大咖,加友链,可以免费进群。

浅谈搜索引擎蜘蛛抓取网页规则同类内容推荐:
  • 隐秘的档案十八岁的生日通关攻略

    隐秘的档案十八岁的生日是一个规则怪谈关卡,女生生日来了,妈妈表现的很奇怪,大家需要遵守规则才能活下去。下面 2023-08-03

  • 隐秘的档案墓地惊魂攻略详细介绍

    隐秘的档案墓地惊魂是一个恐怖探索关卡,主角和上司去墓地巡逻,大家需要做出正确选择。以下是隐秘的档案墓地惊 2023-08-03

  • 梦幻西游网页版清凉一夏第一阶段攻略

    梦幻西游网页版清凉一夏是最新的暑期活动,目前已经开启了第一阶段,大家可以参与活动获得福利。下面为大家带来 2023-06-27

  • 梦幻西游网页版仲夏端午攻略分享

    梦幻西游网页版仲夏端午是2023端午活动,本次活动共分为五大板块,分别为香囊祈福、江神馈赠、经营粽铺、齐造龙 2023-06-21

  • 梦幻西游网页版五行斗法2023年6月打法攻略

    梦幻西游网页版2023年6月五行斗法已经上线,大家需要根据不同擂台属性,选择合适阵容上阵。下面为大家带来梦幻 2023-06-20

  • 口袋奇兵装饰物商城玩法说明

    口袋奇兵装饰物商城是游戏最新上线的玩法,可以兑换购买各种装饰物,帮助属性升级,战力突破。下面为大家带来最新 2023-03-04

  • 金铲铲之战红蓝争霸玩法规则说明

    金铲铲之战红蓝争霸是最新上线的4v4玩法,玩家会被分成不同颜色的阵营,两两进行战斗,一方血量归零时另一方获胜 2023-03-02

  • 梦幻西游网页版小试牛刀王世充打法攻略

    梦幻西游网页版小试牛刀王世充怎么打?挑战特性为重整残兵,战斗开始时在我方出现4位唐军残兵,大家可以用秒三推 2023-03-01

  • 梦幻西游网页版大闹天宫御马监通关攻略

    梦幻西游网页版大闹天宫御马监怎么过?挑战共包含简单、困难、炼狱三个难度,同层多关卡不能上重复的伙伴和宠物 2023-02-22

  • 梦幻西游网页版五行斗法2023年2月打法攻略

    梦幻西游网页版2023年2月五行斗法怎么打?五行斗法共有五个不同属性的擂台以及一个最终试炼,大家需要根据怪的 2023-02-21

  •   admin

    注册时间:

    网站:0 个   小程序:0 个  文章:0 篇

    • 223084

      网站

    • 16453

      小程序

    • 25974

      文章

    • 230

      会员

    赶快注册账号,推广您的网站吧!
    热门网站
    最新入驻小程序

    小朋友猜谜语2021-05-24

    小朋友猜谜语是一款学习教育类的

    球比分2021-05-24

    球比分是一款体育运动类的小程序

    匠人名片2021-05-24

    匠人名片是一款交友社交类的小程

    知晴2021-05-24

    知晴是一款生活服务类的小程序应

    优惠券查询工具2021-05-24

    优惠券查询工具是一款其他工具类

    成语词典汉字拼音故事大全字典2021-05-24

    成语词典汉字拼音故事大全字典是