如何提高Spider抓取网站?提高spider抓取策略是什么?

网站蜘蛛的到访是每个SEO的关注重点,因为没有spider蜘蛛到访,网站就不会有收录。你再网站上所做的一切优化将成为一个笑话。SEOer每天都要看log日志,spider爬取的方向,抓取了网站哪些内容,没有抓取网站哪些内容,再没有抓取的页面上做调整,争取被收录。怎样提高爬虫抓取频率?下面笔者简单介绍提高spider抓取网站的策略,提高spider抓取策略有哪些?

抓取友好性:调整spider抓取压力,因为带宽访问压力大可能会影响网站,从而影响正常用户访问,调整到好抓取压力,既不影响网站的正常用户访问,又能让spider抓取有价值性的页面。

一:压力过低站点不利于网站收录  

抓取压力过低,说明网站蜘蛛不够活跃,说明搜索引擎访不会经常访问网站,这时可能会造成原创文章被抄袭,排名靠后等等,还有一种情况就是网站有再多高质量的文章也不会被收录,因此这是要把工作重点放在站外“引蜘蛛”上,少量更新原创文章即可,增加搜索引擎对你网站的好感度,从而提升站点抓取压力增加搜素速度和收录量。  

如何提高spider抓取网站?提高spider抓取策略是什么?.jpg

二:站点抓取压力不是越高越好  

站点抓取压力越高网站蜘蛛就越活跃,的确利于网站收录,但是站点抓取压力过高的网站,搜索引擎会占据你大量服务器资源,造成网站用户访问速度慢甚至打不开等情况,另一方面压力过高蜘蛛活跃站点如果没有足够信息或者高质量内容支撑的话,搜索引擎会对网站失去信任。可能会对网站进行网站降权处理。因此站点压力不是越高越好。  

2、站点的抓取速度

如果在同一个站点,抓取速度控制有两类:一类是一段时间内的抓取频率;另一类是一段时间内的抓取流量;

二、常用抓取返回码示意

1、404英文名称:“NOT FOUND”,表示该网页已经失效,通常在库中删除,spider如果发现这条URL是不会抓取的。

2、503英文名称:“Service Unavailable”,表示该网页暂时不能访问。网页返回503状态码,百度spider不会直接删除这条URL,再访问多次的情况下,网页如果恢复正常,就能正常抓取。如果继续返回503,才会认为是失效链接,从库中删除。

3、403英文名称:“Forbidden”, 表示该网页目前禁止访问。如果生成的是新的URL,spider是暂时不会抓取,也是会再访问多次;如果是被收录的URL,不会直接删除,短期内同样反复访问几次。如果网页正常访问,则正常抓取;如果仍然禁止访问,那么这条URL也会被认为是失效链接,从库中删除。

4、301英文名称:“Moved Permanently”, 表示该网页重定向到新的URL。如果站点需要更换域名、站点改版的情况下,需要设置301重定向,也可以在站长平台上网站改版工具提交,有效减少网站的流量损失。