什么是搜索引擎机器人及蜘蛛抓取策略

张子凡 搜索引擎优化研究 2012-08-09 08:10:01 阅读(...) 评论(4)

搜索引擎机器人也称网络蜘蛛（Web Spider），这是一个很形象的名字。把互联网比喻成一个蜘蛛网，那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛通过网页的链接地址来寻找网页，从网站某一个页面（通常是首页）开始，读取网页的内容，找到在网页中的其它链接地址，然后通过这些链接地址寻找下一个网页，这样一直循环下去，直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网站，那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。

在抓取网页的时候，网络蜘蛛一般有两种策略：广度优先和深度优先（如下图）。

广度优先深度优先

广度优先是指网络蜘蛛会先抓取起始网页中链接的所有网页，然后再选择其中的一个链接网页，继续抓取在此网页中链接的所有网页。这是最常用的方式，因为这个方法可以让网络蜘蛛并行处理，提高其抓取速度。

深度优先是指网络蜘蛛会从起始页开始，一个链接一个链接跟踪下去，处理完这条线路之后再转入下一个起始页，继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比较容易。

由于不可能抓取所有的网页，有些网络蜘蛛对一些不太重要的网站，设置了访问的层数。例如上图A为起始网页，属于0层，B、C、D、E、F属于第1 层，G、H属于第2层，I属于第3层。如果网络蜘蛛设置的访问层数为2的话，网页I是不会被访问到的。这也让有些网站上一部分网页能够在搜索引擎上搜索到，另外一部分不能被搜索到。对于网站设计者来说，扁平化的网站结构设计有助于搜索引擎抓取其更多的网页。

网络蜘蛛在访问网站网页的时候，经常会遇到加密数据和网页权限的问题，有些网页是需要会员权限才能访问。当然，网站的所有者可以通过协议让网络蜘蛛不去抓取，但对于一些出售报告的网站，他们希望搜索引擎能搜索到他们的报告，但又不能完全免费的让搜索者查看，这样就需要给网络蜘蛛提供相应的用户名和密码。网络蜘蛛可以通过所给的权限对这些网页进行网页抓取，从而提供搜索。而当搜索者点击查看该网页的时候，同样需要搜索者提供相应的权限验证。

除非注明，否则均为泪雪博客原创文章，禁止任何形式转载

本文链接：https://zhangzifan.com/what-is-search-engine.html

什么是搜索引擎机器人及蜘蛛抓取策略

相关推荐

百度搜索资源平台重要通知，站点实名认证提醒

搜索引擎喜欢什么样的原创文章，怎样才能做好排名

头条搜索 Bytespider 开始大规模抓取

百度飓风算法 3.0，控制跨领域采集及站群

百度信风算法，打击翻页诱导行为

百度搜索将打击网站内容获取需要权限才能查看的情况

关注公众号

活在互联网

创业就必须面对失败的结局

浅谈我如何接收国外短信验证码注册各类账号

花600元认证企业微博到底值不值

我为什么会愿意写博客分享经验和代码

这是创业的开始，也是全新的挑战

公司即将装修完成，进入开业倒计时

猜你喜欢

.host域名误判钓鱼网站被停止解析，不建议使用新通用顶级域名后缀建站

创业就必须面对失败的结局

Cloudflare批量重定向规则自定义筛选表达式，根据域名路径关键词跳转落地页