华全通石业有限公司
    • 网站首页
    • 公司简介
      公司简介
      企业文化
    • 产品展示
    • 新闻动态
      公司新闻
      行业新闻
    • 成功案例
      成功案例
    • 客户服务
      售后服务
      技术支持
    • 人才招聘
    • 联系我们
      联系我们
      在线留言

    新闻动态Site navigation

    公司新闻
    行业新闻

    联系方式Contact


    地 址:北京市房山区66号
    电 话:17746429147
    网址:huaquantongstone.com
    邮 箱:84188640@qq.com

    网站首页 > 新闻动态
    新闻动态Welcome to visit our

    搜索引擎蜘蛛是怎么样抓取网站页面内容的

    分享到:
      来源:华全通石业有限公司  更新时间:2026-10-01 08:41:47  【打印此页】  【关闭】

    了(le)解搜索引擎的搜索工作原理是学习seo技术的一个非常(chang)重要的内容,比(bi)如(ru)说搜索引擎蜘蛛的引擎样(yang)抓抓取机制的了解,只有深入的蜘蛛站页了解了这些内容才会真正的明白关键词排名的(de)原理(li),seo优化到底是取网做什么的等等一系列问(wen)题。今天大宝seo博客和朋友们分享一下搜索引擎蜘蛛是面(mian)内怎么样抓取网站页面内容的,正文部分转载自网络。搜索

    互联网信息爆发式增长,引擎样抓如何有效的蜘蛛站页获取并利用这些信息是搜索引擎工作中的首要环节。数据抓取系统作为整个搜索系统中的取网上游,主要负责互联网信息的面内搜集、保存、搜索更新环节,引擎样抓它像蜘蛛一样在网络间爬来爬去,蜘蛛站页因此通常会被叫做“spider”。取(qu)网例如我(wo)们常用的面内几家通用搜索引擎蜘蛛被称为:Baiduspdier、Googlebot、Sogou Web Spider等。

    搜索引擎蜘蛛是怎么样抓取网站页面内容的

    Spider抓取系统是搜索引擎数据来源的重要(yao)保证,如果(guo)把web理解为一个有向图(tu),那么spider的工(gong)作过程(cheng)可以认为是(shi)对这个有向图的(de)遍历。从一些重要的种子 URL开始,通过页面上的超链接关系,不断的发现新URL并抓取,尽最大可能抓取到更多的有价值网页。对于类似百度这样的大(da)型(xing)spider系统,因为每时 每刻都存在网页被修改、删除或出现新的超链接的可能,因此,还要对spider过去抓取过的页面保持(chi)更新,维护一个URL库和(he)页面库。

    搜索引擎蜘蛛是怎么样抓取网站页面内容的

    下图为spider抓取系统的基本框架图,其中包括链接存储系统、链接选取系(xi)统、dns解析服务系统、抓取调度系统、网页分析系统、链接提(ti)取系统、链接(jie)分析系统、网页存储系统。Baiduspider即是通(tong)过这种(zhong)系统的通力合(he)作完成(cheng)对互联网页面的(de)抓取工作。

    搜索引擎蜘蛛是怎么样抓取网站页面内容的

    Baiduspider 主要抓取策略类型

    上图看似简单,但其实Baiduspider在抓取过程(cheng)中(zhong)面对的是一个超级复(fu)杂的网络环境,为了使系统(tong)可以抓取(qu)到尽可能多的有价值资源并保持系统及实际环境中页面的(de)一致性同时不给网站体验造成压力,会设计多种复杂的抓取策略。以下做简单介绍:

    1、抓取友好性

    互联网资源庞大的数量级,这就要求抓取系统尽可能的(de)高效利用带宽,在有限的硬件和带宽资源下尽可能多的抓取到有价值资源。这就造成了另一个问题,耗费被抓网站的(de)带宽造成访问压力,如果(guo)程度过大将(jiang)直(zhi)接影响被抓网站的正常用户访问行为。因此(ci),在抓取(qu)过程中就(jiu)要(yao)进行一定(ding)的抓取压力控制,达到既不影响网站的正常用(yong)户访问又能尽量多的抓取到有价值资(zi)源的目的。

    通常情况下,最基本的是基于ip的压力控制。这是因为如果基(ji)于域名,可能存在一个域名对多个ip(很多(duo)大(da)网站)或多个(ge)域名对(dui)应同一个ip(小网站共享ip)的(de)问题。实际中,往往根据ip及域名的多种条件进行压力调配控制。同时,站长平台也推出了压力反馈工具,站长可以人工调配对自己网站的(de)抓取压力,这时百度spider将优先按照站长的要求进行抓取压力控制。

    对同一个站点的抓取(qu)速度控制一般分为两类:其一,一段时间内(nei)的抓取频率;其二,一段时间内(nei)的抓取流量。同一站点不同的(de)时(shi)间抓取(qu)速度也会不同,例如夜深人静月黑风高时候抓取的可能就会(hui)快一些,也视具体站点类型而定,主要思想是错开正常用户访问(wen)高峰,不断的调整。对(dui)于不同站点,也需要不同的抓取速度。

    2、常用抓取返回码示意

    简单介绍几种百度支持的返回码:

    1)最常见的404代(dai)表“NOT FOUND”,认为网页已经失效,通常将在(zai)库中删除,同时短期内如果spider再次发现这条url也不会抓取;

    2)503代表“Service Unavailable”,认为网页临时不可访问,通(tong)常网站临时关闭,带宽有限等会产生这种(zhong)情(qing)况。对于网页返回503状态码,百度spider不(bu)会把(ba)这条url直(zhi)接删除,同时短期内将(jiang)会(hui)反(fan)复访问几次,如果网页已(yi)恢复,则正常抓取;如果继续返回503,那么这条url仍会被认为是失效链接,从库中删除。

    3)403代表“Forbidden”,认(ren)为网页目前禁止访问。如果(guo)是新url,spider暂时不(bu)抓取(qu),短期内同样会反复访问几次;如(ru)果是已(yi)收录url,不会直接删除,短期内同样反(fan)复访问(wen)几次。如果网页正常访问,则正常抓取;如果仍然禁止访问(wen),那么这条url也(ye)会被认为是失效链接,从库中删除。

    4)301代表是(shi)“Moved Permanently”,认(ren)为网页重定(ding)向至新url。当遇到站点迁移、域名更换、站点(dian)改版的情况时,我们推荐使用301返回码,同时使用(yong)站长平台网站改版工具,以减少改版对网站流量(liang)造成(cheng)的损失。

    3、多种url重定向(xiang)的识别(bie)

    互联网中一部分网页因为各种各样的原因存在url重定向状态,为了对这部分(fen)资源正常抓取,就要求spider对url重定向进行识别判断,同时防止作弊行为。重定向可(ke)分为三类:http 30x重定向(xiang)、meta refresh重(zhong)定向和js重定向(xiang)。另外,百度也(ye)支(zhi)持Canonical标签,在效果上(shang)可以认为也是一种间接的重定向。

    4、抓取(qu)优先级调配

    由于互联网资源规模的(de)巨大以及迅速的变化,对于搜索引擎来说全部抓取到并合理的更(geng)新保持一致性几(ji)乎是不可能的事情,因此这就要(yao)求抓取(qu)系统设计一套合理的抓取优先级调配策略。主要包括:深度优先遍历策略、宽度优先(xian)遍历策略、pr优先策略、反链策略、社(she)会化分享指导策略等等。每个策(ce)略各有优劣,在(zai)实际情况中往往是(shi)多种(zhong)策略结合使用以达到最优的抓取效果。

    5、重复url的(de)过滤

    spider在抓取过程(cheng)中需要(yao)判断一个页面是否已经抓取过了,如(ru)果还没有抓取再进行抓取网页的行为并放在已抓取网址集合中。判断是否已经(jing)抓取其中涉及到最核心的是快速查找并对比,同时涉及到url归一化识别,例如一个url中包含大量无效参数而实际是同一个页面(mian),这将视为同一个(ge)url来对待。

    6、暗网数据的获取

    互联网中存在着(zhe)大量的搜索引擎暂时无法抓取到的数据,被称为暗网数据。一方面,很(hen)多网站的大量数据是存(cun)在于网络数据库中,spider难以采用抓取网页的方式获得完整内容;另一方面,由于网络环境、网站本身不(bu)符合规范、孤岛等(deng)等问题,也会造成搜索引擎无(wu)法抓取。目前来说,对于暗网数据的获取主要思路仍然是通过开放平台采用数据提(ti)交的方式来解决,例如“百度站长平台”“百度开放平台”等等(deng)。

    7、抓取反作弊

    spider在抓取过程中(zhong)往往会遇到所谓抓取黑洞或者面临大量(liang)低质量页面的困扰,这(zhe)就要求抓取系统中同样需要设计一套完善的(de)抓取反作弊系统。例如分析url特征、分析页面大小及(ji)内容、分析站点(dian)规模对应抓取规模等等。

    Baiduspider抓取过程中涉及的网络协议

    刚才提到百度搜索引擎会设计(ji)复杂的抓取策略,其实(shi)搜索引擎与(yu)资源提供者之间存在相互依赖的关系,其中搜索引擎需(xu)要站长为其提供资源,否则搜索引擎就无法满足用(yong)户检索需求;而站长(chang)需要通过搜索引擎将自己的 内(nei)容推广出去获取更多的受众。spider抓取系统(tong)直接涉及(ji)互联网资源提供者的利益,为了使搜素引擎与站长能够达到双赢,在抓取过程中双方必须遵守一定的(de) 规范,以(yi)便于双方的数据处理及对接。这(zhe)种过程中遵守的规范也就是日常中我们所说的一些网络协议。

    以下简单列举:

    http协议:超文本传输协议,是互联(lian)网上应用最为广泛的一种网络协议,客户端和服务器端请求和应答的标准。客户端一般情况是指终端用户,服务器端即指网 站。终端用户通(tong)过浏览器、蜘蛛等向服务器指定端口发送http请求。发送http请求会返回对应的httpheader信息,可以看到包括是否成功、服务 器类型、网页最近更新时间等内容。

    https协议:实际是加密版http,一种更加安全的数据传输协议。

    UA属性(xing):UA即user-agent,是http协议中的一个属性(xing),代表了终端的身份,向服务(wu)器(qi)端表明我(wo)是谁来干嘛,进而服务器端可以根据不同的身份来做出不同的(de)反馈结果。

    robots协议:robots.txt是搜索引擎访问一个网站时要访问的第一个文件,用以来确定哪些是被允许抓取(qu)的哪些(xie)是被禁止抓取的。robots.txt必须放在网站根目录下,且文件名要小写。详细的robots.txt写法可参考 http://www.robotstxt.org 。百度严格按照robots协议执行,另外,同样支持网页内容中添加(jia)的名(ming)为robots的meta标 签,index、follow、nofollow等指令。

    Baiduspider抓取频次原(yuan)则及调整(zheng)方法

    Baiduspider根据上述网站设置的协议对站点页面进(jin)行抓取,但是不可能做到对所有站点一视同仁,会综合考虑站点实际情况确定一个抓取配额,每天定量抓取站点内容,即我们常说的抓取频次。那么百度搜索引擎是根据什么指标来确定对一个网站的抓取(qu)频次的呢,主要指标有四个:

    1,网站更新频率:更新快多(duo)来,更新(xin)慢少来,直接影响Baiduspider的来访频率

    2,网站更新质量:更新频率提高了,仅仅是(shi)吸引了Baiduspier的注意,Baiduspider对(dui)质量(liang)是有严格要求的,如果网站每天更新出的大量内容都被Baiduspider判定为低质页面,依然没有意义。

    3,连通(tong)度:网站应该安全稳定、对Baiduspider保持畅通(tong),经(jing)常给Baiduspider吃闭门羹可不是好事情

    4,站点评价:百度搜索引擎对每个站点都会有(you)一个(ge)评价,且这个评价会根据站点情(qing)况不断变化,是百度搜索引擎对站点的(de)一个(ge)基础(chu)打分(绝非外界所说(shuo)的百度权重(zhong)),是百度内部一个(ge)非常机密的数据。站点评级从不独立使用(yong),会配合其它(ta)因子和阈值一起(qi)共(gong)同影响对网站的抓取和排序。

    抓取频次(ci)间接决定着网站有多少页面有可能被建库收录,如此重要的数值(zhi)如果不符合站长预期该如何调整呢?百度站长平台提供了抓取频次工(gong)具,并已完成多次升级。该工具除了提(ti)供抓取统计数据外,还提供“频次调整”功能(neng),站长根据实际情况向百(bai)度站长平台提出希望Baiduspider增加来访或减少来访的请求,工具会根据站长的(de)意愿和(he)实际情况进行调整。

    造成Baiduspider抓取异常的原因

    有一些(xie)网页,内容优质,用户也可以正常访问,但是(shi)Baiduspider却无法(fa)正常访问并抓取,造成搜索结果覆盖率缺失,对百度搜索引擎对站点都是一种损失,百度把这种情况叫“抓取异常”。对于大量内容无法正常抓取的网站,百度搜索引擎会(hui)认为网站存在用户体验上(shang)的缺陷,并降低对网站的评价,在(zai)抓取、索引、排序上(shang)都会受到一定程度的负面(mian)影响,最终影响(xiang)到网站从百度获取(qu)的流量。

    下面向站长介绍一些常见(jian)的抓取异常原因:

    1,服务器连接异常

    服务器连接异常会有两种情况:一种是站点不稳定,Baiduspider尝试连接您网站的服务器时出现暂时无法连接的情况;一种是Baiduspider一直无法连接上您网站的服务器。

    造(zao)成服务器连接异常的原(yuan)因(yin)通常(chang)是您的网站服务器(qi)过大,超负荷运转。也有可能是您的网站运行(xing)不正常,请检查网站的(de)web服务器(qi)(如apache、iis)是(shi)否安装且正常运(yun)行,并使用(yong)浏览器检查主要页面能否正常访问。您的网站和主机还可能阻止了Baiduspider的访问,您需要检查网站和主机的防火墙。

    2,网络运营商异常:网络运(yun)营商分电信和联通两种,Baiduspider通过电信或网通无法访问您的网站。如果(guo)出现这种情况,您需要与网络服务运营商进行联系,或者购买拥有双线服务的空间或者购买cdn服务。

    3,DNS异常:当Baiduspider无法解析您网站的IP时,会出现DNS异常。可能是您的网站IP地址错误,或者域(yu)名服务商把Baiduspider封禁。请使(shi)用WHOIS或者host查询自己网站IP地址是否正确且可解(jie)析,如果不正确或无法解析,请与域名(ming)注册商联系,更新您的(de)IP地址。

    4,IP封禁:IP封禁为:限制(zhi)网络的出口IP地址,禁止该IP段的使用者进行内容访问,在这里特指封禁了BaiduspiderIP。当您的网站不希望Baiduspider访问(wen)时,才需要该设置,如果您希望Baiduspider访问您的网站,请检查相关设置中是否误添加了BaiduspiderIP。也(ye)有(you)可能是(shi)您网站所(suo)在的空间服务商把百度IP进行(xing)了封禁,这时您需要联系服务商更改设置。

    5,UA封禁:UA即为用户代理(User-Agent),服务器通过UA识别访问者的身份。当网站针对指(zhi)定UA的访问,返回异常页面(如(ru)403,500)或跳转(zhuan)到其(qi)他页面的情况(kuang),即为UA封禁。当您的网站不希望Baiduspider访问时,才需要(yao)该设置,如果您希望Baiduspider访问您的网站,useragent相关的设置中是否有Baiduspider UA,并及时修改。

    6,死链:页面已经无(wu)效,无(wu)法对用户提供任何有价值信息的页面(mian)就(jiu)是死链接,包括协议死链和内容死链两种形式:

    协议死链:页面的TCP协议状态/HTTP协议状态明确表示的死链,常见的如404、403、503状态等。

    内容死链:服务器返回(hui)状态是正常的,但内容已经变更为不存在、已删除或需(xu)要权限等与原内容(rong)无关的信息页面。

    对于死链,我们建议站点使用协议死链,并通过百度站长平台–死链工具向百度提交,以便百度更快地发现死链,减少死链对用户以及搜索引擎造成的负面影响。

    7,异常(chang)跳转(zhuan):将网络请求重新(xin)指向其他位置即为跳转。异常跳转指的是以(yi)下几种(zhong)情况:

    1)当前该页面为(wei)无效页面(内容已删除、死链等),直接跳转到前(qian)一目录或者首页,百度建议站长将该无效页面的入口超链接删除掉

    2)跳转到出错或者无效页面

    注意:对于长时间跳转到其(qi)他域名的(de)情况,如网站更换域名,百度建议使(shi)用(yong)301跳转协议进行设置。

    8,其他异常:

    1)针对百度refer的异常:网页针对来自百度的refer返回不同于正常内容(rong)的(de)行为。

    2)针对百度ua的异常:网页对百度UA返回不同于页面原内容的行为。

    3)JS跳转异常(chang):网页加载(zai)了百度无法识别的JS跳转代(dai)码,使(shi)得(de)用户通过搜索结果进入页面后发生了跳转的情况。

    4)压力过大引起的偶然封禁:百度会根据站点的(de)规模、访问量等信息,自(zi)动(dong)设定一个(ge)合(he)理的抓取压(ya)力。但是在异常情况下,如压力(li)控制失常时,服务器会根据(ju)自身负荷进行保护性的偶然封禁。这种情况下,请在(zai)返回码中返回(hui)503(其含义是“Service Unavailable”),这样Baiduspider会过段时间再来尝试抓取这个链接(jie),如果网站已空闲,则会被成功抓取。

    新链接重要程度判断

    好啦,上面我们说了影响Baiduspider正常抓取的原因,下面就要说说Baiduspider的一些判断原则了。在建(jian)库环节前,Baiduspide会对页面进行初步内容分析和链接分析,通过内容分析决定该网页是否需要建索引库,通过链接(jie)分析发现更多网页,再对更多(duo)网页进行抓取——分析——是否建库&发现新链接的流程。理论(lun)上(shang),Baiduspider会将新(xin)页面上(shang)所有能“看(kan)到”的链接(jie)都抓取(qu)回来,那么面(mian)对众多新链接,Baiduspider根据什么(me)判断哪个更(geng)重要呢?两方面:

    第一,对用户的价值(zhi):

    1,内容独特,百度搜索引擎喜欢unique的(de)内容

    2,主体突出,切不要出现网页主体(ti)内容不突出而被搜索引擎误判为空短页面不抓取

    3,内容丰富

    4,广告适当

    第二,链接重要程度:

    1,目录层级——浅层优先(xian)

    2,链接在站内的受欢迎程度

    百度优先(xian)建重要库的原则

    Baiduspider抓了(le)多少页面(mian)并不是最重要的,重要的是有多少页面被建索引库,即我们常说的“建(jian)库”。众所周知(zhi),搜索引擎的索引库是分层级的,优质的网页会被(bei)分配到重要索引库,普通网页会待在(zai)普通库,再差一些的网页会被分配到低级库去当补充材料。目前60%的(de)检索需求只调用重要(yao)索引库即可满足,这也就解释了为什么有些网站的收录量超高流量却一直不理想。

    那么,哪些网页可以进入优质索引库呢。其实总的原(yuan)则就是一个:对(dui)用户的价值。包括却不仅于:

    1,有时效性且有价值的页面:在这(zhe)里,时效性和价值是并列关系,缺一不可。有(you)些站点为了产生时(shi)效性(xing)内容页面做了大量采集工(gong)作,产生(sheng)了(le)一堆无价值面页,也(ye)是百(bai)度不愿看到的.

    2,内容优质的(de)专题页面:专题页面的内容不一定完全(quan)是(shi)原创的,即可以很好(hao)地把各方内容整合在一起,或者增加一些新鲜的内容,比如(ru)观点和评论,给用户更丰富全面的内容。

    3,高价值原创内(nei)容页面:百度把原创定义为花费一定成本、大量经验(yan)积(ji)累提取后形成的文章。千万不要再问我们伪原创是不是原(yuan)创。

    4,重(zhong)要个人页面(mian):这里仅举一个例子,科比在新浪微博开户了,需要他不经常更新,但对于百度来说(shuo),它仍然是一个极重要的页面。

    哪些网页无(wu)法建入(ru)索引库

    上述优质网页进了索引库,那其实互联网上大部分网站根本没有被百度收录。并非是百度没有发现他们,而是在建库前的(de)筛选环节被过滤掉了。那怎样的(de)网页在最初环节就被过滤掉了呢:

    1, 重复内容的网页:互联网上已有(you)的(de)内容,百度必然没有必要再收录。

    2, 主体内容空短的网页

    1)有些内容使用了百度spider无法解析的技术,如JS、AJAX等(deng),虽然用户访问能看到丰富的内容(rong),依然会被搜索引擎抛弃

    2)加载速度过慢的网页,也有可能被(bei)当作空短页面处理,注意广告加载时间算在网页整体加载时间内。

    3)很多主体不突出的网页即使(shi)被抓取回来也会在这个环节(jie)被抛弃。

    上一篇:高端定制网站设计_设计网站最新作品_2
    下一篇:
    鲜花网上接单最大的免费平台_鲜花网络营销整个流程

    相关文章

    • 黄石市建设工程信息网_黄石网站建设要素_2
    • 快手小黄车(快手小黄车开启多元化运营,挂上你想卖的东西)
    • 快手小黄车自动秒抢商品的方法是什么?操作步骤有哪些?
    • 快手小店退款升级功能全解析(了解快手小店不退货退款升级功能,让你省心省力购物)
    • 高端网站定制开发_网站定制设计流程
    • 快手小店退款流程不顺畅怎么办?如何解决退款问题?
    • 快手小黄车和快手小店,如何选择(解析两种模式的优缺点)
    • 快手小店销量真实吗(揭开快手小店销量的真相)
    • 黄冈网站推广软件_黄石做网络推广哪家好些
    • 快手小黄车如何退货(退货流程、退款方式、注意事项)

    友情链接:

    • 龙岩木振网络科技有限公司
    • 绥化界聚网络科技有限公司
    • 卫辉欧巨网络科技有限公司
    • 舞钢万银网络科技有限公司
    • 本溪启欣网络科技有限公司
    • 长乐傲迎网络科技有限公司
    • 邛崃速川网络科技有限公司
    公司简介|产品展示|新闻动态|成功案例|客户服务|人才招聘|联系我们

    Copyright © 2026 Powered by 华全通石业有限公司   sitemap

    0.269s , 49823.0859375 kb