
地 址:上海市奉贤66号
电 话:18933593942
网址:www.lbwcode.com
网站建设初期,依据(ju)页面数量有限,征的止损团队(dui)人数有限,及时机制网站各类页面元素变动不大。依据但到了网站建设中期,征的止损网站需求方需求变多,及时机制网站更改相比于之前(qian)更(geng)加频繁,依据XX部门提的征的止损XX需求可能会影响SEO流量,若未及时发现,及时机制时间拉长,依据可能造成(cheng)较为严重,征的止损甚至不可逆转的及时机制后果。这个锅,依据谁来背呢?征的止损
这(zhe)点可以通过完善需(xu)求上线流程来解决(jue)一部分,比如:任何涉及页面变动的及时(shi)机制需求(新增(zeng)页面 & 已有页面元素更(geng)改(gai))在(zai)提交RD前,需求评审阶段均需(xu)要SEO部门介入,确认该需(xu)求对SEO渠道(dao)的用户拉新无影响后,在正式(shi)提交RD。

尴尬的是,有相当比例的公司,SEO因为历史效果种种不可(ke)控,或(huo)者 SEO并非用户拉新的主要渠道(dao),SEO较(jiao)难搞定在PM和RD面前(qian)话语权的问题,他们可能不怎么(me)care,老忘记评审的时候叫上SEO一起(qi)玩耍。这种情况需要具有八卦特(te)征的SEO,没事跟RD、PM扯扯皮,问问最近上了什么新需求…

但是,即便在流程上(shang)能够搞定,也是(shi)会(hui)出(chu)现页面元素的(de)改动,却未及(ji)时通知到SEO的情况,比(bi)如新入职的产品提需求,不知道有这个(ge)流(liu)程。

此外,由于SEO部门人(ren)事变动,出现老员工离职、新员工(gong)入职的(de)情况。新入职的SEO不能快速了解网站历史背景,老员工与新员工交接,很多细节会遗漏,导(dao)致新入职的SEO,日后会踩到本可(ke)避免的一些坑。
一些基层SEO针对爬虫日志,也没有足够的分析能力,或者需要(yao)每天手动拿软件或shell等分析一次数据,然(ran)后在执行的SEO动作,操作复杂且效率低下。
为解决以上两点问题,需要有一套“及时止损机制”,用于及时发现潜在风险,并提高日常(chang)SEO效率。
我把“及时止损机制”分为两部分:“爬虫日志监控”和“页面(mian)特征监控”
爬虫日志监控
上(shang)图为“爬虫日志(zhi)监控模块”的逻辑,分“检查字段”、“触发条件”、“执行动作”三个(ge)步(bu)骤。以下是(shi)几点可能需要说明的:
爬虫IP的黑白名单
根据UA为baiduspider的爬虫,检测IP是否为真实的Baiduspider,若为假spider,则加入黑名(ming)单,若为真spider,则加入baiduspider的白名单。
其他主流(liu)搜索引擎,则将出现的ip统统加到对(dui)应的(de)白名单,后期根据(ju)ip段进行排除。
收集白名单IP,可作为日后SEO之用(yong),比如(ru)某个SEO的小需求产品不让上,SEO退而(er)求其次,只针对白名单的IP显示该元素,对正(zheng)常(chang)用户访问不显示等。
提前整理站内已知(zhi)页面
提前统计站内所有URL类型,并整理对应URL类型的正则表达式,这些正则均是统计站内已知(zhi)页面的爬虫情况。
因为大部分SEO包括产品经理,可能都不清除站内到底有多少套URL,所以也有(you)必要通(tong)过日志,找到未知的URL,并进行相应的SEO动(dong)作。
为啥要统计“$body_bytes_sent(发给来访者的(de)文件大小)”这个字段呢?
因为之前经历过几次类似情况:某类页面流量逐减少,经(jing)排查爬虫日志,360Spider访问部分该页面,返回的(de)文件大(da)小为54k,并(bing)不是该页面html文件的正常大小,询问技术,发现不久上线的新反爬虫策略,未把360Spider加入(ru)白名单,导致触发反爬虫策略,返回空白页面。
页面特征监控
针对模板监控页面,是因(yin)为网站可能存在一套URL有N套模板的情况,其他需求方可能只更改了其中一个模板。