关于爬虫风控的记录

在解决一个反爬过程中,突然有了一点想法

目前大部分网站对爬虫的忍耐度都比较高 可能缺少一个简单好用的反爬策略吧,毕竟爬虫与反爬是一种相互学习相互增长的过程

遇到的是这个网站想要风控的时候(可能随机、可能检测到了什么但不确定)返回一串密文和一串JS,用户使用正常浏览器访问的时候,浏览器会默认的触发JS,该JS会对密文进行解密(注意,密文和JS是混淆过的),然后有一串真正有效的JS生成了 ,其中还会有一些全局变量,这串JS会触发网站对XMLHttpRequest的修改,从而生成一串特殊密文MnEwMD=...................

 

emmmmm  看起来就比较的麻烦,不过总是有办法的。

 

以为我会写怎么解决的过程吗? 不存在的,在查问题的过程中找到一个博文,说的很详细了,不信你们去看:http://www.qingpingshan.com/m/view.php?aid=239312

 

这里重点说一下想法:

1. 反爬虫重点是识别人机,所以有了验证码之类的,不过随着机器识别之类的发展,简单的验证码已经很难阻拦了,所以有了各种各样的验证码,你看:https://007.qq.com/online.html

 

2.还有就是增加一些浏览器可以做,但是非浏览器不能做的事情,比如JS的究极加密,全局环境变量,动态代码,银行安全控件,然而一些自动化软件和仿制浏览器依旧可以搞定

3.其他诸如cookie 、ip 这些也是能通过各种各样的办法解决的

4.从这次解决的问题的过程中,发现一个可能会更加有难度的思路:从网络请求入手  ,其实爬虫 的本质就是模仿请求,打到获取数据的目的,与其重点放在识别爬虫的请求,不如增加返回数据的可识别难度。

 

emmm感觉有点生硬  略过略过。主要是记录下又攻克一个难关(并非用博文里说的办法)

转载于:https://www.cnblogs.com/yishilin/p/10009354.html

Python网络爬虫基础 基础知识讲解部分(网络爬虫入门) 网络爬虫就是自动地从互联网上获取程序。想必你听说过这个词汇,但是又不太了解,大家会觉得掌握网络爬虫还是要花一些功夫的,因此这个门槛让你有点望而却步。我常常觉得计算机和互联网的发明给人类带来了如此大的便利,让人们不用阅读说明书就知道如何上手,但是偏偏编程的道路却又是如此艰辛。因此,我会尽可能做到浅显易懂,希望读者能够读懂我说了什么,从而能够享受到其中的快乐。 基本介... 阅读详情

相关推荐

1.网络爬虫概述

一、爬虫是什么? 二、爬虫可以做什么? 三、爬虫开发中有哪些技术?

qq_40407729的博客 5369

常见的反爬虫 | IP

在反爬虫领域,IP主要是指网站或应用为了防止爬虫行为而实施的一系列措施,这些措施识别并限制或阻止来自特定IP地址的访问。这里主要介绍一些常见的IP策略以及如何应对这些策略。

爬虫进击之路 2251

什么是网络爬虫?有哪些作用?如何构建?

根据We Are Social和Hootsuite的2018年全球数字新报告,全球互联网用户数量刚刚超过40亿,比2017年增长7%。人们正在以前所未有的速度转向互联网,我们在互联网上做的很多行为产生了大量的“用户数据”,比如评论,微博,购买记录等等。这一点也不奇怪,互联网目前是分析市场趋势,监视竞争对手或者获取销售线索的最佳场所,数据采集以及分析能力已成为驱动业务决策的关键技能。而...

Yummy的博客 3316

常见的反爬虫 | 验证码

验证码(CAPTCHA,全称“Completely Automated Public Turing test to tell Computers and Humans Apart”,即“完全自动区分计算机和人类的图灵测试”)作为反爬虫策略的一个重要组成部分,其发展历程紧密地与反爬虫技术的演进相连。最初的验证码相对简单,例如文本验证码,它要求用户输入一组扭曲的字符。然而,随着爬虫技术的进步,这些初级形式的验证码已不能有效阻挡复杂的自动化攻击,从而推动了验证码技术的发展和多样化。

爬虫进击之路 2559

爬虫里我们常说的 ‘’ 到底是个什么东西

以前看无能力大佬总说,我也一直不明白,今天在穿甲兵社区看到了某位大佬的回复,才明白到底什么意思 原话:听起来有点虚,换个方式讲可能清晰一点,你可以粗略地理解为反欺诈的技术手段。互联网领域中广义的欺诈指的是刷单、恶意注册、伪造账户参与活动等等,反欺诈就是反这些;爬虫领域的反欺诈(这里对应你提到的),就是针对爬虫特征设计的一些技术手段。 流程大体是这样的:获取终端(账户信息/IP/网页指纹/安卓指纹/某个设定的值(例如 _sign=ejy092jhi))特征和行为信息(例如请求频次/请求路径

shiguanggege的博客 4787

知识笔记 - 爬虫必须了解的基础知识

总的来看,技术大体分两部分,直接在客户端上检测分析险,又或者是将用户行为信息发送到后端分析险,进而决定是否正常响应。在一些大厂的系统中,一般不会单凭某一种异常行为进行反应,而是通过对多种手段分权重检测,综合应用到险评估中,并且通常还借助AI技术不断提升检测的精准度和效率。特别是在用户行为分析和设备指纹识别方面,AI的应用使得系统具备自动化和精细化的能力。

m0_51159233的博客 2979

网络爬虫【简介】

网络爬虫的简介和浏览器分析工具

2401_88885149的博客 1万+

零基础爬虫入门(一) | 初识网络爬虫

本篇博文主要介绍网络爬虫的基本概念、工作原理以及开发环境。 我们为什么要了解网络爬虫? 因为当今从事科学研究等,需要大量的数据,但是这些数据公开的又非常的少,大量的数据都在大公司的手中。我们这些普通人本身并没有那么多数据,但是我们又需要大量的数据。那么,这时我们就需要用到网络爬虫了。 Chapter01 | 初识网络爬虫一、什么是网络爬虫1、爬虫产生的背景1.1、万维网的高速发展1.2、搜索引...

不温卜火 6673

Python 网络爬虫 全面解析

网络爬虫,也称为网页蜘蛛、网络机器人,是一种按照一定的规则,自动地抓取万维网信息的程序或脚本。它通过模拟浏览器的行为,向目标网站发送 HTTP 请求,获取网页的 HTML 源代码,然后从这些代码中提取出所需的数据,如文本、图片、链接等。

你猜我是谁? 2035

Python之网络爬虫爬虫基本认知、网络爬虫之路)

文章目录一、爬虫基本认知二、爬虫之路初级爬虫工程师中级爬虫工程师高级爬虫工程师 一、爬虫基本认知 1、爬虫的简单定义 网络爬虫,又称为网页蜘蛛、蚂蚁、蠕虫、模拟程序,在FOAF社区中,被称为二王爷追逐者。是一种按照一定的规则,自动抓取万维网信息的程序或者脚本。简单来说,网络爬虫就是使用事先写好的程序去抓取网络上所需要的数据。 2、通用网络爬虫 搜索引擎的第一步就是爬虫,但是搜索引擎中的爬虫是一种广泛获取各种网页信息的程序,除了HTML文件外,搜索引擎通常还会抓取和索引文字为基础的多种文件类型,如TXT,WO

Viewinfinitely的博客 868

爬虫与反爬虫对抗实录:从基础拦截到AI,攻防技术拆解与实战避坑

本文总结了作者在爬虫开发中遇到的反爬技术及应对策略。从基础反爬(IP封禁、User-Agent校验、Cookie验证)到进阶手段(设备指纹、参数加密、行为检测),分析了各反爬机制的原理,并提供了实战代码和避坑建议。作者强调代理池搭建、请求头伪装、会话保持等技巧,同时指出模拟真实设备环境和行为模式的重要性。全文基于实战经验,旨在帮助开发者绕过反爬限制,但强调必须遵守robots协议和合法使用数据。

专注于Python爬虫开发,分享爬虫技巧、项目实战与反爬经验,使用Scrapy、BeautifulSoup等工具,解决数据抓取难题。 2269

网络爬虫技术

网络爬虫又称网络蜘蛛、网络机器人,它是一种按照一定的规则自动浏览、检索网页信息的程序或者脚本。网络爬虫能够自动请求网页,并将所需要的数据抓取下来。通过对抓取的数据进行处理,从而提取出有价值的信息。但要注意:爬虫是一把双刃剑关于爬虫的如何合法使用,应遵守《中华人民共和国网络安全法》

weixin_47000687的博客 2052

爬虫与反爬-B站接口安全的介绍

1、接口反爬背景接口反爬,或者说更广义的接口安全,一直以来都是网站和app绕不开的基础问题。尤其是平台的规模扩大,各种功能性的接口包含的信息量越来越多,这也让各种目的的脚本爬虫有了获利的空间和爬取数据的动力。而对于一个平台而言,爬虫流量不同于正常流量,基本上无法带来正向的效益(除了搜索引擎爬虫尚且有推广平台的效果),它们对平台的危害是多方面的:(1)对平台开发和运维,爬虫大量的恶意请求极大地占用了...

weixin_45583158的博客 6394

爬虫防护技术失效与体系必要性分析】

摘要:传统爬虫防护技术(频率限制、验证码等)因现代攻击技术的演进而失效,当前爬虫已发展为结合AI、分布式架构和浏览器模拟的复杂系统。本文分析传统防护的局限性(静态规则、单一维度),阐述现代攻击技术(分布式IP轮换、API伪装、AI行为模拟),提出构建全面体系的必要性,强调多维防护策略(设备指纹、行为分析、联邦学习)的协同应用,并指出未来发展方向(AI深度融合、边缘计算、无感验证)。不同业务场景需定制化方案,如金融业需多层次安全防护。

wangtd的博客 1598

对抗的方式与防护策略

随着移动互联网的发展,App的防护也逐渐升级,从最早的App端上防护慢慢的到服务端做策略进行对抗,中间衍生很多App防护的方式,比如加固,唯一ID服务,数据分析服务等。大厂有能力可以搭建自己的策略平台,小厂就只能依赖三方机构,或者App端上的检测去实现爬虫的对抗和分析。18年之前的爬虫成本很低,当时的App防护也很少,很多App加个壳就觉得高枕无忧,攻击者进行脱壳,加密算法还原以后可以进行高效率点对点之间的数据请求。但是放眼现在的话,这种方式可能比较落后,只能针对一些没有防护的小公司。

Javachichi的博客 1968

防不胜防的爬虫-业务的必要性分析

所以综合分析来看,要想实现高效率更精准的防护效果,的引擎是一个关键的因素,模型的能力决定了对黑灰产数据的关联分析准确度,另外数据情况也是关键,黑灰产的工具如客户端,IP池可能会用于多种攻击如WAF、DDOS等,如果能做到多维度的统计关联分析,也能提高置信度。

wangtd的博客 890

最新版Akamai几种解决方案-反爬虫逆向破解分析akamai2.0

总之,对于Akamai的解决方案,没有一劳永逸的方法,需要根据实际情况和能力做出最合适的选择。比如,URL中可能会出现“akamaiedge.net”、“akamaihd.net”等Akamai特定的域名。Akamai Technologies 是一家全球内容分发网络(CDN)和云服务提供商,致力于加速客户网站的内容分发,保障网站安全,提高网站的访问速度和可靠性。:通过查询网站的IP地址归属,如果IP归属于Akamai Technologies,那么这个网站很可能使用了Akamai的CDN服务。

mature的博客 6699
上一篇: CompletableFuture基本用法
下一篇: 如何优化tomcat配置(从内存、并发、缓存4个方面)优化
weixin_30838921
博客等级 码龄11年 90粉丝 0原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值