不会Python的这几个库,我都不敢说会爬虫,快进来看看吧

网络爬虫——python爬取豆瓣评论 网络爬虫,又被称为网络蜘蛛(Web Spider)、网络机器人等。它根据网页地址(URL)爬取网页内容,网页地址(URL)就是我们在浏览器中输入的网站链接。例如:https://www.baidu.com;网络爬虫仅能够复制网页信息和下载音视频,还可以做到网站的模拟登录和行为链执行。由于需要爬取的网站大多需要先登录才能正常访问,或者需要登录后的cookie值才能继续爬取,所以需要对网站模拟登录。有些网站设置了Referer防盗链,所以需要执行网页浏览行为链。 阅读详情

很多朋友不知道Python爬虫怎么入门,怎么学习,到底要学习哪些内容。今天我来给大家说说学习爬虫,我们必须掌握的一些第三方库。

废话不多说,直接上干货。

请求库

1. requests

GitHub:https://github.com/psf/requests

requests库应该是现在做爬虫最火最实用的库了,非常的人性化。有关于它的使用我之前也写过一篇文章 一起看看Python之Requests库 ,大家可以去看一下。

有关于requests最详细的使用方法,大家可以参考官方文档:https://requests.readthedocs.io/en/master/

小案例

>>> import requests
>>> r = requests.get('https://api.github.com/user', auth=('user', 'pass'))
>>> r.status_code
200
>>> r.headers['content-type']
'application/json; charset=utf8'
>>> r.encoding
'utf-8'
>>> r.text
u'{"type":"User"...'
>>> r.json()
{u'disk_usage': 368627, u'private_gists': 484, ...}
复制代码

2.urllib3

GitHub:https://github.com/urllib3/urllib3

urllib3是一个非常强大的http请求库,提供一系列的操作URL的功能。

有关于它的详细使用方法可以参考:https://urllib3.readthedocs.io/en/latest/

使用小案例:

>>> import urllib3
>>> http = urllib3.PoolManager()
>>> r = http.request('GET', 'http://httpbin.org/robots.txt')
>>> r.status
200
>>> r.data
'User-agent: *\nDisallow: /deny\n'
复制代码

3.selenium

GitHub:https://github.com/SeleniumHQ/selenium

自动化测试工具。一个调用浏览器的 driver,通过这个库你可以直接调用浏览器完成某些操作,比如输入验证码。

对于这个库并非只是Python才能用,像JAVA、Python、C#等都能够使用selenium这个库

有关于Python语言如何去使用这个库,大家可以去访问https://seleniumhq.github.io/selenium/docs/api/py/ 查看官方文档

使用小案例:

from selenium import webdriver

browser = webdriver.Firefox()
browser.get('http://seleniumhq.org/')
复制代码

4.aiohttp

GitHub:https://github.com/aio-libs/aiohttp

基于 asyncio 实现的 HTTP 框架。异步操作借助于 async/await 关键字,使用异步库进行数据抓取,可以大大提高效率。

这个属于进阶爬虫时候必须掌握的异步库。有关于aiohttp的详细操作,可以去官方文档:https://aiohttp.readthedocs.io/en/stable/

使用小案例:

import aiohttp
import asyncio

async def fetch(session, url):
    async with session.get(url) as response:
        return await response.text()

async def main():
    async with aiohttp.ClientSession() as session:
        html = await fetch(session, 'http://python.org')
        print(html)

if __name__ == '__main__':
    loop = asyncio.get_event_loop()
    loop.run_until_complete(main())
复制代码

解析库

1、beautifulsoup

官方文档:https://www.crummy.com/software/BeautifulSoup/

html 和 XML 的解析,从网页中提取信息,同时拥有强大的API和多样解析方式。一个我经常使用的解析库,对于html的解析是非常的好用。对于写爬虫的人来说这也是必须掌握的库。

2、lxml

GitHub:https://github.com/lxml/lxml

支持HTML和XML的解析,支持XPath解析方式,而且解析效率非常高。

3、pyquery

GitHub:https://github.com/gawel/pyquery

jQuery 的 Python 实现,能够以 jQuery 的语法来操作解析 HTML 文档,易用性和解析速度都很好。

数据存储

1、pymysql

GitHub:https://github.com/PyMySQL/PyMySQL

官方文档:https://pymysql.readthedocs.io/en/latest/

一个纯 Python 实现的 MySQL 客户端操作库。非常的实用、非常的简单。

2、pymongo

GitHub:https://github.com/mongodb/mongo-python-driver

官方文档:https://api.mongodb.com/python/

顾名思义,一个用于直接连接 mongodb 数据库进行查询操作的库。

3、redisdump

redis-dump是将redis和json互转的工具;redis-dump是基于ruby开发,需要ruby环境,而且新版本的redis-dump要求2.2.2以上的ruby版本,centos中yum只能安装2.0版本的ruby。需要先安装ruby的管理工具rvm安装高版本的ruby;

 

最后多说一句,小编是一名python开发工程师,这里有我自己整理了一套最新的python系统学习教程。想要这些资料的可以进裙930900780领取。

本文章素材来源于网络,如有侵权请联系删除。

Python 网络爬虫进阶教学全指南 本次博客将深入探究 Python 网络爬虫的核心知识与实用技巧,引领大家从入门迈向精通 阅读详情

相关推荐

什么是网络爬虫

又称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者,是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。网络爬虫可以根据指定的规则,从互联网上下载网页、图片、视频等内容,并抽取其中的有用信息进行处理。网络爬虫的工作流程包括获取网页源代码、解析网页内容、存储数据等步骤。根据其目的和工作方式的同,网络爬虫可以分为多种类型。常见的网络爬虫包括通用爬虫、聚焦爬虫、增量式爬虫等。

2301_79903190的博客 2436

Python爬虫常用的,这些你都用过吗?

这些Python爬虫的有力工具,可以根据你的需求选择和组合使用它们。无论你是想进行简单的网页内容提取还是构建复杂的网络爬虫,这些都能满足你的需求。注意,在进行爬虫活动时,一定要遵守网站的使用政策和法律法规,以确保合法合规。

涛哥聊Python 1763

Python 网络爬虫入门全知道

Python 网络爬虫入门全知道

安年的小小博客有大大的梦想 2717

Python爬虫常用哪些

经常游弋在互联网爬虫行业的程序员来说,如何快速的实现程序自动化,高效化都是自身技术的一种沉淀的结果,那么使用Python爬虫都会需要那些数据支持?下文就是有关于我经常使用的的一些见解。1、urllib:urllibPython3自带的Python2有urllib和urllib2,到了Python3统一为urllib),这个爬虫里最简单的。2、requests:requests属于第三方,使用起来比urllib要简单少,且功能更加强大,是最常用的请求

WANGJUNAIJIAO的博客 2218

6个强大且流行的Python爬虫,强烈推荐!

Python中有非常多用于网络数据采集的,功能非常强大,有的用于抓取网页,有的用于解析网页,这里介绍6个最常用的

分享Python、数据分析、人工智能前沿知识 4716

Python爬虫】你还在纠结选择哪个爬虫嘛,全都拿来吧你

requests——最普遍使用的爬虫 you_get——最受欢迎的爬虫 autoscraper——最智能的爬虫 urllib——最底层的爬虫

user_from_future的博客 1万+

Python 网络爬虫的常用汇总(建议收藏)

Python 在编写网络爬虫常常用到的一些Python爬虫网络主要包括:urllib、requests、lxml、fake-useragent、bs4(BeautifulSoup)、grab、pycurl、urllib3、httplib2、RoboBrowser 、MechanicalSoup、mechanize、socket、Unirest for Python、hyper、PySocks、treq、aiohttp等。爬虫框架Web 框架Re介绍:正则表达式的表示类型:raw string类型(

大模型研究中心 1万+

网络爬虫是什么?怎么学python爬虫

网络爬虫又称网络蜘蛛、网络机器人,它是一种按照一定的规则自动浏览、检索网页信息的程序或者脚本。网络爬虫能够自动请求网页,并将所需要的数据抓取下来。通过对抓取的数据进行处理,从而提取出有价值的信息。

Itmastergo的博客 3万+

不会几个,都敢说我会Python爬虫

一、 请求 1. requests GitHub:https://github.com/psf/requests requests应该是现在做爬虫最火最实用的了,非常的人性化。有关于它的使用我之前也写过一篇文章一起看看Python之Requests,大家可以去看一下。 有关于requests最详细的使用方法,大家可以参考官方文档:https://requests.read...

一定要站在自己热爱的生活里闪闪发光 3万+

Python-网络爬虫

网络爬虫(Web Spider)又称网络蜘蛛或网络机器人,是一段用来实现自动采集网站数据的程序。网络爬虫仅能够为搜索引擎采集网络信息,而且还可以作为定向信息采集器,定向采集某些网站中的特定信息。对于定向信息的爬取,网络爬虫主要采取数据抓取、数据解析、数据入的操作流程。(1)数据抓取:发送构造的HTTP请求,获得包含所需数据的HTTP响应;(2)数据解析:对HTTP响应的原始数据进行分析、清洗,以提取出所需要的数据;(3)数据入:将数据进一步保存到数据(或文本文件)中,用于构建知识

qq_42759120的博客 1663

Python 网络爬虫入门与实战

网络爬虫(Web Crawler)是自动访问网络并提取信息的程序。它可以模拟人类用户在浏览器中的行为,访问网页、抓取数据并存储到本地或数据中。网络爬虫在信息检索、数据挖掘、搜索引擎等领域有广泛应用。Scrapy 是一个强大的爬虫框架,支持异步处理和数据存储。它适合大型爬虫项目,可以高效抓取和解析数据。yield item通过本文的学习,您应该对 Python 网络爬虫有了全面的了解。从基础的 Requests 到高级的 Scrapy 框架,再到实战案例,涵盖了网络爬虫的方方面面。

985工科博士毕业,专攻定位、导航和滤波等算法研究。从业10年,主要使用MATLAB 2171

小白学Python,网络爬虫篇(1)——requests

网络爬虫通俗来讲就是使用代码将 HTML 网页的内容下载到本地的过程。爬取网页主要是为了获取网页中的关键信息,例如网页中的数据、图片、视频等。Python 语言中提供了多个具有爬虫功能的,下面将具体介绍。urllib :是 Python 自带的标准,无须下载、安装即可直接使用。urllib 中包含大量的爬虫功能,但其代码编写略微复杂。requests :是 Python 的第三方,需要下载、安装之后才能使用。

2201_75607087的博客 3227

Python爬虫有哪些,分别怎么用

以上是一些常用的Python爬虫及其用法,每个都有其独特的特点和优势,选择合适的取决于具体的应用场景和需求。在编写爬虫程序时,还需要注意一些道德和法律规范,以确保我们的爬虫程序不会侵犯他人的隐私和权益。

随便写写 2827

全网最全!Python爬虫requests教程(附案例)

Requests 是一个为人类设计的简单而优雅的 HTTP 。requests 是一个原生的 HTTP ,比 urllib3 更为容易使用。requests 发送原生的 HTTP 1.1 请求,无需手动为 URL 添加查询串, 也需要对 POST 数据进行表单编码。相对于 urllib3 , requests 拥有完全自动化 Keep-alive 和 HTTP 连接池的功能。requests 包含的特性如下。

程序员小麦的博客 3万+

常用Python爬虫汇总,建议收藏留用!

很多人学Python,都是从爬虫开始的,毕竟网上类似的资源很丰富,开源项目也非常多。Python学习网络爬虫主要分3个大的版块:当我们在浏览器中输入一个url后回车,后台会发生什么?简单来说这段过程发生了以下四个步骤:•查找域名对应的IP地址。•向IP对应的服务器发送请求。•服务器响应请求,发回网页内容。•浏览器解析网页内容。

xx16755498979的博客 2695

爬虫的三大

大家好,我是爱吃饼干的小白鼠。大家安装完python的requests,beautifulsoup ,lxml三个,之后,我们就来说说怎么使用吧。然后我教大家一个简单的爬虫程序。

爱吃饼干的小白鼠的博客 6941

Python大全,建议收藏留用!

Python,想必大家都是从爬虫开始的吧。毕竟网上类似的资源很丰富,开源项目也非常多。 Python学习网络爬虫主要分3个大的版块:抓取,分析,存储 当我们在浏览器中输入一个url后回车,后台会发生什么? 简单来说这段过程发生了以下四个步骤: 查找域名对应的IP地址。 向IP对应的服务器发送请求。 服务器响应请求,发回网页内容。 浏览器解析网页内容。 那么学习爬虫需要掌握哪些呢?

m0_59162248的博客 3851
上一篇: 你不能低估的Python数据结构Namedtuple(二)
下一篇: 2020最全Python内置函数大全!赶快收藏起来!
python阿喵
博客等级 码龄6年 169粉丝 127原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值