爬取300本Python书籍,用Python告诉你哪家强?

python爬取豆瓣读书任意标签下的书籍信息 import requests from bs4 import BeautifulSoup for tag in ['%E8%AE%A1%E7%AE%97%E6%9C%BA', '%e5%b0%8f%e8%af%b4', '%e5%a4%96%e5%9b%bd%e6%96%87%e5%ad%a6', '%e6%96%87%e5%ad%a6', '%e9%9a%8f%e7%a... 阅读详情

我们的菜鸟学Python公众号经常会送出一些福利,比如Python书籍。时间长了以后,觉得这么多五花八门的python书籍,究竟那几本书籍才是最好的呢,今天小编就带领大家用Python来探查一番,究竟哪些书籍是比较火的。


01

整体的思路

首先小编先带领大家从京东上爬取各类python的书籍,然后通过分析来评出最好的书籍,针对于最好的书籍,小编再对其进行着重的分析。


02

爬取300本书籍

首先是获取python书籍的相关信息,由于信息的获取需要从商品的详细页面获取,因此小编采用selenium库来模拟页面翻页过程,以此来到达新的页面进行爬取,如下图所示。

(动态图,多看5秒钟)

利用selenium可以自动的控制浏览器,并抓取我们需要的信息,部分程序如下图所示。

上述程序中,selenium控制浏览器滑到“下一页”的地方,然后模拟翻页动作,将每个页面中的全部60个商品加载显示出来,然后再利用pyquery来解析页面源码,获取我们需要的信息。


03

数据的分析处理

这里小编爬取了近300部python书籍的信息,这些信息包含了书的名称、价格、总评论数、好评数量、中评数量、差评数量和好评率。如下图所示。

有了书籍的信息后,接下来就是对书籍进行评分,看一下究竟哪些python书籍是最火的。

1).先是数据的预处理,由于爬取到的信息绝大多数是字符串类型,所以需要先将其转化为数字,然后才能进行接下来的处理,数据预处理的部分程序如下所示。

上述程序中,首先是将数据中的无关字符去除,然后进行单位的转化,最后是将字符串转化为数字。

2).数据进行归一化的处理,以避免不同数量级的特征带来干扰,例如好评数量都是几万的,但是好评率却仅仅是不到1的小数,这显然会对评判造成影响。数据归一化后,我们按照下图的公式得到了最终的评分,如下图所示。

评分是这样的,小编采用总的评论数量占60%的比重,而好评率占20%的比重,差评的数量占10%的比重,而价格占了10%的比重,这样组合起来成为了100%

由上图我们也可以看出,《笨办法学python3》成为了最好的python图书,而这本书我们也曾经送出过。当然上述的计算公式只是按照小编的个人喜好来的,如果大家觉得公式不是很合理,大家可以自己编辑公式进行打分,全凭个人喜好。


04

书籍的评论分析

接下来小编对于《笨办法学python3》和《python编程 从入门到实践》这两本书的评论进行了爬取,爬取的部分程序如下图所示。

上述程序中不同的请求url只是页面数值的变化,只需要不停的循环页面,然后对返回的json数据解析,便可以得到需要的数据。

下图是对于这两本书的评论数量的分析,如下图所示。

由图可以看出,两本书的好评数量高达99.48%,这与我们爬取到的好评率相一致。最后是对于爬取到的评论进行词云的展示,如下图所示。

《“笨办法”学python》词云

《python编程,从入门到实践》


通过上图可以看出,大家对于这些书的普遍印象都是很不错的,大家都比较认可这两本书。不知道你心目中的Python神书是那一本,欢迎留言吱一声!

近期热门:

还在做重复的劳动,不如用Python自动生成Excel以邮件发送

独家秘籍,50行代码教你买哪只黄金股

点击阅读原文,原创400篇干货文章

豆瓣读书top250数据爬取与可视化 爬虫–scrapy 题目:根据豆瓣读书top250,根据出版社对书籍数量分类,绘制饼图 搭建环境 import scrapy import numpy as np import pandas as pd import matplotlib.pyplot as plt 加载scrapy框架 #terminal 终端实现 cd .. # 跳转到上一层目录 scrapy startproject booktop # 和项目同名的scrapy框架项目 setting配置 ROBOTSTXT_OBEY = F 阅读详情

相关推荐

Python爬取上交所一年大盘数据(1)

这是我花了几天的时间去把Python所有方向的技术点做的整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。基本上主流的和经典的都有,这里我就不放图了,版权问题,个人看看是没有问题的。

2401_83977530的博客 1591

分享300Python各类电子书,还不快保存起来!

8.8智慧生活日? 今天微信可谓是大手笔,各种支付摇一摇免单。中午吃饭付钱后看怎么出现个好久不见的摇一摇界面,点进去就瞬间膨胀了。 微信免单 感觉最近运气有些好啊...兴高采烈的发了个朋友圈,结果才知道今天微信放大招好友们各种免单,你们是否摇到免单了呢?哈哈... 雨露均沾 最近感觉运气有些好,今天下班回来,收到了华为云社区博客活动的奖品,雷蛇机械键盘,剩下的书和小...

清风Python 1060

用例设计:滴滴打车从轿车到完成支付如何测?

滴滴打车全流程测试用例设计从业务场景覆盖、功能逻辑分解、异常流验证三个维度展开,系统化地构建了测试方案。首先,业务流主干场景被分解为叫车、行程中、支付结算三个阶段,每个阶段都设计了核心测试用例,包括正向和异常用例,如定位准确性、车型选择逻辑、路径偏移监控、费用实时计算、多支付方式兼容等。专项测试补充了状态机验证、资损防控测试和性能测试,确保系统在不同情况下的稳定性和安全性。测试数据策略采用等价类划分设计,实战技巧包括流量回放技术、混沌工程注入和计费沙盒验证,以提高测试的覆盖率和准确性。最终输出交付物包括流程

海姐软件测试的博客 1472

关于Python爬虫,看这8本书就够了

关于爬虫,应该没有人不知道了吧,其抓取速度快和数据质量优的两大特点而受到越来越多的人追捧,互联网时代,有爬虫技术的加持对于职场人来说无疑是锦上添花。随着爬虫技术的流行,网上的资源层出不穷,但对于初学者来说,可能难以选择,如果选错还会在爬虫学习上走一些弯路。老DC专门为想学习了解Python爬虫的同学汇总了一份书单,大家可以先保存~其实学习爬虫不需要一大堆书单和教程,看这8本书就够了。豆瓣评分:9.1本书是一本针对所有层次的Python 读者而作的Python 入门书。

weixin_67991858的博客 1979

有关Python爬虫,看这几本书就够了!

网页抓取就是从网站中提取数据,因为有很多网站,已经有很多开发工具可以用来浏览网站(web爬行)寻找特定的数据片段并自动收集它们(web抓取)。收集到的数据大多是非结构化的HTML形式,之后再将其转化为结构化数据,例如电子表格或者某种形式的数据库,以便能够对这些数据加以利用。这些信息对于那些希望了解趋势的公司或寻找他们感兴趣的特定信息的组织来说是非常宝贵的。

lyy2017175913的博客 1449

学习Python爬虫,必不可少的8本书

关于爬虫,应该没有人不知道了吧,其抓取速度快和数据质量优的两大特点而受到越来越多的人追捧,互联网时代,有爬虫技术的加持对于职场人来说无疑是锦上添花。

DEVELOPERAA的博客 3693

Python网络爬虫经典书籍推荐

1. Python编程:从入门到实践 - 2016 本书是一本针对所有层次的Python 读者而作的Python 入门书。全书分两部分:第一部分介绍用Python 编程所必须了解的基本概念,包括matplotlib、NumPy 和Pygal 等大的Python 库和工具介绍,以及列表、字典、if 语句、类、文件与异常、代码测试等内容;第二部分将理论付诸实践,讲解如何开发三个项目,包括简单的Python 2D 游戏开发如何利用数据生成交互式的信息图,以及创建和定制简单的Web 应用,并帮读者解决常..

铃响了铎 8209

python书籍_爬取300Python书籍,用Python告诉哪家

我们的菜鸟学Python公众号经常会送出一些福利,比如Python书籍。时间长了以后,觉得这么多五花八门的python书籍,究竟那几本书籍才是最好的呢,今天小编就带领大家用Python来探查一番,究竟哪些书籍是比较火的。01整体的思路首先小编先带领大家从京东上爬取各类python书籍,然后通过分析来评出最好的书籍,针对于最好的书籍,小编再对其进行着重的分析。02爬取300书籍首先是获...

weixin_39548541的博客 105

python书籍_近300Python书籍到底哪家,用Python告诉

我们的菜鸟学Python公众号经常会送出一些福利,比如Python书籍。时间长了以后,觉得这么多五花八门的python书籍,究竟那几本书籍才是最好的呢,今天小编就带领大家用Python来探查一番,究竟哪些书籍是比较火的。01整体的思路首先小编先带领大家从京东上爬取各类python书籍,然后通过分析来评出最好的书籍,针对于最好的书籍,小编再对其进行着重的分析。02爬取300书籍首先是获...

weixin_39622225的博客 130

自学python书籍逐级推荐-近300Python书籍到底哪家,用Python告诉

爬取300书籍首先是获取python书籍的相关信息,由于信息的获取需要从商品的详细页面获取,因此小编采用selenium库来模拟页面翻页过程,以此来到达新的页面进行爬取,如下图所示。(动态图,多看5秒钟)利用selenium可以自动的控制浏览器,并抓取我们需要的信息,部分程序如下图所示。上述程序中,selenium控制浏览器滑到“下一页”的地方,然后模拟翻页动作,将每个页面中的全部60个商品加载...

weixin_37988176的博客 206

python爬虫-爬取当当网书籍信息存到Excel中

文章目录一、任务二、分析(一)、单页面的信息分析源代码分析目标信息定位与分析代码设计(二)、所有目标页面链接分析目标链接分析代码设计三、注意要点四、完整代码五、参考 一、任务 获取当当网上至少300本书【均为某类书,如python相关的书籍,或概率论相关的书籍】的信息,包括书名,网址,价格,作者,并存在excel表格中。 二、分析 (一)、单页面的信息分析 源代码分析 在当当网的搜索框输入“pyt...

kakazai.cn 6990

Scarpy爬取当当网书籍

1:Scarpy (1) Scrapy是什么: Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架。 可以应用在包括数据挖掘,信息处理 或存储历史数据等一系列的程序中。 (2)安装scrapy: pip install scrapy 2.scrapy项目的创建以及运行 1.创建scrapy项目: 终端输入 scrapy startproje...

m0_57126456的博客 509

selenium爬取300条京东懒加载的商品信息

selenium爬取京东懒加载的商品信息1.页面分析2.滑动滚动条获取完整页面源码3.解析源码获取标签内容4.保存信息至数据库5.运行结果 1.页面分析 首先给出要爬取数据的url: 京东 进入页面后,显示在界面上的图片已经加载完成,但是没有显示在屏幕上的内容,是没有加载的,只有当我们拖动界面,才会对相应资源进行请求和加载,我们如果用requests模块直接去请求获取页面源码数据,获取的源码肯定不完整。 这时就可以用selenium模拟浏览器的操作,通过拖动界面模拟人浏览,使浏览器资源加载完成后,再去获取页

向日葵的专属太阳 2700

我用Python爬取800只基金数据,发现……

现在很多同学都尝试过购买基金了,毕竟这是号称最简单的懒人投资方法!然而只要基金定投就一劳永逸了吗?当然不是,有哪个硬汉能忍住定投收益一点一点下跌的心痛感?这不,刚过完年,股市急转直下,众多...

简说Python的博客 820

Python爬取Bilibili上二次元妹子的视频

点击上方“菜鸟学Python”,关注文末干货立马到手作者:Mike_Shine来源:https://urlify.cn/2qyMBb一直想爬取BiliBili的视频,无奈一直没有去研究一...

cainiao_python的博客 388

scrapy案例——当当网的爬取

第二页 http://category.dangdang.com/pg2-cp01.03.41.00.00.00.html。1.使用scrapy爬虫技术爬取当当网中科幻小说的书籍数据,包括(图片、标题、作者和价格)#管道可以有很多个,因此管道有优先级 范围1-1000 值越小优先级越高。项目名称:当当网的爬取一——爬取科幻小说的书籍数据。2.将获取到的数据保存在本地josn文件中。6.将图片下载至本地books文件夹中。3.将图片保存在本地文件夹中。

qq_53256193的博客 871

使用python3.7中的scrapy框架,爬取起点小说

这几天在学习scrapy框架,感觉有所收获,便尝试使用scrapy框架来爬取一些数据,对自己阶段性学习进行一个小小的总结 本次爬取的目标数据是起点中文网中的免费作品部分,如下图: 本次一共爬取了100本小说,并对爬取结果进行以下两种存储; 1.把小说内容分章节写入txt中 2.把小说的内容存入sqlserver中 如下: 实现的逻辑: 1.通过书的列表页获得...

weixin_30693183的博客 705

python爬虫教程-有什么好的python3爬虫入门教程或书籍吗?

Python Web Scraping Cookbook - 2018.pdfhttps://china-testing.github.io/scrap_books.html​china-testing.github.ioPublished: 二 06 十一月 2018 By andrew In ...

q6q6q的专栏 2286

Python |(爬虫 )爬取当当网书籍信息存到Excel中

文献检索作业,小白也很无奈。还好有学霸同学的可以借鉴。 一、任务 获取当当网上至少300本书【均为某类书,如Linux相关的书籍,或C++相关的书籍】的信息,包括书名,网址,价格,作者,并存在excel表格中。 二、分析 (一)、单页面的信息分析 源代码分析 在当当网的搜索框输入“Linux”,出现搜索后的页面,按F12查看源代码。  <li ddt-pit="1" clas...

Sherlock_Homles的专栏 4133

Vue3 - 手机移动端H5网页力解决弹起软键盘后页面被挤压变形或页面整体上移问题,点击input输入框键盘弹出底部被上推往上顶遮挡及各种问题(兼容安卓苹果ios手机,微信公众号网页微信内置浏览器)

vue3,h5网页,input输入框组件,vue3 h5软键盘弹出,vue3输入框,键盘弹起时页面整体上移问题,uni,H5页面,解决软键盘弹起页面被挤压、被往顶的问题,解决vue3输入框,键盘弹起时页面整体上移问题,vue3调用手机系统软键盘,页面窗口被顶起,布局定位失效,解决VUE3软键盘弹起导致页面fixed定位元素被顶上去,输入法软键盘弹起,窗口顶起,变形解决办法,Vue中input组件在IOS设备上弹出软键盘时页面整体上移问题的解决方案,以及input组件聚焦后弹出软键盘固定在,Vue3软键盘把界

🏆 前端领域优质创作者 1万+

基于Excel、Matlab与UG的准双曲面齿轮精确建模研究.pdf

基于Excel、Matlab与UG的准双曲面齿轮精确建模研究.pdf

上一篇: 女程序员做了个梦。。。
下一篇: 程序员的自我救赎,使用Python开发性格分析工具
菜鸟学Python
博客等级 码龄9年 7561粉丝 571原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值